AutoGUIWorld绕过真实软件生成轨迹,桌面代理得分升至40.8%

01AutoGUIWorld不运行真实软件生成7.9万条交互样本,微调后桌面代理得分从33.0%升至40.8%

GUI代理需要从交互轨迹中学习软件如何响应点击等操作、保存界面状态并完成多步任务。但扩充这类数据通常意味着安装、配置和运行更多软件,专业应用还会带来额外成本。研究团队提出AutoGUIWorld,尝试绕过真实软件环境生成训练轨迹。

系统先根据操作系统、视觉外观和界面状态的结构化描述,生成初始GUI场景及相应任务。随后,规划器写出每一步原子操作及其预期视觉后果,图像生成器则迭代修改当前截图,产出操作后的下一幅界面,由此串起连续交互过程。

经过动作定位和逐次状态转移的质量过滤,AutoGUIWorld最终得到79,266条带空间标注的步骤级训练样本,覆盖Ubuntu、Windows、macOS和Chrome。来源没有披露生成与过滤这些样本的计算成本,也未说明未经人工检查部分的错误率。

论文称,使用这些合成轨迹微调Qwen3.5-35B-A3B后,模型在真实桌面任务基准OSWorld上的平均得分从33.0%升至40.8%,提高7.8个百分点;在科学任务基准ScienceBoard上的成功率从14.0%升至32.2%,提高18.2个百分点。

实验说明合成轨迹可以改善该模型在两项真实任务测试中的表现,但尚未证明它能取代真实软件环境,或能对测试范围之外的模型与软件取得同样效果。

GUI代理团队可能减少部署大量软件来收集轨迹的成本图像生成器的界面状态错误可能进入训练数据下一步要看计算成本、人工检查错误率及跨模型泛化结果。

02研究发现大模型后训练普遍牺牲重复采样覆盖率,并提出「锐化税」衡量损失

一项研究发现,大模型后训练提高单次成功率、采样效率和一致性时,可能削弱重复尝试寻找少数可行解的能力。研究针对需多轮工具调用和交互的agent任务;配上轻量推理harness的预训练模型也能胜任。

pass@1衡量一次尝试的准确率,pass@K则看多试几次能否至少撞到一条正确路径。基础模型pass@1较低,但测试预算充足时,pass@K常超过后训练版本。作者认为,后训练把任务推向「总能解决」或「从不解决」两端,以覆盖率换取效率和一致性。

研究覆盖四个模型家族的14组模型、三个agent基准,共42种组合,该现象见于多数设置。「锐化税」量化后训练造成的测试时扩展能力损失。按题目难度调节采样温度的PTGS在两个agent环境中比固定温度基线损失更小,既提高单次准确率,也让重复采样解决更多任务。

依赖多次采样的agent系统可能因后训练失去解题覆盖模型评测需同时关注pass@1和pass@KPTGS的额外成本和更广泛效果仍待验证。

03早期一层加入6.5万参数LoRA,Qwen3-8B的24行引用链准确率从15.5%升至99%

研究者用合成任务测试Transformer:模型不输出思维链,只沿「K=苹果、B=K、D=B」这类多行引用直接作答。论文称,13个基础模型通常只能可靠追踪1.4至3.6行,增加预训练循环帮助有限。

团队在Qwen3-8B第14层加入任务专用rank-8 LoRA。这种适配方法仅训练65,537个附加参数,基础权重全部冻结,却把24行引用链的精确准确率从15.5%提高到99%;训练更久的版本可处理50行。

作者称,LoRA并不在token间搬运信息,而是启动冻结中间层的「接力」。切断第14至22层中每行对父行的注意力后,准确率降至随机水平;切断第23至29层则影响很小。分别训练的早层LoRA还让三个标准模型在MuSiQue多跳问答上的精确匹配提高9.4至17.9点,但尚未证明同一LoRA能跨任务复用。

小规模适配可能释放冻结模型已有的长链计算能力效果高度依赖插入层位下一步需验证训练成本及跨任务复用能力。
04

白宫推动科技公司签署AI安全承诺,并将AI改称“Super Intelligence” 白宫召集Meta、Amazon、xAI和Anthropic等公司负责人签署AI安全承诺,特朗普称其具有“道德约束力”;他同时签署行政命令,正式采用“Super Intelligence”这一称呼。 techcrunch.com

05

OpenAI安全员工离职,批评公司安全文化 负责撰写重大产品发布安全报告的David Robinson宣布离职,称OpenAI的文化已经失灵,并主张前沿AI公司应采用类似核电站和繁忙机场的多层安全机制。OpenAI回应称,公司会在必要时暂停训练或推迟模型,并正加强研究环境安全、第三方评估和实时监控。 techcrunch.com

06

AWS停止在数据中心审批中要求政府机构签署保密协议 AWS首席执行官Matt Garman表示,公司已停止在数据中心项目中与政府机构使用保密协议;这一调整正值美国多地因透明度、用水、污染和电价问题考虑限制数据中心建设。 techcrunch.com

07

OpenAI向高价订阅用户推出Dots通用agent平台 Dots可在云端计算机中操作Blender、GIMP等软件,也能通过ChatGPT桌面应用访问用户电脑,目前优先面向包括每月100美元Pro方案在内的最高等级账户。实际测试中,它能完成网站修改和视频处理,但多次被网站安全验证拦截并需要人工接管。 theverge.com

08

Meta开放Muse硬件开发代码,并生产5000台Home Link 开发者可通过Meta开放的SDK,把Muse AI agent接入ESP32、Raspberry Pi、显示器、按钮和传感器。Meta还生产了5000台Muse Home Link,可借助社区技能控制灯具、电视和打印机,计划本月开始发货。 theverge.com

09

Stability AI转向专业音乐工具,获得三大唱片公司投资和授权 Stability AI获得Sony、Warner和Universal参与的7600万美元融资,三家公司同时授权其音乐目录用于训练。公司已发布三款音频模型和AI音乐编辑软件,可从文本生成器乐曲目或片段,后续版本还将支持用哼唱和口技引导生成。 techcrunch.com

10

Capcom计划把RE Engine逐步改造成“AI生成游戏引擎” Capcom程序员Satoshi Ishida表示,公司将逐步把AI整合进游戏开发流程,以缩短大型游戏中的耗时工作。Capcom此前称不会在游戏中使用AI生成素材,目前披露的重点仍是提高开发效率。 theverge.com

11

Microsoft把数据中心“仿生化”方案扩展至欧美20多个地点 Microsoft计划在美国和德国20多个数据中心地点增加原生树木、花园及生态修复项目,并称美国所有新项目都将采用相关方案。公司希望借此减少绿地损失和噪声影响,但其数据中心扩建带来的砍伐与排放增长仍受到当地居民和环保人士质疑。 theverge.com

12

Circuit Breaker Labs用模拟用户测试AI心理安全风险 这家AI安全测试初创公司构建不同年龄、语言和文化背景的模拟用户agent,每天执行数万至数十万次交互,以检查模型能否识别自伤、心理伤害及长期对话中的危险信号。公司目前主要服务AI教练、日记和心理支持等高风险应用。 techcrunch.com

13

GraphForge用真实文件和证据图生成可验证的agent训练任务 GraphForge从真实工作文件构建证据图,并据此同时生成任务要求和评分标准;研究团队还用初次运行与修订agent检查任务能否执行。Qwen3.6-27B在2169条GraphForge轨迹上微调后,GDPVal、Workspace-Bench-Lite和SpreadsheetBench II成绩均有提升。 huggingface.co