自我进化搜索代理会「共同作弊」,错误共识最高达8.8%

01自我进化搜索代理会「共同作弊」,CrossFit将错误共识占比从最高8.8%降至3.7%

自我进化搜索代理通常由两个组件组成:出题器根据来源文档生成问题和伪标签,求解器负责回答,双方答案是否一致则成为训练奖励。新论文发现,这套闭环可能让两者逐轮认同同一个错误,形成研究者所称的「共同作弊」;论文同时提出CrossFit,通过隔离反馈来源减少错误共识。

研究者用来源证据进行事后审计后发现,随着自我进化轮次增加,内部训练信号虽持续改善,伪标签正确率却可能停滞或下降。这意味着一致性只能证明出题器和求解器给出相同结果,不能证明结果符合原始材料。

在Qwen3.5-4B和9B实验中,标准闭环的错误共识占比分别达到6.1%和8.8%。多样本验证对每个候选额外调用六次标注生成,只把两项比例降至5.7%和7.2%。

CrossFit将来源文档分为A、B两组:A组生成的问题交给仅在B组训练的辅助求解器评分,B组反之,从而避免同源伪标签沿反馈路径被直接复现,主求解器的更新规则则保持不变。该方法把错误共识占比降至3.0%和3.7%,并在七个搜索问答基准上相对标准闭环平均提高8.8分和8.4分。其在其他模型、生产任务和更长训练周期中的效果,以及辅助求解器的完整计算成本,仍未明确。

开发自我训练搜索代理的团队不能只看内部奖励,还需核对反馈监督的来源CrossFit降低了错误标签被循环强化的风险,但引入辅助求解器的成本尚待衡量下一步要看它能否在更多模型和真实任务中保持效果。

02SMART用持续记忆和动态多代理翻译整部剧集,15个字幕方向均取得最佳MQM成绩

长篇字幕翻译不能只处理孤立句子:术语、人物指代和风格要跨越单集乃至整部剧保持一致,还要符合字幕格式。研究团队提出的SMART因此建立剧集级持久记忆,并让动态路由器按场景选择多代理流程。

系统先翻译部分句子,可调用术语核验、字幕约束检查和上下文检索工具。评判—修订循环再根据候选评分和文字批评,更新代理提示与路由策略,无需重训底层模型;完成配置调整后,再翻译剧集其余部分。

论文推出的Subtitle Arena覆盖14种类型、每部2至198集及15个目标地区语言。SMART在全部15个翻译方向取得最佳总体MQM成绩,平均惩罚比最强竞争代理系统低6.9%;在MuSC四个语言对上也取得论文所称最佳模型结果,人评总分为4.50/5。其处理速度、运行成本和真实发行项目中的人工修改量仍未公布。

字幕团队可用剧集级上下文减少术语、指代和风格不一致的风险流程能按任务调整而不必重训底层模型下一步要看真实制作中的速度、成本和人工返修量。

03DyRAD重建动态驾驶雷达场景,RADIal目标恢复率达90.7%,最强基线为26.9%

自动驾驶闭环测试需要合成车辆未实际驶过视角的传感器观测。新方法DyRAD可从记录数据重建动态驾驶场景,并输出完整的距离—方位—多普勒雷达张量。

现有动态场景方法只重建距离—方位张量;能渲染多普勒的方法又假设场景静止。雷达处理还会把单个反射扩散至多个数据格,若将这种传感器效应混入场景几何,视角移动后就会错误渲染。

DyRAD用静态背景反射体和经运动跟踪的动态点反射体表示场景,将物体速度投影至视线方向生成多普勒,并用固定解析点扩散函数模拟雷达信号扩散。场景与传感器效应分开后,同一重建结果可在不重新拟合的情况下切换雷达配置。

研究在RADIal、Boreas及合成基准上测试原路径和偏移视角。RADIal评测中,DyRAD恢复了参考数据已检测物体的90.7%,最强基线为26.9%;这不是总体检测准确率。

自动驾驶团队可生成原轨迹之外的动态雷达观测更换雷达配置时可减少重新拟合成本实际道路安全收益和部署算力仍未知。
04

Barclays计划让多数软件工程师在2027年使用Claude Code 英国银行Barclays正扩大Claude在软件开发、旧系统改造和运营流程中的应用,计划到2026年底覆盖一半开发人员、2027年覆盖多数软件工程师;其Claude知识助手已获逾1.6万名员工采用,全球市场业务每天还用Claude处理约12万封邮件。 anthropic.com

05

Albertsons把Safeway购物流程接入ChatGPT 美国零售商Albertsons推出Safeway在ChatGPT中的购物体验,用户可根据食谱、照片或购物清单选择商品、获取优惠并建立购物车,再前往Safeway结账;公司计划把该能力扩展至Albertsons、Vons和Jewel-Osco等旗下品牌。 openai.com

06

Google DeepMind开源生物序列水印SynthID Bio Google DeepMind发布SynthID Bio,用水印标记AI生成的蛋白质及其他生物设计,帮助DNA合成商验证设计来源并辅助筛查;团队已在Evo 2设计的噬菌体基因组中集成水印,早期细菌培养实验显示这些噬菌体仍具功能。 deepmind.google

07

Mid-Harness用执行前验证把终端agent成功率提高至68.03% Mid-Harness在不更换生成模型和执行框架的情况下,先采样并验证多项候选操作,再选择一项执行。论文称,以TMAX-9B生成操作、GPT-5.6 Sol负责验证时,TerminalBench-Lite的Pass@1从50.00%升至68.03%。 huggingface.co

08

AREX-2用长流程反思训练提升agent迭代能力 AREX-2基于机器学习和算法编程任务合成长流程改进轨迹,训练基于Qwen3.8-27B的agent反复检查并优化方案;论文报告其在MLE-bench Lite获得81.8分,并在BrowseComp、GAIA等研究任务上实现迁移。 huggingface.co

09

小型社交餐饮企业The Den称ChatGPT Work每周节省10至15小时 北美小型企业The Den表示,管理团队使用ChatGPT Work后每周节省10至15小时,申请资助和酒牌所需时间分别减少92%和91%;该案例由OpenAI发布。 openai.com

10

OpenAI平台刊文讨论AI承担重复执行工作的经济价值 Hemanth Asirvatham和Elliott Mokski在OpenAI的新经济主题平台发表独立观点文章,认为科学与技术进步不仅需要原创洞见,也依赖大量协调、管理和执行工作,AI可能主要通过降低这些工作的稀缺性发挥价值。作者注明文章仅代表个人观点,不代表OpenAI。 openai.com