01第二位数学家要求OpenAI证明未使用其非公开研究,训练数据透明度争议扩大
数学家Andreas Thom要求OpenAI拿出数据证据,证明他与ChatGPT的非公开交流没有被用于改进模型或影响一项非-sofic群成果。非-sofic群大致指无法由有限结构逼近的无限数学结构;OpenAI公布的成果大量建立在Thom与Gábor Kun的既有工作之上。
OpenAI最初发布成果时没有承认两人的近期贡献,受到数学界批评后修改了说明。Thom又发现,OpenAI对其团队研究技术的掌握异常具体,而这些技术当时并非最明显或最有希望的解法,因此询问公司研究人员:自己与ChatGPT的交流是否进入训练数据,或能被模型推理过程利用。
据Thom描述,他得到的回答只否认相关对话可被直接访问,却没有说明去标识化后的内容是否进入用于改进模型的数据池。OpenAI此前回应另一名数学家Tristan Buckmaster的Navier–Stokes质疑时,也否认求解过程中访问特定用户数据,但承认无法完全排除用户活动产生的去标识化数据曾帮助改进模型。
这一区别使争议从成果署名扩大到训练数据和研究保密:去掉姓名并不等于去掉数学思想。Thom要求OpenAI披露必要的数据集、用户设置和数据使用条款;目前没有证据确认其研究实际进入训练数据或影响成果,OpenAI也未立即回应置评请求。
02GE-Act 2.0把机器人训练数据扩至3万小时,零样本操作成功率最高升至44.1%
GE-Act 2.0是一套从未来状态预测中生成机器人动作的世界—动作模型。研发团队把联合训练数据从300小时扩至3万小时,并直接测试预训练检查点,不针对单项任务微调,以观察操作能力能否随数据规模增长而迁移。
模型以控制导向自编码器压缩并保留动作和指令信息;单步视觉规划器一次生成完整未来状态,逆动力学模型再将其转成动作。两部分先用互补数据分别预训练,联合训练时只采用与记录动作在行为上兼容的预测结果。
测试覆盖20类技能中的100项任务,以及未见过的场景、背景、光照和物体。G1-OP成功率从17.1%升至44.1%,提高27个百分点;G2-90D从13.4%升至31.1%,提高17.7个百分点。增益覆盖19/20和18/20类技能,支持跨任务泛化;G2-90D数据占比不足2%却明显提升,团队据此认为存在跨机器人形态迁移,但平台硬件差异、训练成本及长期部署表现仍未知。
03BeaconKV用「信标查询」压缩长推理缓存,团队报告显存占用最多减少5.8倍
大型推理模型生成长思维链时,键值(KV)缓存会随序列长度线性增长,长轨迹甚至可能超过GPU容量。现有方法常依据近期查询决定保留哪些token,但模型可能突然回看早期解题计划,近期注意力因而无法可靠代表未来需求。
研究者发现,这类回看远距离内容的查询会在嵌入空间聚成少数相似性簇。BeaconKV为每个全局查询簇保留紧凑的「信标查询」,再结合近期查询,预测哪些历史键值对还会被访问;该方法无需保存完整查询历史,也不需要额外训练。
团队在四款开源大型推理模型和多种推理基准上称,BeaconKV总体优于既有方法,在「几乎保持」完整缓存准确率的同时,内存占用最高减少5.8倍,吞吐量提高超过4.3倍。但具体准确率损失,以及两项最高收益是否来自同一配置或生产负载,尚未披露。

OpenAI推出云端Agents API Agents API是一项由Codex harness驱动的托管服务,支持开发者编排工具调用、运行长期会话并构建和发布云端agent。 openai.com
Slack开放聊天内AI应用生成工具Surfaces Slackforce Surfaces可根据自然语言要求,从获准访问的对话和连接应用中收集信息,生成可交互的报告、仪表盘、演示文稿和微型网站。该功能面向所有已启用Slackbot的客户开放,接入实时数据的版本计划于10月上线。 theverge.com
ChatGPT Work加入企业数据agent OpenAI发布Data agent,允许ChatGPT Work用户用自然语言连接公司数据、分析信息并制作交互式仪表盘。 openai.com
OpenAI向美国各级政府减免AI服务费用 OpenAI与美国总务管理局将向符合条件的联邦、州、地方及部落政府提供零许可费、用量费用五折和扩展的网络防御支持。 openai.com
环球音乐与ElevenLabs开发授权音乐AI平台 环球音乐集团与语音及音乐生成公司ElevenLabs达成多年许可协议,将允许用户利用获授权曲库制作混音和歌曲改编;艺人可自行选择是否参与。该平台将与ElevenLabs现有Music API和ElevenMusic生成器分开运营。 theverge.com
英伟达预计下一财年收入增长70% CEO黄仁勋重申英伟达下一财年收入可能同比增长70%;按分析师预计的本财年约4000亿美元收入计算,下一财年约为6800亿美元。他还称,一套整合36颗Grace CPU和72颗Blackwell GPU的系统目前订单销售额环比增长27%。 techcrunch.com
OpenAI在API中推出GPT‑Live‑1语音模型 GPT‑Live‑1支持全双工语音对话,并强化指令遵循、自定义声音和电话系统接入能力,供开发者构建实时语音应用。 openai.com
DeepSeek发布V4.1架构家族的小型模型 DeepSeek发布DeepSeek‑V4.1‑Flash,称这是其新架构家族中最小的模型,具备原生视觉理解能力,并面向更快推理和更高吞吐量设计。 twitter.com
前DeepMind研究员Danijar Hafner创办机器人公司 长期研究世界模型的Danijar Hafner于2025年秋离开Google DeepMind,成立一家仍处于隐身阶段的创业公司,尝试让机器人借助基于模型的强化学习应对训练中未见过的环境和意外情况。 technologyreview.com
研究团队用Codex和ChatGPT筛选抗菌分子 宾夕法尼亚大学研究员César de la Fuente的实验室使用Codex和ChatGPT搜索现存及已灭绝生物的基因组,寻找可用于对抗耐药性感染的抗菌候选分子。 openai.com
Show-Harness用统一语义接口连接视觉语言模型与机器人 Show-Harness把视觉语言模型生成的离散语义动作交给适配不同机器人本体的模块执行;论文团队称,该方案支持前沿闭源模型零样本控制机器人,也能以数小时GPU微调成本适配小型开源模型。 huggingface.co