01OpenWAM开放机器人世界—动作模型全栈,6400小时数据训练成果进入真实机器人测试
世界—动作模型从视频生成先验继承环境知识,再用具身经验转成机器人控制信号。现有系统常把生成骨干、视觉表示、架构、信息流、推理和数据绑在一起,单项作用难辨。OpenWAM此次发布模块化研究栈及开放模型,并进入真实机器人测试。
OpenWAM-Infra把上述环节拆成可组合模块,统一训练、推理、部署和评测;团队再以受控实验研究继承何种知识、世界与动作学习如何协同,以及这种协同如何扩展。
实验归纳的关键原则包括:使用高容量生成骨干和紧凑、信息丰富的潜在空间;为动作提供独立容量,建立明确的世界到动作信息流;同步联合去噪。团队还称,具身预训练主要改善分布外泛化,第一视角人类与机器人数据的单阶段联合训练可兼顾世界覆盖和动作落地。
据此构建的OpenWAM-α用约6400小时、5.185亿帧第一视角人类及机器人数据预训练。团队称,它在覆盖五种机器人本体的八项模拟基准中居领先梯队,并登顶真实双臂RoboDojo-Real榜单;但完整真实测试成功率、统计区间及独立复测尚缺。团队开放基础设施代码、评测协议、预训练及后训练权重和数据配方。
02AuK统一语音生成与编辑,开放模型以四步推理换取4.5倍加速
开放语音基础模型AuK把语音生成、内容编辑、增强与分离、副语言特征编辑和声学编辑五类任务纳入同一接口,用户可用自然语言指令和音频上下文控制生成或修改。团队此次同时开放源代码和模型权重。
AuK基于约30.3亿个指令—音频实例训练,形成195万小时有效监督数据。模型由多模态大语言模型提供语义条件,再用联合训练于语音、一般音频和音乐的VAE提供声学条件,随后通过先双流、后单流的整流流Transformer生成音频。
训练先做纯生成预热,再联合预训练生成与编辑;后训练则以人类反馈偏好优化处理开放式编辑,以奖励强化学习改善语音生成。经一致性初始化和任务路由蒸馏后,AuK-Flash无需无分类器引导即可四步推理。团队称其在相同条件下比完整模型快4.5倍;但所用硬件、绝对延迟、完整质量指标和独立评测结果均未披露。
03Uno用扩散并行生成加速自回归模型,团队报告吞吐量最高提升3倍
自回归语言模型逐个生成token,顺序执行限制推理速度。Uno团队提出一种扩散增强模型,并已发布代码和检查点:它保留标准下一token目标训练的自回归权重,同时加入轻量扩散权重,并行提出多个token。
这些扩散权重经额外蒸馏训练,可从零训练或加到开放权重模型上;Ψ-Spec采样器再按自回归分布完成采样。它不同于依赖独立草稿模型的投机解码,也不同于可能牺牲原模型质量的纯扩散模型,但「无损」仍是团队主张。
团队称,Uno在所有受测批量大小下均超过对比的投机解码方法,吞吐量最高为基础模型的3倍;8B版本在其代理工具使用、编码和长上下文评测中超过26B DiffusionGemma和Mercury 2。
目前验证主要集中于8B模型,来源未完整披露硬件、绝对延迟和KV缓存压力,也未覆盖更大模型、MoE或SSM;社区还对框架原创性提出异议。

马萨诸塞州要求大型数据中心匹配100%清洁电力 该州行政令要求峰值需求超过25兆瓦的数据中心自备清洁电力、资助附近新增发电设施或向用户保护基金缴费,并暂停受理相关销售税减免申请。 techcrunch.com
微软承诺不使用师生数据训练AI模型 微软与美国教师联合会等组织达成十项原则,包括限制数据收集、禁止AI陪伴产品,并要求高风险决定接受人工复核;学区可从11月起将条款加入合同。 theverge.com
iPhone 18 Pro新增照片硬件认证模式 Apple称“Reference Image”模式会签署相机传感器捕获的数据,并通过Private Cloud Compute生成可用于核对编辑痕迹的参考图像;相关API也将向第三方开发者开放。 theverge.com
OpenAI任命AI安全研究者Paul Christiano进入基金会董事会 曾参与开发人类反馈强化学习技术的Christiano将加入安全与安保委员会;他表示AI能力快速提升可能带来失控风险,并认为行业目前尚未将风险降至可接受水平。 techcrunch.com
Suno发布首款使用唱片业授权内容训练的音乐模型 Suno称v6采用来自Warner Music Group、BMG和Believe等伙伴的授权内容及用户数据重新训练,提供标准版、实验性v6-wild和免费轻量版v6-mini,并支持通过对话局部修改歌曲。 theverge.com
GPT-5.6 Sol被用于自主执行量子计算实验 OpenAI介绍称,一名MIT研究者使用GPT-5.6 Sol与Codex运行量子计算实验、分析结果并校准量子比特。 openai.com
Apple Health将计算“健康年龄”和身体准备度 改版后的健康应用利用Apple Intelligence整理睡眠、运动、心脏及部分血液指标,生成“Health Age”、准备度评分和个性化建议,计划今年晚些时候先以美国英语推出。 techcrunch.com
Apple用隔离硬件处理环境音频AI功能 Apple称新款Apple Watch的Secure Exclave会在不保存原始录音的情况下识别语音、声音和音乐,操作系统、应用及Apple均无法访问原始音频;跨设备传输和符合条件的文本同步也将加密。 theverge.com
Prime Video用AI让演员口型匹配人工配音 Amazon在德国剧集《Maxton Hall》的英语配音中启用AI与视觉特效结合的口型同步功能,目前覆盖前两季,并计划扩展到更多作品。 theverge.com
Apple用AI和3D打印校准折叠手机铰链 Apple称其首款折叠手机Duo在制造时使用AI为每个铰链匹配最合适的外壳,再通过激光扫描和最多25层定制光聚合物打印修正表面起伏。 techcrunch.com
OECD数据:AI使用方式与学生成绩差异相关 基于91个国家和地区逾76万名15岁学生的数据,PISA报告显示,直接用AI概括指定阅读或起草作业的学生表现相对较差;每周用AI辅助学习且经常评估其输出质量的学生则略优于非使用者。 theverge.com
DriveZero用闭环强化学习摆脱人类驾驶轨迹监督 DriveZero将视觉基础模型与闭环强化学习动作模型结合,论文称其纯摄像头规划器无需人类轨迹监督,并在NAVSIM和HUGSIM自动驾驶基准上取得领先或超越人类驾驶记录的结果。 huggingface.co