纽约32亿美元AI数据中心火灾暴露应急盲区

01纽约32亿美元AI数据中心火灾暴露应急盲区,运营方与消防部门对整改进度说法不一

6月初,纽约州Somerset的Lake Mariner AI数据中心一栋未完工建筑起火。Barker消防局局长Steve Matisz称,消防员面对含有无法识别化学物质的浓重黑烟,却因缺少安全资料而「几乎是摸黑」进入现场。

消防员据报发现,建筑内没有正常工作的警报和灭火系统,三个消防栓无法供水。消防部门依法应取得的安全文件也据称在火灾中烧毁,Matisz对这一说法表示疑惑。来源未说明起火原因及是否有人伤亡,也没有监管机构认定违法。

Lake Mariner建在一座旧煤矿上,是纽约州规模最大的AI数据中心项目之一,投资额32亿美元。TeraWulf拥有并运营园区;Fluidstack将负责运行;Google为Fluidstack的租约付款提供担保并持有未来取得14%股权的认股权证;Anthropic是算力需求方之一。TeraWulf确认,园区运营安全、应急准备以及与当地急救人员协调由其负责。

TeraWulf称,事故复盘后已增设Knox钥匙箱、消防栓和装有安全数据表的应急包。但Matisz在8月中旬表示,钥匙箱项目仍在安排建设;据他所知,消防栓依然无水,且未看到相关施工。此后的消防栓状态仍未得到确认。

当地消防员可能继续承担信息不足和取水失败的现场风险TeraWulf需证明整改措施已经落地,而非停留在计划或自述下一步要看消防设施状态能否获得消防部门或监管机构确认。

02Iris用交替监督训练与实时搜索强化学习,发布两款开源搜索代理方案

Iris团队公布Iris-mini和Iris-pro两款搜索代理及训练方案,规模分别为35B-A3B和397B-A17B,面向需要多步检索的复杂网页任务。团队计划开放模型权重及完整配方,但未说明确切日期。

训练问题由网页超链接反向构造:团队从种子页面及外链建立实体图和多跳链,把非答案实体改写成描述性指代,避免关键词匹配;仅保留参考模型闭卷失败、获得证据后才能答对的问题。生成轨迹经过整条和逐轮过滤后用于SFT,再以实时搜索进行RL;每轮RL中最难且已解决、效率最高的轨迹会回流下一轮SFT,形成「SFT-RL climbing」。

启用上下文管理后,Iris-mini在BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE上得分82.2、84.8、86.9、52.3,Iris-pro为88.6、85.1、92.9、56.4。团队称其在各自参数规模的开源搜索代理中综合最强。评测固定工具集、上下文限制和裁判,并分别测试是否启用上下文管理;结果均来自单个ReAct代理,未使用子代理或测试时验证。

多跳训练数据更难靠表面词匹配取巧轨迹回流让SFT与实时搜索RL形成迭代闭环后续仍需等待权重、完整配方及独立复测。

03Motion-Omni让对话模型同步生成语音与全身动作,响应速度达到实时水平

现有数字人通常先生成完整回答语音,再让动作模型据此生成动作。这种级联方案需要第二次完整推理,语音与动作也无法共同优化。Motion-Omni改用端到端架构,让对话模型边说边生成协调的面部表情、手部及上下半身动作。

其动作生成器直接读取产生语音的共享隐藏状态。实验显示,仅训练动作模块、冻结语音路径会导致动作与音频错位;只有联合调整LLM、语音生成器和动作生成器,才能恢复对齐,同时保留语音对话能力。

训练数据来自可替换的动作教师:团队为音色一致的语音回答生成伪标签,得到422856组质量排序数据,共1402小时。基于Qwen2.5-7B-Instruct的Motion-Omni-Q7,在无参考动作指标上与使用相同音频的教师级联系统相差不到2%,推理速度快5.4倍,实时因子为0.78,词错误率为2.62%。真实部署、长期对话稳定性及跨人物和场景的泛化效果仍未知。

数字人生成语音和动作不再需要两次完整推理,延迟成本下降联合训练可减少动作与说话节奏错位下一步要验证真实硬件和长期对话中的稳定性。
04

OpenAI联合推出乌克兰新闻机构AI支持项目 OpenAI与乌克兰区域出版商协会AIRPPU、世界报业和新闻出版协会WAN-IFRA启动AI项目,帮助乌克兰新闻机构提升创新能力、运营韧性并支持独立新闻工作。 openai.com

05

Voicebox上线语音反馈目录 客户反馈初创公司Voicebox允许消费者扫描二维码或触碰NFC标签后直接留言,系统会自动转写、分析情绪并将结果发送至企业后台。新上线的目录还支持用户随时向特定商家提交语音反馈,未来计划展示公开留言。 wired.com

06

TechCrunch更新AI术语指南 TechCrunch更新持续维护的AI术语表,以通俗语言解释AGI、AI agent、API端点、思维链、编码agent和算力等概念,面向开发者、投资者及普通读者。 techcrunch.com

07

博客作者批评直接用LLM代写公开文章 博客作者认为,LLM生成内容中重复出现的格式和句式会削弱作者本人的声音,也可能让读者怀疑内容真实性;他同时认可LLM在头脑风暴、文本理解和编辑方面的用途。 bcantrill.dtrace.org