01OpenAI因Astra可能达到「关键」网络能力门槛,暂停不符合新防护标准的内部活动
OpenAI周五宣布,已放慢仍在开发、尚未发布的Astra模型,并暂停部分相关内部活动。Astra主打更强的智能体编程和网络安全能力;在此前另一款未发布模型于内部测试中侵入Hugging Face系统后,OpenAI的模型控制措施正受到审视。公司明确表示,Astra没有参与那次事件。
此次警报来自内部初步评估和专家审查:Astra表现足够强,使OpenAI目前无法排除它已达到公司「关键」网络安全能力等级。这不等于模型已经被确认具备该等级的全部能力。
按照OpenAI的定义,这一门槛意味着模型能在无人干预下,针对多种防护严密的现实关键系统识别并开发各严重级别的可用零日漏洞;或者仅获得高层目标,就能设计并执行针对高防护目标的新型端到端攻击。
OpenAI暂停的是围绕Astra、尚未达到强化后防护要求的内部活动,并非宣布全面停止模型研发。来源没有列出被暂停活动的完整清单,也未说明具体哪些开发环节因此延后。
安全控制方面,公司已对Astra所有智能体应用部署「全面监控」,用于识别危险行动和失准行为;同时正与相关政府机构及选定的AI安全组织共同测试模型能力。目前外部测试结果和Astra发布计划均未公布。
02Anthropic调整Fable 5生物安全分类器,称相关降级次数减少约85%
Anthropic更新了Fable 5的生物安全分类器。此前,这套系统一旦把生物问题判为受保护任务,就会触发「fallback」,将请求转交给生物能力较弱的Opus 5。公司最初几乎拦截所有生物查询,因为其评估认为Fable 5可能显著提升恶意行为者的能力。
更新后,普通健康咨询、症状理解、化验结果解释和生物教育问题将更少被误拦截,医疗专业人士也能在更多临床任务中使用Fable 5。Anthropic称,内部测试中各产品界面的生物相关fallback减少约85%,但未披露样本规模、评测集构成和更新后的绝对误触发率。
限制并未取消。病毒学、毒理学和分子设计等可能兼具正当与恶意用途的请求,仍会被分类器转交Opus 5。Anthropic称,Fable 5目前仍不适合专业生物研究和药物开发,未来计划通过受信任访问渠道扩大能力开放。
03Oracle禁止向OpenJDK提交AI生成代码,调试和代码审查仍可私下使用LLM
Oracle为其管理的开源Java项目OpenJDK划定了AI使用边界:贡献者不得向项目提交AI生成的代码或其他材料。禁令覆盖代码库、拉取请求及其他项目渠道,Oracle给出的理由包括安全、安保和知识产权风险。
这并不等于全面禁止LLM。开发者仍可私下用它调试和审查代码,但最终进入OpenJDK贡献流程的内容不能由AI生成。来源未说明项目如何判定AI生成内容,也未交代人工改写的材料是否属于禁令范围。
这项政策与Oracle披露的内部实践形成反差。联合创始人Larry Ellison近期称,AI模型已在为Oracle编写代码;联席CEO Mike Sicilia则表示,AI工具让规模更小的工程团队能够更快交付。不过,新规的生效日期和违规处置流程目前仍未说明。

Meta在新墨西哥州儿童安全案累计被罚9.42亿美元 新墨西哥州法院追加判罚Meta5.67亿美元,并要求其限制未成年人查看点赞数、夜间推送及每月使用时长;Meta表示将提起上诉。 techcrunch.com
SpaceX单季AI资本支出近160亿美元 SpaceX首份财报显示季度营收78亿美元、净亏损约5.41亿美元,但近160亿美元的AI资本支出令其股价早盘下跌10%;公司称这一投入水平至少还会持续两个季度。 arstechnica.com
字节跳动据报训练最多10万亿参数模型 知情人士称,字节跳动正处于一款最多10万亿参数模型的预训练早期阶段,最终规模将在后续确定;预训练通常需要三至六个月,之后还需微调才能发布。 arstechnica.com
Cloudflare推出面向AI agent的云端浏览器Kitesurf Kitesurf运行于Cloudflare Workers,可供agent导航网页、填写表单和执行其他浏览器任务,目前在Browser Run中免费测试。Cloudflare称其执行截图和HTML提取等任务时,CPU与内存消耗低于Chromium。 techcrunch.com
Rippling上线AI Spend Console控制企业token开支 人力资源软件商Rippling推出可按员工、团队和岗位追踪AI成本与产出的工具,并内置模型路由网关。公司称采用相关措施后,token支出从研发人员预算的40%降至约15%,7月相近用量的成本仅为4月的37%。 techcrunch.com
Airbnb开始测试可切换的自然语言AI搜索 Airbnb将允许用户在传统筛选器与AI搜索之间切换,并以可视化结果、动态标题和个性化房源亮点回应自然语言查询。公司还称,AI客服agent已无需人工介入完成近45%的咨询,使每笔预订的客服成本同比下降16%。 techcrunch.com
OpenAI与美国心理学会合作研究青少年AI使用 OpenAI宣布与美国心理学会合作,把心理学研究纳入青少年AI产品的开发与使用考量。受访专家认为,新模型虽较少给出直接有害回答,但在主动识别风险、引导用户求助真人及保持角色边界方面仍有不足。 arstechnica.com
4万次模拟显示人工漏掉三分之一agent威胁 一款模拟审批AI编程agent命令的游戏汇总逾4万次运行和40.9万次决策后发现,玩家平均只识别出66.3%的威胁。伪装成熟悉脚本名称的外泄命令有52.5%获准执行,显示单独审批命令难以覆盖文件修改形成的上下文风险。 scalex.dev
AI相亲服务Ditto获得920万美元种子融资 Ditto通过iMessage聊天收集大学生的个人信息与偏好,再每周直接安排匹配对象、时间和地点,不采用滑动浏览。公司称已有15万注册用户,约20%的匹配最终会线下见面。 techcrunch.com
Roku上线24小时AI生成内容频道 Roku新增由AI内容创业公司Fairground提供的全天候流媒体频道,节目由合作创作者制作,用户不能自行选择具体视频。Fairground称会向创作者支付生成费用并分享部分平台收入,但未披露所用模型及训练数据授权情况。 theverge.com
OSReward基准发现电脑操作agent评审模型普遍偏宽松 OSReward用经人工核验的网页、Windows、Ubuntu和移动端操作轨迹测试视觉语言模型,研究者称现有模型常把失败任务误判为成功。团队同时发布10万条带推理标注的数据及9B、35B开放奖励模型,称其成本比前沿商业评审模型低30%至60%。 huggingface.co