微软拟让Copilot调用本地文件并操作Windows

01微软将让Copilot调用本地文件并操作Windows,相关功能未来数月推出

微软在Windows与Surface活动上演示了Copilot的新能力:它将能访问Windows电脑中的本地文件,并跨文件夹和应用执行操作。这些功能属于微软所称的「混合智能」,即让应用和工具按任务需要,结合设备本地与云端的AI模型处理工作。

台上的视频演示以报税为例。微软Copilot执行副总裁Jacob Andreou要求Autopilot协助向会计师提交材料。这个AI agent随后搜索不同文件夹,找到所需文档,重命名并压缩文件,最后起草邮件,把压缩包作为附件加入。

这条动作链目前只是演示,并非所有用户已经可用。微软称,混合智能功能将在未来数月进入Copilot,但没有给出准确日期,也未解释本地模型和云端模型分别承担哪些步骤。

微软还展示了新的Windows搜索体验:用户可直接在搜索栏开启深色模式、用滑块调高麦克风音量或发送短信。该功能计划从今年秋季开始登陆Windows 11。公司尚未说明Copilot访问文件的授权边界、敏感文件如何保护,以及执行重命名、压缩或发信等动作前是否需要逐项确认。同场公布的Surface RTX Spark Dev Box则面向本地AI开发,配备128GB统一内存,并针对超过1200亿参数的模型优化。

Windows用户可能减少查找文件和跨应用操作的时间,但也将面对更高的文件访问与误操作风险企业需要评估本地和云端处理对敏感数据的影响下一步要看微软公布具体权限、确认机制和上线日期。

02Anthropic推出Haiku 5.5:短上下文价格降至每百万Token 0.10美元与0.50美元

Anthropic推出面向高吞吐量、成本敏感任务的小模型Haiku 5.5。它适合摘要、分类、数据库查询、在线客服及编码子代理;复杂的agent编码任务仍更适合Sonnet 5.5或Opus 5.5。新模型现已登陆Claude平台、AWS、Google Cloud和Microsoft Azure。

不超过10万Token时,输入和输出分别为每百万Token 0.10美元和0.50美元;超过后升至0.50美元和2.50美元。Anthropic称,结合请求长度与单项任务Token变化,平均运行成本较Haiku 4.5低约75%。

但标价降幅不等于任务成本降幅。开发者Simon Willison实测,同一段长提示经新分词器处理,Token约为Haiku 4.5的1.25倍;来源尚无独立的大规模性能验证。

Anthropic同时把Sonnet 5.5缓存读取价减半至每百万Token 0.10美元,称多数agent任务成本可降约20%。本周起,Max 5x、Max 20x和Team订阅者每月分别获100美元、200美元和最高500美元API额度,用于Claude平台任意模型,但额度不会结转。

高频短任务开发者可直接降低调用成本长上下文用户需按新分词结果重算账单Sonnet agent用户和希望试做应用的订阅者获得额外降本空间,后续要看额度实际使用率。

03SafeActBench测试发现:三种AI代理配置静态判断准确率至少95%,交互执行成功率却不超52%

工具型AI代理能调用工具改变外部状态,但结果正确,不代表行动前已有充分证据。SafeActBench用656个案例覆盖六个操作领域、五种协议,测试十种模型与执行框架组合,从静态判断一路追踪到有依赖关系的多步工作流。

三种组合在同一批V1案例上的静态判断准确率至少95%,交互执行成功率却不超过52%。差距主要在行动前出现:V0测试中,代理未完成必要调查便停止的比例为21.7%至62.9%;V1中,37.0%至66.9%的行动尝试发生在必要证据建立前。

基准通过绑定来源的Evidence Ledger记录信息何时确认、动作何时发生,并以确定性轨迹评估器检查证据和后续依赖。43个V1案例的控制实验还扣留一条决定性记录,代理仍在46.5%至53.5%的已完成任务中行动。取得证据后,单步执行通常可靠;多步任务则新增前置条件未满足和执行不完整问题。上述比例不能直接外推至真实生产系统。

开发者不能只凭静态判断准确率评估代理安全性测试成本需要前移到调查完整性和行动前证据审计部署前还应检查多步任务的依赖满足与执行完整度。
04

ChatGPT上线可交互的「Intelligent UI」 OpenAI正随GPT-6向ChatGPT用户推出Intelligent UI,可在回答中直接生成图表、表单、按钮及计算器等交互工具;Plus、Pro、Business和Enterprise用户率先获得GPT-6 Sol,Go及免费用户将使用GPT-6 Luna。 theverge.com

05

微软发布搭载Nvidia RTX Spark的AI PC与开发工作站 Surface Laptop Ultra起价2600美元,Surface RTX Spark Dev Box起价6000美元,均主打本地运行AI模型。新版Windows 11还将加入用于隔离AI agent的Execution Containers,微软称该功能会面向所有Windows 11用户开放。 techcrunch.com

06

Meta用新AI系统追踪暗中导向儿童性虐待材料的广告 Meta推出大语言模型系统,不仅分析广告内容,还检查广告指向的网站,以识别表面正常、实则为非法材料引流的“signposting”行为;公司另用red-teaming AI agent测试自身防护漏洞。Meta称2026年上半年已处置3320万条儿童性剥削内容,其中超过97%由系统在用户举报前发现。 techcrunch.com

07

Google向公众开放SynthID媒体验证网站 该网站可检查图片、视频和音频是否带有Google的SynthID AI水印,覆盖JPG、MP4、MP3等多种格式;Google此前仅向部分记者、媒体从业者和研究人员开放测试,并称目前每日验证请求约100万次。 techcrunch.com

08

Nous Research融资9000万美元并推出企业版Hermes agent 开源Hermes Agent开发商Nous Research以15亿美元估值完成B轮融资,新资金将用于推出Hermes for Businesses,让企业部署可处理多步骤工作流的定制agent。公司称Hermes Agent已被克隆超过2400万次,但其全球AI token用量占比等数据尚属企业自估。 techcrunch.com

09

Google、Meta等投入3亿美元建设「虚拟细胞」 Google DeepMind、Meta和AI药物研发公司Isomorphic Labs将共同向非营利生物医学机构Biohub投资3亿美元,用于生成AI数据集并建立可模拟细胞的预测模型。该项目属于规模18亿美元的Virtual Biology计划,美国能源部未来五年还将投入超过5亿美元。 theverge.com

10

Healthleap融资3800万美元,用AI筛查住院患者风险 医疗AI初创公司Healthleap把临床记录、检验结果和生命体征输入风险模型,标记可能存在营养不良、谵妄等问题的患者供医护人员复核,而不直接作出诊断。公司称其平台已部署于50多家医院,并计划把支持范围扩展至40多种主要疾病。 techcrunch.com

11

Google推出用文字提示生成网页游戏的Playground Google Labs实验平台Playground允许用户通过提示词创建2D或3D、单人或多人网页游戏,也能上传图片并转化为游戏素材。该服务首批面向美国18岁以上用户开放,免费档按周提供有限生成token,未来计划接入Unity Spark。 techcrunch.com

12

Common Sense Media称ChatGPT青少年模式存在「不可接受的风险」 青少年安全评估机构Common Sense Media称,ChatGPT for Teens可能漏发家长警报、未能在危机情境下提供适当帮助;OpenAI则质疑部分测试可能发生在家长控制完全激活前。Common Sense Media回应称,即使部分账户已连接更长时间,危机通知仍不可靠。 theverge.com

13

OpenAI发布722份数学手稿,成果仍待同行检验 OpenAI公布由一款未发布前沿模型生成的722份手稿,覆盖372组相关结果,并称其中解决了数百个开放问题。独立顾问组织AGMAI此前要求AI实验室通过既有学术渠道及时披露模型、提示词和算力等信息,数学界仍需进一步核验这些结果。 theverge.com

14

Radisson把酒店搜索与预订接入ChatGPT Radisson Hotel Group与咨询公司Accenture合作开发ChatGPT插件,让旅客在规划行程时查找、比较并预订酒店;现有素材未披露具体开放范围或上线时间。 openai.com