往期日报 · 第 62 期
Astra越过安全阈值,治理分歧扩大
Astra 被认定达到关键网络安全能力阈值;G20 轻监管主张、医疗治理报告与安全智能体并购同时推进。
- 模型安全
- 全球治理
- 医疗AI
- 智能体
- 安全运营
要点速览
- 01Astra 首次被认定达到关键网络安全能力阈值,先进能力将分层开放
- 02美国在 G20 推动 Carolina Principles,主张用行业标准替代专门审批机构
- 03WHO/Europe 报告把医疗 AI 的进步标尺从部署速度改为治理准备度
- 04Palo Alto Networks 收购 Console,把自然语言智能体带进安全告警处置
模型能力与安全边界
OpenAI 将 Astra 列入关键网络安全能力等级
OpenAI 于 9 月 1 日发布 《Path to Astra: critical capabilities and frontier safeguards》,称 Astra 首次达到其 Preparedness Framework 的“关键网络安全能力”阈值。该阈值指模型在获得合适工具和访问权限后,能够在多个经过强化防护的系统中发现此前未知的安全漏洞,并在没有人逐步引导的情况下设计利用链。
官方披露,Astra 在 ExploitBench 已知漏洞基准上取得 100%;在为避免数据污染而建立的 20 个近期高严重度漏洞内部数据集上,Astra 的任意代码执行率显著高于 GPT-5.6 Sol,并在评估中发现、利用了两个零日漏洞组成的攻击链,相关漏洞正在向维护者披露。OpenAI 同时公布,Astra 在网络安全越狱评估中的拒答率为 91.5%,GPT-5.6 Sol 为 59%;这些是公司在特定测试条件下的结果,并非独立审计结论。
在此前 Hugging Face 事件复盘之后,OpenAI 表示已延迟部分训练与发布工作,增加模型拒答、系统级分类器、思维链监控和自动停止机制。Astra 将很快开放,但最先进的网络安全能力先面向小范围测试者,之后通过 Daybreak Blue 扩展防御性使用。
全球 AI 政策与规则
G20 会议出现“轻监管”路线之争
据 CNET 9 月 1 日报道,本周在美国北卡罗来纳州 Chapel Hill 举行的 G20 Innovation Ministerial 把生成式 AI 监管带入多边讨论。美国白宫科技政策办公室主任 Michael Kratsios 在开场讲话中表示,政策适配过慢会削弱创新收益;美国正推动名为 Carolina Principles 的“促进创新框架”,重点包括支持 AI 研究、打通商业化路径和发展行业主导的技术标准。
前美国 AI 事务负责人 David Sacks 在会上反对设置类似 FDA 的 AI 专门审批机构,称新模型可能像车辆在车管所排队一样被拖慢。马斯克和扎克伯格也在远程发言中支持更宽松、偏向默认合法和开放模型的政策取向。上述主张目前是美国及企业代表在会议上的立场,不等于 G20 已达成共识;会议形成的政策意见预计将输入 12 月在迈阿密举行的 G20 领导人峰会。
医疗 AI 治理
WHO/Europe 把治理准备度置于部署速度之前
WHO 欧洲区 9 月 1 日发布的报告称,医疗 AI 是否负责任地进步,衡量标准应是治理准备度,而不是部署速度。这是 WHO/Europe 首次发布负责任医疗 AI 知识共同体报告;该共同体在 2025 年 10 月至 12 月进行为期五周的线上对话,参与者来自 105 个国家。
报告把碎片化和带偏见的数据、责任边界不清以及 AI 素养不足列为主要障碍,并将治理框架、数据、验证、劳动力能力,以及患者、社区和一线专业人员参与列为优先行动。WHO/Europe 也特别说明,报告记录的是知识共同体参与者的观点,不必然代表 WHO 的正式立场;这使它更像一份跨地区治理共识的工作底稿,而不是新的强制法规。
企业安全智能体
Palo Alto Networks 收购 Console
Palo Alto Networks 于 9 月 1 日在 投资者关系公告 中宣布收购 Console。公告将 Console 描述为 AI 原生平台,能够为企业运营提供智能体能力,以 AI 驱动的分析和行动处理告警、问题与请求,并支持在 Cortex 安全平台中调查信号、排序工作和采取行动。
Palo Alto Networks 首席执行官 Nikesh Arora 表示,安全运营将从管理仪表板和排队工单转向用自然语言直接与数据对话,构建可以自动告警和修复问题的智能体工作流。公司未披露交易金额,也没有在公告中承诺具体的整合时间表;目前可以确认的是,Console 将被用于强化 Cortex 的 agentic capabilities,企业安全产品的竞争因此进一步从“看见问题”延伸到“自动采取动作”。