往期日报 · 第 75 期
实时语音、企业预测与推理芯片
实时语音模型正式可用,企业把表格预测与容量调度纳入平台;科研与芯片部署显示,验证和推理效率仍是落地关键。
- 实时语音
- 企业AI
- AI科研
- 推理芯片
要点速览
- 01实时语音应用可在低延迟与后台推理之间选择正式模型
- 02表格预测免训练接入企业平台,GPU 容量调度转为优先级机制
- 03科学家自报每周省近7小时,但验证与实验成为新瓶颈
- 04Meta 首批自研推理芯片完成测试,排定2027年数据中心部署
实时语音模型
Gemini 3.8 Live 与 Extended Thinking 转为正式可用
Google 于 9 月 15 日将两款面向 Live API 的 audio-to-audio 模型转为正式可用。Gemini 3.8 Live 是低延迟语音智能体和实时对话的默认选项,支持交错推理、默认异步函数调用及完整会话客户端内容更新;Gemini 3.8 Live Extended Thinking 则可在实时音频交互期间进行后台推理,适用于需要更高推理深度的场景。
这把实时语音产品的取舍拆成两个明确选项:追求即时响应时使用标准版,需要更多后台推理时采用 Extended Thinking。Google 的更新说明未公布两者在具体任务上的性能对比,实际选择仍应结合延迟要求和工作负载测试。
| 模型 | 主要定位 | 推理方式 |
|---|---|---|
| Gemini 3.8 Live | 低延迟语音智能体与实时对话 | 交错推理 |
| Gemini 3.8 Live Extended Thinking | 更高推理需求的实时音频交互 | 后台推理 |
企业预测与算力调度
SAP 在 AI Core 提供 TabPFN-3.5 Plus
SAP 宣布,Prior Labs 的 TabPFN-3.5 Plus 已在 SAP AI Core 向客户提供。该模型面向现金流、付款延迟、供应商风险、追加销售和客户流失等结构化业务预测;SAP 称其可直接处理缺失值、混合数据类型和不一致字段,并通过上下文学习从原始表格数据生成预测,无需另行训练或调参。
这与通用语言模型处理文本的路径不同,重点是把表格预测嵌入企业 AI 平台。模型能否带来更准确的业务判断,仍取决于标签质量、历史偏差和具体任务的外部验证;SAP 所述性能优势属于公司对外部基准的引用。
SageMaker 为训练作业加入实例偏好列表
AWS 同日为 SageMaker AI 的训练和处理作业加入实例偏好列表。提交任务时,团队现在可按优先级给出多个可接受的实例类型与数量;系统会在列表中找到首个有可用容量的配置后启动作业。一个任务还可同时声明按需容量或 SageMaker Flexible Training Plans 的预留容量来源。
此前,作业只能指定一种实例类型,GPU 紧张时往往需要手工重试或并发提交多个任务。新机制把这部分容量探测交给平台调度,适用于可在多种实例上获得相近效果的训练、微调和数据处理任务。AWS 表示,该功能已在所有提供 SageMaker 的区域通过 CLI、API、SDK 与控制台上线。
科研工作流的验证瓶颈
Google 与 MIT 研究量化科学家使用 AI 的早期模式
Google、Google DeepMind 与 MIT FutureTech 发布的研究显示,近半数受访科学家每天使用某种 AI,并自报每周节省接近 7 小时。研究将大语言模型与专业模型视为互补:前者较多用于通用分析、编程和论文准备,后者较多用于领域预测、数据生成、分类和模拟。
效率增量并未自动转化为发现速度。研究指出,AI 加快上游环节后,输出验证、尚未测试的假设以及实体实验和临床验证会形成新的下游瓶颈。应注意,这份调查属于筛选式非概率在线样本,未加权且未给出抽样误差;“接近 7 小时”是受访者自报结果,不能直接外推为全体科研人员的因果效应。
推理芯片进入实测与部署排期
Meta 披露第三代自研推理芯片 Arke 的首批测试
据彭博社报道,Meta 正测试第三代自研 AI 芯片 MTIA 450,代号 Arke,并计划在 2027 年上半年将其部署到数据中心,用于通用推理。报道援引 Meta 工程副总裁的话称,首批 12 颗芯片于 9 月 1 日由台积电交付,实测性能与模拟结果相差约 2% 至 3%,首日已运行 Meta、DeepSeek 与阿里巴巴的模型。
Meta 与 Broadcom 合作设计、由台积电制造该系列芯片,并称未来 12 个月已承诺超过 1GW 等效能耗规模。公司同时取消原计划兼顾训练和推理的 Olympus,转向推理专用路线;下一代 MTIA 500,代号 Astrid,计划在 2027 年末进入数据中心。上述节能与成本收益仍是 Meta 的目标和管理层表述,量产后的实际表现有待观察。
2026-09-01
12 颗 Arke 芯片交付
实测与模拟相差约 2% 至 3%
2027 年上半年
Arke 计划进入数据中心
面向通用推理
2027 年末
Astrid 计划进入数据中心
下一代 MTIA 500