AI 日报

往期日报 · 第 40 期

字节跳动训练10万亿参数大模型,Cloudflare推出AI智能体专属浏览器

字节跳动被曝正训练规模达10万亿参数的大模型以追赶Anthropic。Cloudflare推出专为AI智能体设计的云端浏览器Kitesurf。此外,Meta发布终端代码智能体Muse Code,中国AI产业面临中文高质量训练数据枯竭的新瓶颈。

约 5 分钟编辑部
  • 中国大模型
  • AI智能体
  • 模型开发
  • 数据瓶颈

要点速览

  1. 01字节跳动正训练10万亿参数大模型,规模达 Kimi K3 三倍以上
  2. 02Cloudflare 发布专为 AI 智能体设计的云端浏览器 Kitesurf
  3. 03Meta 推出终端代码智能体 Muse Code,进军企业级 AI 编程市场
  4. 04中国 AI 产业面临高质量中文训练数据即将枯竭的新瓶颈
  5. 05Shopify 称 AI 搜索推动电商转化率提升,未蚕食传统搜索流量

巨头模型竞赛

字节跳动训练10万亿参数大模型

据英国《金融时报》报道,字节跳动(ByteDance)正在训练一个参数量高达 10 万亿的巨型人工智能模型。这一规模将是此前月之暗面发布的 2.8 万亿参数模型 Kimi K3 的三倍以上,其目标是追赶并匹敌 Anthropic 旗下最先进的 Mythos 系统。业内估计,Anthropic 的 Mythos 5 参数量约为 8 万亿。

该模型目前正处于预训练的早期阶段,预计该过程将持续三到六个月。在算力受限的背景下,字节跳动此举显示出中国科技巨头在追求前沿模型能力上的决心。创始人张一鸣据称已要求团队避免过度依赖模型蒸馏(distillation)来获取短期进展,而是要建立真正的原生能力。

Meta 推出代码智能体 Muse Code

Meta 正式进入企业级 AI 编程工具市场,推出了专为处理大型复杂代码库而设计的终端 AI 智能体 Muse Code。该工具由 Meta 最新发布的 Muse Spark 1.2 模型驱动,能够自主规划代码更改、编写和修改代码,并执行多步软件工程任务。

与依赖 IDE 插件的传统辅助工具不同,Muse Code 直接在终端环境中运行,优化了长周期和多智能体协作的工作流。这一发布使 Meta 与 OpenAI 及 Anthropic(如 Claude Code)在快速增长的 AI 编程助手领域展开了直接竞争。

智能体基础设施与应用

Cloudflare 发布 AI 智能体专属浏览器 Kitesurf

随着 AI 软件从问答聊天机器人向能够代客执行任务的智能体(Agent)演进,网络基础设施提供商 Cloudflare 推出了一款名为 Kitesurf 的云端托管浏览器,专为 AI 智能体设计。与面向人类的传统浏览器不同,Kitesurf 剥离了主题、标签页和扩展程序等视觉元素,专注于上下文窗口管理、性能优化、Token 成本控制以及防范提示词注入攻击。

Cloudflare 表示,Kitesurf 运行在其无服务器平台 Workers 上,在执行截图和 HTML 提取等常见智能体任务时,其 CPU 和内存消耗显著低于 Chromium。该工具目前处于测试阶段,允许开发者通过 API 控制无头浏览器实例,从而更高效地构建基于浏览器的 AI 自动化工作流。

Shopify 称 AI 搜索推动电商转化率提升

在第二季度财报电话会议上,电商平台 Shopify 表示,人工智能正在成为传统搜索的有力补充,而非替代品。公司数据显示,第二季度由 AI 驱动的流量和订单同比增加了两倍。与 AI 导致内容发布商流量下降的情况不同,Shopify 发现 AI 助手能够通过处理多维度的复杂搜索意图,将购物者的购买旅程大幅压缩。

据统计,有一半由 AI 引导的会话直接落地在产品描述页,这一比例是传统搜索的 2.5 倍。此外,第二季度 75% 的 AI 归因购买发生在热门前 100 名类别之外,表明 AI 在挖掘长尾商品和匹配精准需求方面具有显著优势。

产业生态挑战

中国 AI 产业面临高质量数据枯竭瓶颈

随着中国大模型竞赛进入新阶段,除了广受关注的算力芯片限制外,一个更隐蔽但同样致命的瓶颈正在显现:高质量中文训练数据的严重短缺。美国研究机构 Epoch AI 预测,全球高质量的公开人类生成文本可能在未来六年内被完全耗尽。

中国 AI 专家警告称,中文互联网上高质量、结构化数据的匮乏,可能比硬件限制更早地阻碍国产大模型能力的进一步突破。目前,中美顶尖 AI 实验室都在投入巨资挖掘线下人类知识或合成数据,以应对即将到来的“数据墙(data wall)”。