北京时区2026-09-04Models · Agents · Infra · China
AI 日报 | 2026-09-04
过去 24–48 小时,AI 主线集中在三件事:前沿闭源模型继续把安全阈值、agent/coding 能力和分阶段发布绑定在一起;Meta、Kimi、DeepSeek 等非 OpenAI 阵营继续用 coding/agent benchmark 与长上下文、开放权重争夺开发者入口;算力侧则从“买 GPU”进入“锁定 2027–2028 年供给与自研/合作芯片”的长期合约阶段。
今日概览
- OpenAI 发布/启动 GPT-6 Astra 分阶段 rollout,并在安全说明中强调其 cyber 能力达到 Critical threshold。
- Meta AI Research 发布 Muse Spark 1.3,重点面向 Muse Code 与 Meta Model API,强调更强 agentic workflows、coding、长任务协作。
- Moonshot/Kimi 推出 Kimi K3:2.8T 参数、1M token context、native vision、Kimi Delta Attention 与 Attention Residuals。
- DeepSeek API 近期上线 DeepSeek-V4-Flash-Vision-Exp,补齐视觉理解 agent 能力并给出多项 benchmark。
- NVIDIA 与 AWS 公布面向 2027–2028 年的额外 200 万 GPU 供给计划,覆盖 Blackwell Ultra、Rubin、Rubin Ultra。
- GitHub 已将 Claude 与 OpenAI Codex 作为 coding agents 接入 Copilot 平台 public preview。
- Reuters 报道 Anthropic 曾讨论以约 70 亿美元收购 AI 芯片初创 MatX,后转向潜在硬件合作。
最重要 5 条
01 · Frontier model
OpenAI GPT-6 Astra:能力发布与安全阈值同时成为产品叙事
摘要:OpenAI 启动 GPT-6 Astra rollout。公开 API 文档显示,GPT-6 Astra 先面向 Trusted Access Program 企业开放,随后扩展到 API 以及 Plus、Pro、Business、Enterprise 计划。其安全说明把 cyber 能力标记为 Critical threshold。
关键细节:OpenAI safety overview 称,在合适工具和访问条件下,GPT-6 Astra 可以发现未知安全漏洞并开发 exploit,因此同步加强防护。CNBC 与 Guardian 也报道了 Astra 的分阶段推出与 OpenAI 对“新一代 AGI 阶段”的强叙事。
为什么重要:模型发布已经不只是 benchmark 与价格问题。OpenAI 把最强模型的访问节奏、安全阈值、cyber 使用边界和企业 trusted access 绑定,意味着前沿模型商业化会越来越像受控基础设施,而非简单 API 商品。
来源:OpenAI Safety Overview · OpenAI API Docs · CNBC
02 · Agent / coding
Meta Muse Spark 1.3:Meta 继续用 coding/agent 场景切入前沿模型竞争
摘要:Meta AI Research 发布 Muse Spark 1.3,并在 Muse Code 与 Meta Model API 中 rollout。Meta 称新模型在 agentic 与 coding 任务上更强,能处理更长周期、多工作流、信息冲突的任务。
关键细节:官方博客强调 Muse Spark 1.3 可以在单个长线程中维护上下文和先前结果,主动补齐计划缺口,在不明确任务中提问,在 consequential actions 前确认。已有 reasoning modes 当天可用,max reasoning 会在额外安全测试后开放。
为什么重要:Meta 这次并未只打“开源权重”牌,而是把模型、Muse Code、Meta Model API 和 agent harness 结合。前沿模型竞争正在变成“模型 + 工具运行环境 + 长任务可靠性”的系统竞争。
来源:Meta AI Research · Meta developer model page
03 · China / open model
Kimi K3:Moonshot 把开放模型规模推到 2.8T 与 1M 上下文
摘要:Moonshot AI 发布 Kimi K3,称其为首个 open 3T-class model。模型为 2.8T 参数,具备 native vision 与 1-million-token context window,面向长周期 coding、knowledge work 和 reasoning。
关键细节:Kimi K3 使用 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes),并扩大 MoE sparsity:896 experts 中激活 16 个。发布页称 Kimi K3 在评测套件中持续超过其他被测开放模型,但整体仍落后最强闭源模型 Claude Fable 5 与 GPT 5.6 Sol。Kimi K3 已在 Kimi.com、Kimi Work、Kimi Code、Kimi API 可用;默认 max thinking effort,低/高 effort 后续更新。
为什么重要:中国模型厂商的竞争重点正在从聊天助手扩展到 coding agent、长上下文工作流和开放权重生态。Kimi K3 的 2.8T/1M context 组合,会给推理服务商、量化/并行框架和企业私有部署提出新压力。
来源:Kimi K3 Tech Blog
04 · Multimodal agent
DeepSeek-V4-Flash-Vision-Exp:多模态 agent benchmark 成为新竞争面
摘要:DeepSeek API 上线 DeepSeek-V4-Flash-Vision-Exp,这是实验性视觉理解模型,通过 model='deepseek-v4-flash-vision-exp' 调用。
关键细节:官方 change log 给出多项 agent/coding benchmark:Terminal Bench 2.1 为 83.9,NL2Repo 57.7,DeepSWE 59.3,DSBench-Hard 63.6,AutomationBench Public 25.7,ApexBench Pass@1 36.5,Agents' Last Exam 27.3,Chartography 64.3,ZeroBench Pass@5 35.0。DeepSeek 称纯文本能力与 V4-Flash 持平,在需要视觉理解的 agent benchmark 上相较 V4-Flash 有显著提升,接近 Opus-4.8。
为什么重要:Agent 的下一阶段不只是在 terminal 中写代码,而是理解 UI、图表、文档、截图和多模态状态。DeepSeek 把 vision-exp 放在 API change log 而非单纯研究 demo 中,说明多模态 agent 能力正在进入可调用服务。
来源:DeepSeek API Change Log
05 · Compute infra
AWS + NVIDIA:2027–2028 年额外 200 万 GPU,算力锁仓继续扩大
摘要:NVIDIA Newsroom 报道,AWS 计划在 2027–2028 年部署额外 200 万 NVIDIA Blackwell Ultra、Rubin 和 Rubin Ultra GPU,用于 agentic AI 与 physical AI 基础设施。
关键细节:该计划是在此前 2026 年起增加超过 100 万 NVIDIA GPU 的基础上继续加码。覆盖 GPU 代际从 Blackwell Ultra 延伸到 Rubin 与 Rubin Ultra,显示云厂商提前锁定多代产品路线。
为什么重要:Frontier AI 的竞争周期正在被 18–36 个月的供给承诺重塑。对模型公司来说,能否拿到 2027 年以后的大规模加速器容量,可能比短期训练技巧更影响产品 cadence;对 NVIDIA 来说,Rubin 代际需求已经被 hyperscaler 订单提前验证。
来源:NVIDIA Newsroom
其他值得关注
GitHub 将 Claude 与 Codex 接入 Copilot coding agent public preview
GitHub Changelog 显示,Claude by Anthropic 与 OpenAI Codex 已作为 coding agents 面向 Copilot Pro+ 与 Copilot Enterprise 客户 public preview。用户可在 GitHub 中启动 agent sessions 并分配任务;preview 期间每个 coding agent session 消耗一个 premium request。重点不在“又多两个模型选择”,而在 GitHub 正在把 Claude、Codex、Copilot 放入同一 agent 平台,统一治理、上下文与记忆。
来源:GitHub Changelog · GitHub Copilot
Anthropic 与 MatX:自研/合作芯片变成 frontier lab 战略选项
Reuters 报道,Anthropic 曾讨论以约 70 亿美元收购 AI 芯片初创 MatX,以加速其定制硬件计划;交易讨论后来停止,并转向潜在硬件合作。即便交易未成,这一报道也说明模型公司不再满足于只做云端 GPU 大客户,而是在 TPU、ASIC、互连和推理效率上寻找更深控制权。
来源:Reuters
中国 AI 生态检查
本轮重点更新来自 Kimi 与 DeepSeek。Qwen/通义方向,公开搜索结果显示 Qwen3.8-Max-0902 等追踪条目,但未检索到可验证的官方发布页;因此今日不作为重点条目,仅继续关注 QwenLM 官方博客、GitHub 与模型页。GLM、豆包、百度文心、MiniMax 过去 24–48 小时未检索到足够高可信的新官方发布,暂不纳入核心新闻。