北京时区2026-09-04Models · Agents · Infra · China

AI 日报 | 2026-09-04

过去 24–48 小时,AI 主线集中在三件事:前沿闭源模型继续把安全阈值、agent/coding 能力和分阶段发布绑定在一起;Meta、Kimi、DeepSeek 等非 OpenAI 阵营继续用 coding/agent benchmark 与长上下文、开放权重争夺开发者入口;算力侧则从“买 GPU”进入“锁定 2027–2028 年供给与自研/合作芯片”的长期合约阶段。

7核心新闻条目
10主要来源链接
5重点深读

今日概览

最重要 5 条

01 · Frontier model

OpenAI GPT-6 Astra:能力发布与安全阈值同时成为产品叙事

摘要:OpenAI 启动 GPT-6 Astra rollout。公开 API 文档显示,GPT-6 Astra 先面向 Trusted Access Program 企业开放,随后扩展到 API 以及 Plus、Pro、Business、Enterprise 计划。其安全说明把 cyber 能力标记为 Critical threshold。

关键细节:OpenAI safety overview 称,在合适工具和访问条件下,GPT-6 Astra 可以发现未知安全漏洞并开发 exploit,因此同步加强防护。CNBC 与 Guardian 也报道了 Astra 的分阶段推出与 OpenAI 对“新一代 AGI 阶段”的强叙事。

为什么重要:模型发布已经不只是 benchmark 与价格问题。OpenAI 把最强模型的访问节奏、安全阈值、cyber 使用边界和企业 trusted access 绑定,意味着前沿模型商业化会越来越像受控基础设施,而非简单 API 商品。

来源:OpenAI Safety Overview · OpenAI API Docs · CNBC

02 · Agent / coding

Meta Muse Spark 1.3:Meta 继续用 coding/agent 场景切入前沿模型竞争

摘要:Meta AI Research 发布 Muse Spark 1.3,并在 Muse Code 与 Meta Model API 中 rollout。Meta 称新模型在 agentic 与 coding 任务上更强,能处理更长周期、多工作流、信息冲突的任务。

关键细节:官方博客强调 Muse Spark 1.3 可以在单个长线程中维护上下文和先前结果,主动补齐计划缺口,在不明确任务中提问,在 consequential actions 前确认。已有 reasoning modes 当天可用,max reasoning 会在额外安全测试后开放。

为什么重要:Meta 这次并未只打“开源权重”牌,而是把模型、Muse Code、Meta Model API 和 agent harness 结合。前沿模型竞争正在变成“模型 + 工具运行环境 + 长任务可靠性”的系统竞争。

来源:Meta AI Research · Meta developer model page

03 · China / open model

Kimi K3:Moonshot 把开放模型规模推到 2.8T 与 1M 上下文

摘要:Moonshot AI 发布 Kimi K3,称其为首个 open 3T-class model。模型为 2.8T 参数,具备 native vision 与 1-million-token context window,面向长周期 coding、knowledge work 和 reasoning。

关键细节:Kimi K3 使用 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes),并扩大 MoE sparsity:896 experts 中激活 16 个。发布页称 Kimi K3 在评测套件中持续超过其他被测开放模型,但整体仍落后最强闭源模型 Claude Fable 5 与 GPT 5.6 Sol。Kimi K3 已在 Kimi.com、Kimi Work、Kimi Code、Kimi API 可用;默认 max thinking effort,低/高 effort 后续更新。

为什么重要:中国模型厂商的竞争重点正在从聊天助手扩展到 coding agent、长上下文工作流和开放权重生态。Kimi K3 的 2.8T/1M context 组合,会给推理服务商、量化/并行框架和企业私有部署提出新压力。

来源:Kimi K3 Tech Blog

04 · Multimodal agent

DeepSeek-V4-Flash-Vision-Exp:多模态 agent benchmark 成为新竞争面

摘要:DeepSeek API 上线 DeepSeek-V4-Flash-Vision-Exp,这是实验性视觉理解模型,通过 model='deepseek-v4-flash-vision-exp' 调用。

关键细节:官方 change log 给出多项 agent/coding benchmark:Terminal Bench 2.1 为 83.9,NL2Repo 57.7,DeepSWE 59.3,DSBench-Hard 63.6,AutomationBench Public 25.7,ApexBench Pass@1 36.5,Agents' Last Exam 27.3,Chartography 64.3,ZeroBench Pass@5 35.0。DeepSeek 称纯文本能力与 V4-Flash 持平,在需要视觉理解的 agent benchmark 上相较 V4-Flash 有显著提升,接近 Opus-4.8。

为什么重要:Agent 的下一阶段不只是在 terminal 中写代码,而是理解 UI、图表、文档、截图和多模态状态。DeepSeek 把 vision-exp 放在 API change log 而非单纯研究 demo 中,说明多模态 agent 能力正在进入可调用服务。

来源:DeepSeek API Change Log

05 · Compute infra

AWS + NVIDIA:2027–2028 年额外 200 万 GPU,算力锁仓继续扩大

摘要:NVIDIA Newsroom 报道,AWS 计划在 2027–2028 年部署额外 200 万 NVIDIA Blackwell Ultra、Rubin 和 Rubin Ultra GPU,用于 agentic AI 与 physical AI 基础设施。

关键细节:该计划是在此前 2026 年起增加超过 100 万 NVIDIA GPU 的基础上继续加码。覆盖 GPU 代际从 Blackwell Ultra 延伸到 Rubin 与 Rubin Ultra,显示云厂商提前锁定多代产品路线。

为什么重要:Frontier AI 的竞争周期正在被 18–36 个月的供给承诺重塑。对模型公司来说,能否拿到 2027 年以后的大规模加速器容量,可能比短期训练技巧更影响产品 cadence;对 NVIDIA 来说,Rubin 代际需求已经被 hyperscaler 订单提前验证。

来源:NVIDIA Newsroom

其他值得关注

GitHub 将 Claude 与 Codex 接入 Copilot coding agent public preview

GitHub Changelog 显示,Claude by Anthropic 与 OpenAI Codex 已作为 coding agents 面向 Copilot Pro+ 与 Copilot Enterprise 客户 public preview。用户可在 GitHub 中启动 agent sessions 并分配任务;preview 期间每个 coding agent session 消耗一个 premium request。重点不在“又多两个模型选择”,而在 GitHub 正在把 Claude、Codex、Copilot 放入同一 agent 平台,统一治理、上下文与记忆。

来源:GitHub Changelog · GitHub Copilot

Anthropic 与 MatX:自研/合作芯片变成 frontier lab 战略选项

Reuters 报道,Anthropic 曾讨论以约 70 亿美元收购 AI 芯片初创 MatX,以加速其定制硬件计划;交易讨论后来停止,并转向潜在硬件合作。即便交易未成,这一报道也说明模型公司不再满足于只做云端 GPU 大客户,而是在 TPU、ASIC、互连和推理效率上寻找更深控制权。

来源:Reuters

中国 AI 生态检查

本轮重点更新来自 Kimi 与 DeepSeek。Qwen/通义方向,公开搜索结果显示 Qwen3.8-Max-0902 等追踪条目,但未检索到可验证的官方发布页;因此今日不作为重点条目,仅继续关注 QwenLM 官方博客、GitHub 与模型页。GLM、豆包、百度文心、MiniMax 过去 24–48 小时未检索到足够高可信的新官方发布,暂不纳入核心新闻。

来源链接

  1. OpenAI Safety Overview
  2. OpenAI API model docs
  3. CNBC on GPT-6 Astra
  4. Meta AI Research Muse Spark 1.3
  5. Kimi K3 Tech Blog
  6. DeepSeek API Change Log
  7. NVIDIA Newsroom AWS GPU plan
  8. GitHub Changelog Claude/Codex agents
  9. GitHub Copilot product page
  10. Reuters Anthropic/MatX