2026-08-21 · Beijing

AI 日报 | 2026-08-21

过去 24–48 小时的 AI 更新呈现三条主线:中国模型继续在长上下文、开源权重和 agent/coding 能力上推进;算力供应链向定制芯片和长期融资结构倾斜;AI coding/agent 从“能写代码”进入任务队列、可观测性、OAuth/工具链稳定性与推理服务工程化。

ModelsAgent / AI CodingInfra / ChipsChina AIOpen Source
5核心条目
11核心来源
6其他观察

今日概览

DeepSeek-V4 Preview 与 Qwen3.8-Max 把 1M context、成本效率与开放权重推到台前;Marvell/Google 定制芯片交易显示 TPU 供应链更外部化;GitHub Copilot 与 vLLM 的近期更新则说明 agent/coding 与推理基础设施的战场正在转向企业级编排、计量、验证与服务稳定性。

最重要 5 条

China Models

1. DeepSeek-V4 Preview:低成本 1M context 成为中国开源模型竞争焦点

摘要:DeepSeek 官方发布 DeepSeek-V4 Preview,主打 “affordable million context length”,并宣布模型开源。

关键细节:官方页面强调 1M context length 与成本效率;DeepSeek 主页同时将 DeepSeek-V4、DeepSeek-R1、DeepSeek-Coder 列为核心开源模型线。

为什么重要:长上下文正在从 closed frontier model 的差异化能力转为开源/开放权重生态的标配。若 V4 的实际吞吐、KV cache 成本和长文档可靠性成立,会直接影响企业 RAG、代码库级 agent、法律/金融文档分析的模型选型。

Open Weights

2. Qwen3.8-Max:阿里将 Max 级模型推向 2.4T 参数、1M context,并预告开源权重

摘要:阿里云/通义官方披露 Qwen3.8-Max,称其为 Qwen 系列迄今最强旗舰模型。

关键细节:官方材料称 Qwen3.8-Max 规模为 2.4 trillion parameters,支持 up to 1 million tokens context,在 Text Arena 排名第五、Vision Arena 排名第二;Qwen 博客还称这是首次开放 Qwen-Max-class 模型权重,权重计划随后发布。

为什么重要:Qwen 若兑现 Max 级开源权重,将进一步压缩闭源 API 与开源部署之间的能力差距,也会推动国内云厂商围绕模型 API、私有化部署和行业 agent 的商业化竞争。

Chips / Infra

3. Marvell/Google 定制芯片交易:TPU 供应链更像“半开放平台”

摘要:Reuters 报道 Marvell 将帮助 Google 开发需求旺盛的定制芯片,并给予 Google 潜在价值 122 亿美元持股权利。

关键细节:报道定位为 Big Tech 与芯片供应商围绕定制 AI silicon 的最新大型交易;Google TPU 需求和外部半导体设计/制造合作继续深化。

为什么重要:AI 基础设施竞争正在从“买 GPU”扩展到“控制定制 ASIC、封装、内存、网络和融资”。对云客户而言,未来训练/推理价格曲线不只由 NVIDIA GPU 供给决定,Google TPU、AWS Trainium、AMD rack-scale 系统和定制 ASIC 都会形成价格压力。

来源:Reuters
Agentic Coding

4. GitHub Copilot 周更:agent 任务管理和 agent app 计量成为企业化重点

摘要:GitHub Copilot 8 月更新集中在 CLI、agent 任务队列、agent app 活动指标和模型退役治理。

关键细节:8 月 10 日周更提到 Copilot CLI 可在 /tasks 管理 subagents 与任务,并在 agent turn 运行时排队 prompts、shell commands 和支持的 slash commands;8 月 7 日 Copilot usage metrics API 新增 agent app activity,可按 Claude、Codex 等 partner agents 拆分。

为什么重要:企业采用 coding agent 的瓶颈正从模型能力转向可观测性、权限边界、任务编排和成本归因。GitHub 将 agent 活动纳入 usage metrics,意味着 agent 已被当作工程组织内部的可管理生产资源。

Inference

5. vLLM 继续强化推理服务:Adaptive Verification 与路由/多 LoRA 生态

摘要:vLLM 博客近期更新聚焦 serving 可靠性与吞吐,8 月 14 日发布 Adaptive Verification in vLLM: DSpark confidence-scheduled verification。

关键细节:vLLM 今年还推进 Semantic Router、KV offloading connector、WideEP/Blackwell serving、SageMaker/Bedrock 多 LoRA serving 等方向。

为什么重要:开源推理栈正在快速吸收闭源服务商的关键能力:动态验证、路由、多模型托管、KV 管理和 MoE serving。对企业而言,vLLM 的成熟度直接决定“自托管开源模型”能否在成本、延迟和可靠性上接近商业 API。

其他值得关注

  • Anthropic 新闻页近期仍将 Claude Code 与 Opus/Sonnet agentic coding 能力作为产品主线;搜索结果显示 Claude Code 近期有 MCP OAuth redirect URI 修复,说明 agent 工具链稳定性仍是关键迭代点。
  • OpenAI 官方搜索结果出现 “OpenAI models, Codex, and Managed Agents come to AWS”,显示 OpenAI 正继续向企业云渠道分发模型、Codex 与 managed agents。
  • Kimi/月之暗面 7 月 Kimi K3 后仍是中国模型生态重点变量;NYT 关注其许可策略与对美国领先地位的冲击。
  • 智谱/Z.ai 官方开放平台继续主推 GLM-5 系列与 GLM-5V-Turbo;第三方报道称 GLM-5.3 在 8 月发布,但本日报未找到足够强的官方公告页,因此仅列为观察项。
  • MiniMax H3 在社区中被讨论为 2026 年重要开权重多模态/视频模型,但搜索结果多为第三方站点;需要继续追踪官方 model card 与权重仓库。
  • 豆包/Doubao 今年 2 月发布 Doubao 2.0,定位 “agent era”;近 48 小时未检索到足够强的官方新发布。