今日概览
- DeepSeek V4 Flash 0731 正式发布:284B/13B-active MoE,Agent 微调后 benchmark 超越自家 V4-Pro Preview,定价 $0.14/$0.28/百万 tokens,MIT 开源权重、原生 Responses API + Codex 支持。这是过去一周讨论度最高的模型发布。
- Qwen 3.8 Max GA:8 月 3 日进入 General Availability,附带完整定价与 benchmark,阿里的最新旗舰级模型,代表中国模型生态的持续演进。
- Anthropic Claude Code 内幕故事 & Frontier Red Team:Anthropic 发布 Claude Code 从内部 CLI 到正式产品的深度叙事,同时公开三起真实世界网络安全攻防案例。
- GitHub Copilot:Agent Skills + MCP 正式 GA:Copilot Code Review 的 Agent Skills 和 MCP 支持已全面可用,coding agent 进入"企业级可定制"阶段。
- 推理基础设施加速分化:vLLM v0.26.0 发布 + Z.AI 纯国产芯片数据中心竣工,反映全球推理栈的异构化趋势。
模型发布开源AgentDeepSeek
1. DeepSeek V4 Flash 0731 正式发布:13B Active 在 Agent Benchmark 上超越 V4 Pro Preview
📅 2026-07-31 · 来源:DeepSeek 官方
DeepSeek 将 V4 Flash 从 Preview 正式推进到公开 Beta,同一个 284B / 13B-active MoE 架构,仅通过重新后训练(re-post-training),就在九项 Agent Benchmark 上超越更大规模的 V4 Pro Preview。
关键指标:
- Terminal Bench 2.1:82.7;DeepSWE:54.4
- 原生支持 OpenAI Responses API + Codex CLI
- 定价:$0.14 输入 / $0.28 输出(百万 tokens),约为 V4-Pro 的三分之一
- MIT 开源权重,已在 Hugging Face 发布
- 1M context window
为什么重要:这是首次出现小主动参数模型通过 Agent 专项微调全面超越大模型的案例。它验证了一个关键趋势:Agentic 能力不一定需要更多参数,而是需要更针对性的后训练数据与 evaluation。该模型在 Codex CLI 上的原生兼容意味着它已进入 AI coding agent 的主流选项池,性价比极高。
模型发布中国 AIQwenAlibaba
2. Qwen 3.8 Max 全面可用:阿里旗舰模型进入 GA
📅 2026-08-03 · 来源:阿里云 / Qwen 官方
Qwen 3.8 Max 于 8 月 3 日正式进入 General Availability,附带完整定价与 benchmark 数据。此前的 Preview(7 月 19 日发布)仅在阿里 Token Plan、Qoder 和 QoderWork 中可用。GA 版本扩展了 API 可用性和完整文档。
为什么重要:Alibaba 的模型迭代节奏明显加快。Qwen 3.8 Max 标志着中国大模型从"追赶 benchmark"进入"产品化/定价竞争"阶段。Qwen 系列已在全球开发者社区中形成稳定影响力(Hugging Face、ModelScope、Ollama 等均有分发),GA 发布将进一步推动企业级部署。
AI 安全AgentAnthropicClaude Code
3. Anthropic:Claude Code 内幕故事 & Frontier Red Team 攻防实例公开
📅 2026-07-30 / 8 月初 · 来源:Anthropic Newsroom
Anthropic 近期发布了两篇重要内容:
- 《The Making of Claude Code》:由研究员、工程师和早期用户讲述 Claude Code 如何从内部 CLI 工具演变为 Anthropic 的旗舰 coding agent。该故事披露了内部开发过程中的关键设计决策。
- Frontier Red Team 报告:公开调查了三起真实世界的网络安全事件,展示 AI 系统在实际攻防场景中的表现和局限性。
背景补充:Claude Opus 5(7 月 24 日发布)定位为"比 Fable 5 便宜一半,但仍接近前沿智能"的中档推理模型,主要面向长时间运行的 Agent 工作负载。Claude Sonnet 5 的 introductory pricing(输入 $2 / 输出 $10 / 百万 tokens)持续到 8 月 31 日。
为什么重要:Anthropic 正在系统性地构建 Agent 生态心智——不仅发布模型,还公开工程经验(Claude Code 内幕)、安全实践(Frontier Red Team)和透明定价策略。这种"模型 + 工具 + 安全叙事"的组合对企业和开发者选型影响深远。
AI CodingMCPGitHubCopilot
4. GitHub Copilot:Agent Skills + MCP 正式 GA,Coding Agent 进入企业定制时代
📅 2026-07-29 · 来源:GitHub Changelog
GitHub 正式将 Copilot Code Review 的 Agent Skills 和 MCP Server 支持从 Preview 推进到 General Availability,覆盖 Copilot Pro、Pro+、Business 和 Enterprise 用户。
关键能力:
- Agent Skills:通过
.github/skills/SKILL.md 让 Copilot Code Review 调取团队内部工具和编码规范
- MCP Server:允许 Copilot 连接外部工具和数据源进行更深入的上下文评审
- 付费模型方面:Kimi K2.7 Code 已加入 Copilot 模型池,Claude Sonnet 5 自 7 月 4 日起成为默认模型
- Copilot Vision 已 GA(7 月 4 日),Cursor iOS Beta 已上线
为什么重要:Copilot 从"代码补全工具"进化为"可编程的 Agent 平台"。Agent Skills + MCP 的组合意味着企业可以将自己的代码库知识、安全策略、架构规范注入到 AI review 流程中,而不只是依赖通用模型。这让 coding agent 从"开发者个人工具"变成"团队工程基础设施"。
推理基础设施开源芯片中国 AI
5. 推理基础设施分化:vLLM v0.26.0 + Z.AI 国产芯片数据中心
📅 2026-07-27 / 7 月下旬 · 来源:GitHub / Bloomberg
过去一周,推理基础设施领域出现两个标志性事件:
- vLLM v0.26.0 发布(7 月 27 日):开源推理引擎最新大版本,继续推进 disaggregated serving、elastic clusters 等 Agent-ready 特性。
- Z.AI(智谱关联)纯国产芯片数据中心竣工:据 Bloomberg 7 月 20 日报道,Z.AI 完成了一座大型数据中心建设,计划完全使用中国国产芯片训练 AI 模型,标志着中国在受限环境下转向国产替代路线的实质性进展。
此外,Kimi K4(月之暗面 Moonshot AI 下一代模型)被报道需要比 K3 更大的训练规模,但受限于无法购买 NVIDIA Blackwell 芯片,凸显中国 AI 公司在算力获取上的结构性挑战。
为什么重要:推理栈的全球格局正在加速分化。vLLM 生态向 Agentic API 和异构硬件(Ascend 等国产加速器)推进;Z.AI 的全国产数据中心则是中国 AI 供应链独立性的试金石。两类发展都指向同一方向:推理基础设施不再单一依赖 NVIDIA + CUDA。
其他值得关注
🔄 Kimi K2.7 Code 加入 GitHub Copilot 模型池
Moonshot AI 的 K2.7 Code 模型已进入 Copilot 的付费模型阵容,代表中国 coding model 首次进入全球最大开发者平台的默认选项。
🔐 Anthropic Fable 5 全球恢复 + 联手微软/Google/AWS 制定越狱严重性评分框架
Anthropic 的 Fable 5 于 7 月 1 日全球恢复使用(此前因出口管制暂停)。同时,Anthropic 联合 Glasswing 计划成员(AWS、Microsoft、Google 等)提出行业级 jailbreak 严重性评分标准。
📊 中国 AI 生态监控
过去 48 小时内,DeepSeek(V4-Flash-0731 的后续技术讨论活跃)、Qwen(3.8 Max GA)、MiniMax(M3 开源权重 6 月发布后生态持续扩展)、智谱 GLM(GLM-5.2 在 coding benchmark 中表现稳定)、豆包/百度文心(未发现近期重大官方发布)构成了当前中国模型生态的主要竞争格局。建议持续跟踪各家的 API changelog、GitHub release 和官方定价页面,而非仅依赖二级媒体报道。
💰 AI 融资快照
Anthropic 在 5 月底完成 65B 美元 Series H(估值 965B),7 月初二级市场估值突破 1.2T 美元。同时,Baseten(1.5B Series F)、Fireworks AI(1.5B)等推理基础设施公司的密集融资继续推高整个 AI 栈的估值。Cerebras IPO 后表现强劲,5 月上市后与 AMD、CrowdStrike 签约合作。
来源链接
- DeepSeek V4 Flash 0731 官方
- Hugging Face:DeepSeek V4 Flash 分析
- Qwen 3.8 Max GA 详情
- Qwen 官方站点
- Anthropic Newsroom
- Claude Opus 5 发布
- Claude Sonnet 5 发布
- GitHub Copilot Agent Skills + MCP GA
- vLLM v0.26.0
- Bloomberg: Z.AI 国产芯片数据中心
- AI Coding 工具定价对比 (2026)
- LLM Stats:模型发布追踪
- AI Release Tracker