北京日期 · 2026-08-13

AI 日报 | 2026-08-13

今天的主线不是单一模型发布,而是三条结构性变化叠加:Google 继续围绕 Gemini 重排 DeepMind 执行链路;Claude Code 等 coding agent 的商业化规模变得更清晰;中国模型与本地/云端推理基础设施继续通过 Qwen、Ollama、vLLM 等渠道扩散。

模型
Gemini / Claude / Qwen
Agent & Coding
Claude Code / Bedrock AgentCore
Infra
vLLM / Ollama / DGX Spark

最重要与值得关注

1

Google DeepMind 管理层重排:Koray Kavukcuoglu 接手前沿模型推进

摘要:Reuters/CNBC 报道,Google 在 Gemini 竞争压力下调整 DeepMind 领导分工;Sergey Brin 近月推动关键 AI 团队更集中投入 Gemini,Koray Kavukcuoglu 承担更直接的前沿 AI 推进职责。

为什么重要:这不是单纯人事新闻,而是 Google 把研究、产品化与算力调度进一步压到 Gemini 主线的信号。对开发者和企业客户而言,Gemini API、Workspace/Cloud AI 与 TPU 供给可能更紧密绑定。

来源:www.reuters.com/world/inside-google-executive- | www.cnbc.com/2026/08/12/google-deepmind-koray-

2

Anthropic 新闻流继续凸显 Claude Code 商业化:Run-rate 已达数十亿美元级

摘要:Anthropic 新闻页近期披露 Claude Opus 5、Claude 金融服务以及融资相关信息;其中融资稿提到 Claude Code 于 2025 年 5 月面向公众开放,run-rate revenue 已超过 25 亿美元,且 2026 年以来翻倍。

为什么重要:AI coding/agent 已从“提高个人效率的 IDE 插件”进入大额企业预算和平台分发阶段。Claude Code 的收入规模意味着 coding agent 正在成为前沿模型商业化最快的落地面。

来源:www.anthropic.com/news | www.anthropic.com/news/anthropic-raises-30-bil

3

Alibaba Qwen3.8-Max:2.4T 参数、1M context,继续推进中国闭源/开放生态混合打法

摘要:Alibaba 官方 8 月 3 日宣布 Qwen3.8-Max,称其为 Qwen 系列迄今最强模型,2.4 万亿参数、最高 100 万 token 上下文,并在 Text Arena 排名第五、Vision Arena 第二。

为什么重要:虽然不是 24 小时内发布,但仍是本周中国模型生态的核心基准点:Qwen 正把超长上下文、多模态、coding 与云 API 分发合并为一个平台叙事,对 DeepSeek、Kimi、GLM、MiniMax 形成直接压力。

来源:www.alibabacloud.com/en/press-room/alibaba-unv

4

Ollama release 流水线继续围绕中国模型与本地 agent 场景迭代

摘要:Ollama GitHub releases 摘要显示,近期支持/更新涉及 Kimi、GLM、MiniMax、DeepSeek、gpt-oss、Qwen、Gemma 等模型,并包含 “ollama launch for Claude Code disables telemetry by default”、MLX 与 llama.cpp engine 更新等细节。

为什么重要:本地推理层正在从“模型下载器”演化成 agent/coding 工具链的运行时。中国开源/开放权重模型能被 Ollama、llama.cpp、MLX 快速消费,是其全球开发者扩散的关键通道。

来源:github.com/ollama/ollama/releases

5

vLLM release 节奏保持高密度:推理基础设施仍在围绕吞吐、兼容性和新模型快速追赶

摘要:vLLM releases 页面显示 v0.27.0 release notes,包含 561 commits、242 contributors(64 new)的贡献规模。

为什么重要:vLLM 是云厂商、模型服务商和企业自建推理栈的重要底座。贡献者规模和提交密度说明推理优化仍是 AI infra 的主战场,尤其在长上下文、多模态和 MoE 模型成本压力下。

来源:github.com/vllm-project/vllm/releases

6

AWS Bedrock/AgentCore/Strands Agents 内容持续增加,云厂商将 agent 纳入托管服务栈

摘要:AWS ML Blog 分类页近期内容包括 Strands Agents、多 agent 视频处理、Amazon Bedrock AgentCore Memory、Cisco 与 AWS 针对 AI agent 安全/治理的合作方案等。

为什么重要:企业 agent 的瓶颈不只在模型能力,而在记忆、权限、审计、可观测性和合规。AWS 把这些能力包装进 Bedrock/AgentCore,代表云平台正把 agent workflow 变成标准托管产品。

来源:aws.amazon.com/blogs/machine-learning/category

7

AI 芯片/算力:NVIDIA 个人 AI 超算与 Google TPU 叙事继续强化“专用算力 + 开发者入口”

摘要:NVIDIA 官网继续重点展示 DGX Spark:Grace Blackwell 桌面 AI 超算、128GB unified memory、可在本地处理最高约 200B 参数模型;同时 Google TPU 与 Anthropic/Google Cloud 绑定成为市场关注点。

为什么重要:算力竞争正在双线展开:一边是 hyperscaler 级 TPU/GPU 集群与大客户锁定,另一边是桌面/边缘大内存设备承接私有化与本地 agent。模型越长上下文、越 agentic,推理侧内存和带宽越成为采购核心。

来源:marketplace.nvidia.com/en-us/enterprise/person | www.nvidia.com/en-us/

生态观察