AI 日报 | 2026-07-22

聚焦最近 24–48 小时 AI 模型、Agent/AI coding、基础设施/芯片/算力、开源模型、中国 AI 生态与商业新闻。

北京时间 06:30核心来源 10 条文章式静态页
面向熟悉 AI、技术与商业读者的 24–48 小时更新。本期重点:Copilot 模型菜单继续扩张、端侧/本地推理栈快速迭代、NVIDIA 把 graphics/simulation 与 agentic/physical AI 合并讲述,中国模型生态则以 API 迁移和多模态/Agent 产品化为主线。

今日概览

  • Agentic coding 的竞争从“单一模型能力”转向模型路由、工具并行、组织治理和可观测性:GitHub Copilot 新增 Gemini 3.6 Flash,并在上周把仓库级 usage metrics GA。
  • 本地与开源推理基础设施仍在高频发布:llama.cpp 今日连续 release,vLLM 0.25.x 线进入 MRv2 默认化后的修补期。
  • NVIDIA 在 SIGGRAPH 把 neural rendering、world models、simulation、MCP 与 NIM 服务放在同一叙事中,说明“生成内容”与“训练物理 AI 的仿真世界”正在靠拢。
  • 中国 AI 生态没有看到过去 24 小时内的单一重磅基础模型发布,但 DeepSeek 旧 API 名称停用临近、MiniMax Music-3.0 发布、Kimi/GLM/Doubao/MiniMax/DeepSeek 等模型在云平台目录中继续被打包为可切换能力。
  • 最重要 5 条

    1. GitHub Copilot 接入 Gemini 3.6 Flash:更强调长程 agentic coding 与并行工具调用

    摘要:GitHub Changelog 显示,Gemini 3.6 Flash 已开始在 GitHub Copilot 中滚动上线,面向 Web/app 开发、coding 和 longer-horizon agentic tasks。

    关键细节:官方说明提到 configurable reasoning effort、parallel tool use;早期测试中相较 Gemini 3.5 Flash 在 coding/agentic workflow 上有更高 task-completion rate 与更好的 token efficiency。可用入口包括 VS Code、Visual Studio、Copilot CLI、GitHub Copilot cloud agent、Copilot app、JetBrains、Xcode、Eclipse;Copilot Business/Enterprise 管理员需启用 Gemini 3.6 Flash Preview policy。按 provider list pricing 进入 usage-based billing。

    为什么重要:Copilot 正在成为多模型 agent runtime,而不是某一家模型的 IDE 插件。对企业来说,模型选择、预算控制、policy enablement 与 IDE/CLI/cloud agent 的一致性,正在变成 AI coding 平台采购的核心变量。

    来源https://github.blog/changelog/2026-07-21-gemini-3-6-flash-is-now-available-in-github-copilot/

    2. llama.cpp 今日 release:OpenVINO 后端补齐动态加载宏,CUDA get_rows 做向量化优化

    摘要:llama.cpp 在 7 月 21 日发布 b10077、b10076。b10077 修复 OpenVINO backend 缺失 GGML_BACKEND_DL_IMPL() 调用;b10076 对 CUDA same-type get_rows 路径做 int4 向量化。

    关键细节:b10077 修复 issue #25586,补齐其他 backend 已有的动态加载宏。b10076 将每元素 scalar copy 改为在连续 same-type、16-byte 对齐等条件满足时使用 k_get_rows_float_vec,通过每线程复制一个 int4 降低 block 数;同时用 occupancy gate 避免小规模 gather 退化。

    为什么重要:这类底层小优化与后端修复决定了本地推理生态的实际可用性。OpenVINO 对 Intel CPU/GPU/NPU 路径重要,CUDA gather 优化则影响量化权重/embedding lookup 等热点路径。

    来源https://github.com/ggml-org/llama.cpp/releases

    3. NVIDIA SIGGRAPH:把 MCP、NIM、Cosmos 3 Edge 与 neural rendering 放进 physical AI 工作流

    摘要:NVIDIA 在 SIGGRAPH 2026 发布/展示多项 graphics + simulation + AI 更新,包括 Model Context Protocol connections、Synthetic Video Detector NIM microservice、Cosmos 3 Edge open world model、NemoClaw on DGX Station with NVIDIA Agent Toolkit。

    关键细节:官方博客称 keynote 聚焦 neural rendering、world models 和 simulation methods for AI, built by AI。SIGGRAPH 议程持续到 7 月 23 日,NVIDIA 将内容创作、媒体、机器人和物理 AI 放在同一条生产链:生成世界、验证世界、再用世界训练/驱动 agents。

    为什么重要:MCP 出现在内容创作与仿真工具链中,说明“agent 可调用工具/上下文协议”正在从软件工程扩展到 DCC、仿真、机器人数据生成。NIM 微服务则继续把模型能力产品化为可部署单元。

    来源https://blogs.nvidia.com/blog/siggraph-news-2026/

    4. 中国模型生态:DeepSeek 旧 API 名停用临近,MiniMax 发布 Music-3.0,M3 继续强调 Agent/代码/长上下文

    摘要:DeepSeek API 文档提示 deepseek-chatdeepseek-reasoner 将于 2026-07-24 停用,目前分别映射到 deepseek-v4-flash 的非思考/思考模式;MiniMax 开放平台 7 月 16 日发布 Music-3.0,并继续把 MiniMax-M3 定位为面向 Agent 推理、工具调用、代码、多模态 Chat 输入和长上下文任务的语言模型。

    关键细节:DeepSeek V4-Pro/V4-Flash 已通过 OpenAI ChatCompletions 与 Anthropic interface 提供;MiniMax 模型发布页显示 M3 于 6 月 1 日发布,M2.7 于 3 月 18 日发布,7 月 16 日更新集中在音乐生成。检索 Moonshot 官网显示 Kimi K3/K2.6、多模态与百万 token 上下文仍是主线;智谱官网强调 GLM-5.2 在 Artificial Analysis 综合榜单得分 51、进入前三。

    为什么重要:中国生态近期的重点更像“产品化与 API 稳定迁移”而非单点发布。对开发者而言,旧 alias 停用、模型名迁移、跨 OpenAI/Anthropic 兼容接口和云平台模型目录,比 benchmark headline 更直接影响生产系统。

    来源https://api-docs.deepseek.com/updates/https://platform.minimaxi.com/docs/release-notes/modelshttps://www.moonshot.cn/https://www.zhipuai.cn/

    5. vLLM 0.25.x:MRv2 默认化后进入修补期,继续围绕 dense model serving、FP8 MoE、Transformers backend 性能

    摘要:vLLM v0.25.1 是 0.25.0 之后的补丁 release,修复 TorchCodec 在缺少 system FFmpeg 时阻塞模型启动,以及 mixed-dtype allreduce RMSNorm quant fusion 的匹配问题。

    关键细节:0.25.0 的大变化包括 Model Runner V2 成为 dense models 默认路径、移除 legacy PagedAttention、Transformers modeling backend 性能接近 native vLLM,并加入 FP8 MoE、EVS、realtime embeddings、Mamba hybrid prefix caching、多模态 prefix bidirectional attention、dynamic speculative decoding + full CUDA graphs 等。

    为什么重要:vLLM 正在从“高吞吐 serving 框架”演进成复杂模型形态的统一 runtime。MRv2 默认化意味着后续性能/功能优化会集中到新执行路径;补丁修复说明生产部署的依赖链仍很脆弱,尤其是多模态编解码和 fusion pattern。

    来源https://github.com/vllm-project/vllm/releases/tag/v0.25.1

    其他值得关注

  • **GitHub Copilot 仓库级 usage metrics GA**:新增 enterprise/org 两个 REST API endpoint,按天返回每仓库 Copilot coding agent 创建/合并 PR、Copilot code review suggestion 类型等。对 AI-readiness reporting 和 enablement targeting 很关键。来源:https://github.blog/changelog/2026-07-17-repository-level-github-copilot-usage-metrics-generally-available/
  • **NVIDIA AI clouds 商业模式**:NVIDIA 7 月 1 日宣布与 AI clouds 通过 revenue-sharing 和 credit-support 支持多租户 AI factories,除标准产品收入外分享云服务收入。来源:https://blogs.nvidia.com/blog/nvidia-unlocks-ai-compute-at-scale-capital-partners-to-power-ai-infrastructure-buildout/
  • **Cloudflare AI 平台方向**:近期博客强调 AI Gateway 统一推理层、Workers AI 大模型承载、AI 流量治理/monetization。虽然过去 24 小时没有看到新的 Workers AI 模型发布,但其“推理入口 + 网络边缘 + AI crawler 控制”组合值得持续跟踪。来源:https://blog.cloudflare.com/ai-platform/
  • **OpenAI 7 月主线**:搜索结果显示 OpenAI 7 月发布 GPT-5.6、GPT-Live、ChatGPT Work 和 “A scorecard for the AI age”。OpenAI 官网部分页面抓取受 403 限制,本期仅把它作为近期背景,不作为重点未核验条目展开。来源:https://openai.com/index/gpt-5-6/ ,https://openai.com/index/a-scorecard-for-the-ai-age/
  • 来源链接清单

    1. GitHub Copilot 接入 Gemini 3.6 Flash(2026-07-21)— https://github.blog/changelog/2026-07-21-gemini-3-6-flash-is-now-available-in-github-copilot/

    2. llama.cpp 发布 b10077 / b10076,OpenVINO 后端修复与 CUDA get_rows 向量化(2026-07-21)— https://github.com/ggml-org/llama.cpp/releases

    3. NVIDIA 在 SIGGRAPH 推进 agentic/physical AI:MCP 连接、Synthetic Video Detector NIM、Cosmos 3 Edge(2026-07-20)— https://blogs.nvidia.com/blog/siggraph-news-2026/

    4. Cloudflare 近期 AI 平台方向:Workers AI 大模型、AI Gateway 统一推理层与 AI 流量治理(2026-07)— https://blog.cloudflare.com/ai-platform/

    5. MiniMax 开放平台 7 月 16 日发布 Music-3.0,M3 继续作为 Frontier Coding/Agent 模型主线(2026-07-16)— https://platform.minimaxi.com/docs/release-notes/models

    6. DeepSeek API 旧模型名 deepseek-chat / deepseek-reasoner 将于 2026-07-24 停用(2026-07-24 deadline)— https://api-docs.deepseek.com/updates/

    7. vLLM v0.25.1 补丁发布,修复 TorchCodec/FFmpeg 启动阻塞与 mixed-dtype RMSNorm fusion(2026-07-14)— https://github.com/vllm-project/vllm/releases/tag/v0.25.1

    8. OpenAI 7 月 GPT-5.6 与“AI age scorecard”继续强化模型成本/能力透明度叙事(2026-07-17)— https://openai.com/index/a-scorecard-for-the-ai-age/

    9. GitHub Copilot repository-level usage metrics GA:coding agent / code review 活动下钻到仓库(2026-07-17)— https://github.blog/changelog/2026-07-17-repository-level-github-copilot-usage-metrics-generally-available/

    10. NVIDIA 推 AI clouds 收入分成与信用支持模式,服务多租户 AI factories(2026-07-01)— https://blogs.nvidia.com/blog/nvidia-unlocks-ai-compute-at-scale-capital-partners-to-power-ai-infrastructure-buildout/