AI 日报 | 2026-07-22
聚焦最近 24–48 小时 AI 模型、Agent/AI coding、基础设施/芯片/算力、开源模型、中国 AI 生态与商业新闻。
面向熟悉 AI、技术与商业读者的 24–48 小时更新。本期重点:Copilot 模型菜单继续扩张、端侧/本地推理栈快速迭代、NVIDIA 把 graphics/simulation 与 agentic/physical AI 合并讲述,中国模型生态则以 API 迁移和多模态/Agent 产品化为主线。
今日概览
最重要 5 条
1. GitHub Copilot 接入 Gemini 3.6 Flash:更强调长程 agentic coding 与并行工具调用
摘要:GitHub Changelog 显示,Gemini 3.6 Flash 已开始在 GitHub Copilot 中滚动上线,面向 Web/app 开发、coding 和 longer-horizon agentic tasks。
关键细节:官方说明提到 configurable reasoning effort、parallel tool use;早期测试中相较 Gemini 3.5 Flash 在 coding/agentic workflow 上有更高 task-completion rate 与更好的 token efficiency。可用入口包括 VS Code、Visual Studio、Copilot CLI、GitHub Copilot cloud agent、Copilot app、JetBrains、Xcode、Eclipse;Copilot Business/Enterprise 管理员需启用 Gemini 3.6 Flash Preview policy。按 provider list pricing 进入 usage-based billing。
为什么重要:Copilot 正在成为多模型 agent runtime,而不是某一家模型的 IDE 插件。对企业来说,模型选择、预算控制、policy enablement 与 IDE/CLI/cloud agent 的一致性,正在变成 AI coding 平台采购的核心变量。
来源:https://github.blog/changelog/2026-07-21-gemini-3-6-flash-is-now-available-in-github-copilot/
2. llama.cpp 今日 release:OpenVINO 后端补齐动态加载宏,CUDA get_rows 做向量化优化
摘要:llama.cpp 在 7 月 21 日发布 b10077、b10076。b10077 修复 OpenVINO backend 缺失 GGML_BACKEND_DL_IMPL() 调用;b10076 对 CUDA same-type get_rows 路径做 int4 向量化。
关键细节:b10077 修复 issue #25586,补齐其他 backend 已有的动态加载宏。b10076 将每元素 scalar copy 改为在连续 same-type、16-byte 对齐等条件满足时使用 k_get_rows_float_vec,通过每线程复制一个 int4 降低 block 数;同时用 occupancy gate 避免小规模 gather 退化。
为什么重要:这类底层小优化与后端修复决定了本地推理生态的实际可用性。OpenVINO 对 Intel CPU/GPU/NPU 路径重要,CUDA gather 优化则影响量化权重/embedding lookup 等热点路径。
来源:https://github.com/ggml-org/llama.cpp/releases
3. NVIDIA SIGGRAPH:把 MCP、NIM、Cosmos 3 Edge 与 neural rendering 放进 physical AI 工作流
摘要:NVIDIA 在 SIGGRAPH 2026 发布/展示多项 graphics + simulation + AI 更新,包括 Model Context Protocol connections、Synthetic Video Detector NIM microservice、Cosmos 3 Edge open world model、NemoClaw on DGX Station with NVIDIA Agent Toolkit。
关键细节:官方博客称 keynote 聚焦 neural rendering、world models 和 simulation methods for AI, built by AI。SIGGRAPH 议程持续到 7 月 23 日,NVIDIA 将内容创作、媒体、机器人和物理 AI 放在同一条生产链:生成世界、验证世界、再用世界训练/驱动 agents。
为什么重要:MCP 出现在内容创作与仿真工具链中,说明“agent 可调用工具/上下文协议”正在从软件工程扩展到 DCC、仿真、机器人数据生成。NIM 微服务则继续把模型能力产品化为可部署单元。
来源:https://blogs.nvidia.com/blog/siggraph-news-2026/
4. 中国模型生态:DeepSeek 旧 API 名停用临近,MiniMax 发布 Music-3.0,M3 继续强调 Agent/代码/长上下文
摘要:DeepSeek API 文档提示 deepseek-chat 与 deepseek-reasoner 将于 2026-07-24 停用,目前分别映射到 deepseek-v4-flash 的非思考/思考模式;MiniMax 开放平台 7 月 16 日发布 Music-3.0,并继续把 MiniMax-M3 定位为面向 Agent 推理、工具调用、代码、多模态 Chat 输入和长上下文任务的语言模型。
关键细节:DeepSeek V4-Pro/V4-Flash 已通过 OpenAI ChatCompletions 与 Anthropic interface 提供;MiniMax 模型发布页显示 M3 于 6 月 1 日发布,M2.7 于 3 月 18 日发布,7 月 16 日更新集中在音乐生成。检索 Moonshot 官网显示 Kimi K3/K2.6、多模态与百万 token 上下文仍是主线;智谱官网强调 GLM-5.2 在 Artificial Analysis 综合榜单得分 51、进入前三。
为什么重要:中国生态近期的重点更像“产品化与 API 稳定迁移”而非单点发布。对开发者而言,旧 alias 停用、模型名迁移、跨 OpenAI/Anthropic 兼容接口和云平台模型目录,比 benchmark headline 更直接影响生产系统。
来源:https://api-docs.deepseek.com/updates/ ,https://platform.minimaxi.com/docs/release-notes/models ,https://www.moonshot.cn/ ,https://www.zhipuai.cn/
5. vLLM 0.25.x:MRv2 默认化后进入修补期,继续围绕 dense model serving、FP8 MoE、Transformers backend 性能
摘要:vLLM v0.25.1 是 0.25.0 之后的补丁 release,修复 TorchCodec 在缺少 system FFmpeg 时阻塞模型启动,以及 mixed-dtype allreduce RMSNorm quant fusion 的匹配问题。
关键细节:0.25.0 的大变化包括 Model Runner V2 成为 dense models 默认路径、移除 legacy PagedAttention、Transformers modeling backend 性能接近 native vLLM,并加入 FP8 MoE、EVS、realtime embeddings、Mamba hybrid prefix caching、多模态 prefix bidirectional attention、dynamic speculative decoding + full CUDA graphs 等。
为什么重要:vLLM 正在从“高吞吐 serving 框架”演进成复杂模型形态的统一 runtime。MRv2 默认化意味着后续性能/功能优化会集中到新执行路径;补丁修复说明生产部署的依赖链仍很脆弱,尤其是多模态编解码和 fusion pattern。
来源:https://github.com/vllm-project/vllm/releases/tag/v0.25.1
其他值得关注
来源链接清单
1. GitHub Copilot 接入 Gemini 3.6 Flash(2026-07-21)— https://github.blog/changelog/2026-07-21-gemini-3-6-flash-is-now-available-in-github-copilot/
2. llama.cpp 发布 b10077 / b10076,OpenVINO 后端修复与 CUDA get_rows 向量化(2026-07-21)— https://github.com/ggml-org/llama.cpp/releases
3. NVIDIA 在 SIGGRAPH 推进 agentic/physical AI:MCP 连接、Synthetic Video Detector NIM、Cosmos 3 Edge(2026-07-20)— https://blogs.nvidia.com/blog/siggraph-news-2026/
4. Cloudflare 近期 AI 平台方向:Workers AI 大模型、AI Gateway 统一推理层与 AI 流量治理(2026-07)— https://blog.cloudflare.com/ai-platform/
5. MiniMax 开放平台 7 月 16 日发布 Music-3.0,M3 继续作为 Frontier Coding/Agent 模型主线(2026-07-16)— https://platform.minimaxi.com/docs/release-notes/models
6. DeepSeek API 旧模型名 deepseek-chat / deepseek-reasoner 将于 2026-07-24 停用(2026-07-24 deadline)— https://api-docs.deepseek.com/updates/
7. vLLM v0.25.1 补丁发布,修复 TorchCodec/FFmpeg 启动阻塞与 mixed-dtype RMSNorm fusion(2026-07-14)— https://github.com/vllm-project/vllm/releases/tag/v0.25.1
8. OpenAI 7 月 GPT-5.6 与“AI age scorecard”继续强化模型成本/能力透明度叙事(2026-07-17)— https://openai.com/index/a-scorecard-for-the-ai-age/
9. GitHub Copilot repository-level usage metrics GA:coding agent / code review 活动下钻到仓库(2026-07-17)— https://github.blog/changelog/2026-07-17-repository-level-github-copilot-usage-metrics-generally-available/
10. NVIDIA 推 AI clouds 收入分成与信用支持模式,服务多租户 AI factories(2026-07-01)— https://blogs.nvidia.com/blog/nvidia-unlocks-ai-compute-at-scale-capital-partners-to-power-ai-infrastructure-buildout/