AI 日报 | 2026-08-22

北京时间 06:30 自动生成 · 面向 AI/技术/商业读者

过去 24–48 小时的 AI 更新主线不是单点模型跃迁,而是“模型能力下沉到可部署系统”:DeepSeek 给 V4 Flash 增加视觉入口,Copilot 把模型选择和 Agent Plugins 标准化,Cloudflare 继续把 AI Gateway/Workers AI 收敛成控制平面,vLLM 则在 DeepSeek-V4、FlashAttention 4、模型 runner 与结构化 tool calling 上做工程加速。

ModelsAgentsAI CodingInferenceChina AIInfra

今日概览

DeepSeek V4 Flash Vision Exp:多模态、长上下文、低价 MoE。
GitHub Copilot:Kimi K3、MAI-Code-1.1-Flash、Agent Plugins 1.0。
Cloudflare:Workers AI + AI Gateway 统一控制平面。
vLLM:DeepSeek-V4 serving、FA4、tool calling、runner warmup。

最重要 4 条

DeepSeek-V4-Flash-Vision-Exp 上线:V4 Flash 进入多模态实验阶段

摘要:DeepSeek API changelog 2026-08-21 宣布 DeepSeek-V4-Flash-Vision-Exp,可通过 model=deepseek-v4-flash-vision-exp 调用。

关键细节:官方列出 Terminal Bench 2.1 83.9、NL2Repo 57.7、DeepSWE 59.3、DSBench-Hard 63.6、AutomationBench 25.7、ApexBench Pass@1 36.5、Agents’ Last Exam 27.3、Chartography 64.3、ZeroBench Pass@5 35.0。OpenRouter 页面显示 284B total / 13B active MoE,1,048,576 context,最高 384,000 output,$0.22/$0.66 per 1M input/output tokens。

为什么重要:DeepSeek 正把长上下文、agent/code benchmark 与视觉理解合并到低价 MoE SKU;如果实验版稳定,文档/图表理解、多模态 agent workflow 的成本曲线会继续被中国模型压低。

来源:https://api-docs.deepseek.com/updates/;https://openrouter.ai/deepseek/deepseek-v4-flash-vision-exp

GitHub Copilot 周更:Kimi K3、MAI-Code-1.1-Flash 与 Agent Plugins 1.0

摘要:GitHub Changelog 2026-08-13 的 Copilot weekly release 把“更多模型 + 可移植插件 + 更顺滑 agent workflow”作为主线。

关键细节:Kimi K3 rollout 到 Copilot Pro/Pro+/Max/Business/Enterprise;MAI-Code-1.1-Flash 加入原生图像理解,并提升 coding quality、instruction following、tool use、performance;Agent Plugins 1.0 GA,覆盖 VS Code、Copilot CLI、GitHub Copilot SDK、Copilot app。

为什么重要:Copilot 正从 IDE 补全产品变成多模型、多宿主 agent runtime。Agent Plugins 1.0 把插件从单一编辑器资产变成跨 CLI、SDK、App 的组织级能力封装。

来源:https://github.blog/changelog/2026-08-13-github-copilot-weekly-releases-august-10/

Cloudflare 合并 Workers AI 与 AI Gateway:AI 控制平面成基础设施卖点

摘要:Cloudflare 8 月 Agents Week 宣布统一 AI Gateway 和 Workers AI,目标是把托管 GPU 与外部 provider 的 observability、billing、dynamic routing 收进一个控制面。

关键细节:官方描述包括 unified bindings、model-first routing、跨 managed GPUs 与 external providers 的韧性 AI 应用构建;这与 Cloudflare 以 Workers/Durable Objects 做 agent runtime 的路线一致。

为什么重要:企业部署 agent 时,模型本身只是变量之一;成本、路由、日志、回退、限流和合规控制逐渐成为平台锁定点。Cloudflare 的动作说明 edge/serverless 厂商正在争夺“模型中立控制平面”。

来源:https://blog.cloudflare.com/workers-ai-gateway-unification/

vLLM release 继续压榨推理栈:DeepSeek-V4、FA4、Model Runner V2、结构化工具调用

摘要:vLLM releases 页面显示近期版本围绕新模型、内核 warmup、DeepSeek-V4 性能、非生成式 workload、tool calling 做大量优化。

关键细节:Qwen3.5 dense/MoE、K-EXAONE-2.0-750B-A37B、VaultGemma、jina-embeddings-v5-text-nano;FlashAttention 4 on SM100 支持 FP8 KV cache 与 headdim-256,并引入 JIT/runner-owned Triton kernel warmup;DeepSeek-V4 有 sequence parallelism、跳过空 c128 launch、workspace reuse、compact MXFP4 indexer KV cache 等优化;XGrammar 0.2.0 支持 strict tool calling + reasoning 的 structural tags。

为什么重要:前沿模型竞争正在转移到 serving economics。TTFT、KV cache、首请求编译、结构化工具调用可靠性,会直接决定 agent 产品的延迟、成本和可维护性。

来源:https://github.com/vllm-project/vllm/releases

其他值得关注