AI 日报 | 2026-09-01
核心条目
核心来源/入口
模型、Agent、推理算力、中国生态
过去两天的主线不是单个“震撼模型”,而是中国模型厂商把 Agent/API 兼容和成本效率放到前台,前沿 API 定价下行,推理硬件与 serving runtime 围绕长上下文和 token 成本重构。
最重要 5 条
1. DeepSeek V4-Pro / V4-Flash 转向 Agent 与 OpenAI Responses API 兼容
摘要:DeepSeek 官网与 API changelog 显示,V4-Pro 已正式发布,V4-Flash API 进入公开 beta,重点是增强 agent 能力、可调 reasoning effort,并支持 Responses API / Codex 集成。
关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。
为什么重要:这意味着中国模型厂商不再只卷聊天与榜单,而是在主动贴近 agent harness、代码代理与生产工作流接口标准。
来源:https://deepseek.com/en/index.html; https://api-docs.deepseek.com/updates/
2. Qwen3.8-Flash-Next:成本压缩与 coding/office 能力并进
摘要:QwenLM GitHub 显示 2026-08-26 发布 Qwen3.8-Flash-Next,相比 Qwen3.7-Plus 训练/推理成本约为 1/9,同时在 coding 与 office tasks 上提升。Qwen3.8 仓库也宣称首次将 Qwen-Max-class 模型开放发布。
关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。
为什么重要:开源/可下载权重如果能接近旗舰闭源能力,将继续压低企业私有部署与中国云上模型服务价格。
来源:https://github.com/QwenLM/Qwen3.8-Flash-Next/; https://github.com/QwenLM/Qwen3.8
3. NVIDIA 推 Vera Rubin LPX/CPX:长上下文 agent 推理成为硬件叙事核心
摘要:NVIDIA 近期博客称 agentic AI 会产生更长上下文、更高系统间通信和更多数据源访问,Vera Rubin LPX、CPX、Spectrum-X 与 NVLink Fusion 面向降低 token 成本与提升推理吞吐。
关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。
为什么重要:算力瓶颈从训练扩展到长上下文推理与 agent runtime,硬件路线开始围绕 KV cache、互联和低延迟服务设计。
来源:https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/
4. Anthropic 将 Claude Sonnet 5 低价永久化
摘要:Anthropic Claude Sonnet 5 页面更新称,原 introductory pricing($2/M input、$10/M output)改为永久价格,原定 9 月 1 日恢复的 $3/$15 不再适用。
关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。
为什么重要:模型能力竞争之外,前沿模型 API 价格继续下行;对 coding agent、RAG 和企业自动化的边际成本影响直接。
来源:https://www.anthropic.com/news/claude-sonnet-5
5. vLLM / llama.cpp 持续快速迭代,推理软件栈仍是开源模型落地关键层
摘要:GitHub release 页面显示 vLLM 最新 release notes 包含数百提交与大量贡献者;llama.cpp release 持续围绕多后端 artifact、server 和平台兼容修复。
关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。
为什么重要:模型发布频率很高,但实际生产性能依赖 serving runtime;vLLM 与 llama.cpp 仍分别代表云端高吞吐和本地/边缘部署的关键基础设施。
来源:https://github.com/vllm-project/vllm/releases; https://github.com/ggml-org/llama.cpp/releases
其他值得关注
- OpenAI ChatGPT Ads 扩展欧洲:OpenAI 8 月公告称广告将面向 Free/Go 计划用户扩展,Plus/Pro/Enterprise 保持无广告。 来源:https://openai.com/index/chatgpt-ads-expands-across-europe/
- OpenAI 推 ChatGPT for Teens:OpenAI 与 CodeAI 宣布面向学生和教育者的工具与资源合作。 来源:https://openai.com/index/chatgpt-for-teens/
- Kimi / Moonshot 仍主推 Kimi K2.6/K3、多模态和复杂工作流:Moonshot 官网展示 Kimi K3、PerceptionBench、K2.6,并强调深度研究、一键建站、表格和 PPT 自主编辑。 来源:https://www.moonshot.cn/
- GLM-5.3-Flash 在第三方模型发布跟踪中列为 8 月底新模型:AI Release Tracker 记录 Z.ai GLM-5.3-Flash 发布于 2026-08-26;需继续追踪官方细节。 来源:https://aireleasetracker.com/
来源链接
- https://deepseek.com/en/index.html
- https://api-docs.deepseek.com/updates/
- https://github.com/QwenLM/Qwen3.8-Flash-Next/
- https://github.com/QwenLM/Qwen3.8
- https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/
- https://www.anthropic.com/news/claude-sonnet-5
- https://github.com/vllm-project/vllm/releases
- https://github.com/ggml-org/llama.cpp/releases
- https://openai.com/index/chatgpt-ads-expands-across-europe/
- https://openai.com/index/chatgpt-for-teens/
- https://www.moonshot.cn/
- https://aireleasetracker.com/