AI 日报 | 2026-09-01

北京时间 2026-09-01 · 最近 24–48 小时 AI 产业与技术更新
5
核心条目
9
核心来源/入口
重点
模型、Agent、推理算力、中国生态

过去两天的主线不是单个“震撼模型”,而是中国模型厂商把 Agent/API 兼容和成本效率放到前台,前沿 API 定价下行,推理硬件与 serving runtime 围绕长上下文和 token 成本重构。

最重要 5 条

1. DeepSeek V4-Pro / V4-Flash 转向 Agent 与 OpenAI Responses API 兼容

摘要:DeepSeek 官网与 API changelog 显示,V4-Pro 已正式发布,V4-Flash API 进入公开 beta,重点是增强 agent 能力、可调 reasoning effort,并支持 Responses API / Codex 集成。

关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。

为什么重要:这意味着中国模型厂商不再只卷聊天与榜单,而是在主动贴近 agent harness、代码代理与生产工作流接口标准。

来源:https://deepseek.com/en/index.html; https://api-docs.deepseek.com/updates/

2. Qwen3.8-Flash-Next:成本压缩与 coding/office 能力并进

摘要:QwenLM GitHub 显示 2026-08-26 发布 Qwen3.8-Flash-Next,相比 Qwen3.7-Plus 训练/推理成本约为 1/9,同时在 coding 与 office tasks 上提升。Qwen3.8 仓库也宣称首次将 Qwen-Max-class 模型开放发布。

关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。

为什么重要:开源/可下载权重如果能接近旗舰闭源能力,将继续压低企业私有部署与中国云上模型服务价格。

来源:https://github.com/QwenLM/Qwen3.8-Flash-Next/; https://github.com/QwenLM/Qwen3.8

3. NVIDIA 推 Vera Rubin LPX/CPX:长上下文 agent 推理成为硬件叙事核心

摘要:NVIDIA 近期博客称 agentic AI 会产生更长上下文、更高系统间通信和更多数据源访问,Vera Rubin LPX、CPX、Spectrum-X 与 NVLink Fusion 面向降低 token 成本与提升推理吞吐。

关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。

为什么重要:算力瓶颈从训练扩展到长上下文推理与 agent runtime,硬件路线开始围绕 KV cache、互联和低延迟服务设计。

来源:https://blogs.nvidia.com/blog/vera-rubin-lpx-spectrum-x-nvlink-fusion/

4. Anthropic 将 Claude Sonnet 5 低价永久化

摘要:Anthropic Claude Sonnet 5 页面更新称,原 introductory pricing($2/M input、$10/M output)改为永久价格,原定 9 月 1 日恢复的 $3/$15 不再适用。

关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。

为什么重要:模型能力竞争之外,前沿模型 API 价格继续下行;对 coding agent、RAG 和企业自动化的边际成本影响直接。

来源:https://www.anthropic.com/news/claude-sonnet-5

5. vLLM / llama.cpp 持续快速迭代,推理软件栈仍是开源模型落地关键层

摘要:GitHub release 页面显示 vLLM 最新 release notes 包含数百提交与大量贡献者;llama.cpp release 持续围绕多后端 artifact、server 和平台兼容修复。

关键细节:保留接口兼容、reasoning effort、coding/office、长上下文推理、token 成本等生产指标,而非只看通用榜单。

为什么重要:模型发布频率很高,但实际生产性能依赖 serving runtime;vLLM 与 llama.cpp 仍分别代表云端高吞吐和本地/边缘部署的关键基础设施。

来源:https://github.com/vllm-project/vllm/releases; https://github.com/ggml-org/llama.cpp/releases

其他值得关注

来源链接