最重要 5 条
China Models1. DeepSeek-V4 Preview:低成本 1M context 成为中国开源模型竞争焦点
摘要:DeepSeek 官方发布 DeepSeek-V4 Preview,主打 “affordable million context length”,并宣布模型开源。
关键细节:官方页面强调 1M context length 与成本效率;DeepSeek 主页同时将 DeepSeek-V4、DeepSeek-R1、DeepSeek-Coder 列为核心开源模型线。
为什么重要:长上下文正在从 closed frontier model 的差异化能力转为开源/开放权重生态的标配。若 V4 的实际吞吐、KV cache 成本和长文档可靠性成立,会直接影响企业 RAG、代码库级 agent、法律/金融文档分析的模型选型。
Open Weights2. Qwen3.8-Max:阿里将 Max 级模型推向 2.4T 参数、1M context,并预告开源权重
摘要:阿里云/通义官方披露 Qwen3.8-Max,称其为 Qwen 系列迄今最强旗舰模型。
关键细节:官方材料称 Qwen3.8-Max 规模为 2.4 trillion parameters,支持 up to 1 million tokens context,在 Text Arena 排名第五、Vision Arena 排名第二;Qwen 博客还称这是首次开放 Qwen-Max-class 模型权重,权重计划随后发布。
为什么重要:Qwen 若兑现 Max 级开源权重,将进一步压缩闭源 API 与开源部署之间的能力差距,也会推动国内云厂商围绕模型 API、私有化部署和行业 agent 的商业化竞争。
Chips / Infra3. Marvell/Google 定制芯片交易:TPU 供应链更像“半开放平台”
摘要:Reuters 报道 Marvell 将帮助 Google 开发需求旺盛的定制芯片,并给予 Google 潜在价值 122 亿美元持股权利。
关键细节:报道定位为 Big Tech 与芯片供应商围绕定制 AI silicon 的最新大型交易;Google TPU 需求和外部半导体设计/制造合作继续深化。
为什么重要:AI 基础设施竞争正在从“买 GPU”扩展到“控制定制 ASIC、封装、内存、网络和融资”。对云客户而言,未来训练/推理价格曲线不只由 NVIDIA GPU 供给决定,Google TPU、AWS Trainium、AMD rack-scale 系统和定制 ASIC 都会形成价格压力。
Agentic Coding4. GitHub Copilot 周更:agent 任务管理和 agent app 计量成为企业化重点
摘要:GitHub Copilot 8 月更新集中在 CLI、agent 任务队列、agent app 活动指标和模型退役治理。
关键细节:8 月 10 日周更提到 Copilot CLI 可在 /tasks 管理 subagents 与任务,并在 agent turn 运行时排队 prompts、shell commands 和支持的 slash commands;8 月 7 日 Copilot usage metrics API 新增 agent app activity,可按 Claude、Codex 等 partner agents 拆分。
为什么重要:企业采用 coding agent 的瓶颈正从模型能力转向可观测性、权限边界、任务编排和成本归因。GitHub 将 agent 活动纳入 usage metrics,意味着 agent 已被当作工程组织内部的可管理生产资源。
Inference5. vLLM 继续强化推理服务:Adaptive Verification 与路由/多 LoRA 生态
摘要:vLLM 博客近期更新聚焦 serving 可靠性与吞吐,8 月 14 日发布 Adaptive Verification in vLLM: DSpark confidence-scheduled verification。
关键细节:vLLM 今年还推进 Semantic Router、KV offloading connector、WideEP/Blackwell serving、SageMaker/Bedrock 多 LoRA serving 等方向。
为什么重要:开源推理栈正在快速吸收闭源服务商的关键能力:动态验证、路由、多模型托管、KV 管理和 MoE serving。对企业而言,vLLM 的成熟度直接决定“自托管开源模型”能否在成本、延迟和可靠性上接近商业 API。