AI 日报 | 2026-07-28

最近 24–48 小时 · 模型 / Agent / Coding / Infra / 中国生态 / 商业

今天的主线是:中国 open-weight 模型继续施压前沿闭源模型;美国大厂把模型速度、企业 agent 产品与算力平台绑定;基础设施层从 GPU 架构到 serverless inference 都在围绕 agentic workload 重构。

今日概览

Kimi K3 权重释放窗口到来
OpenAI 推 GPT-5.6 Sol 与 Presence
Cloudflare Workers AI 承接大模型
NVIDIA Rubin 面向 AI factory
Qwen Code 强化 agent workflow

最重要 5 条

1

Moonshot/Kimi K3 权重按计划开放下载

摘要:Moonshot 在 Kimi K3 技术博客中预告完整模型权重于 7 月 27 日释放,并称后续技术报告会披露架构、训练和评测细节;Bloomberg 同日报道称该模型的基准表现已触发市场重新评估中美前沿模型差距。

为什么重要:这是过去 24 小时最值得关注的中国开源模型事件:如果权重、报告和许可如期落地,Kimi 将从 API/产品竞争进一步进入可复现的 open-weight 生态竞争,对 Qwen、DeepSeek、GLM 以及海外闭源 API 形成价格和部署压力。

来源:Kimi K3 Tech Blog / Bloomberg

2

OpenAI 预览 GPT-5.6 Sol,并把 Presence 定位为企业 Agent 产品

摘要:OpenAI 近期发布 GPT-5.6 家族后,又预览 GPT-5.6 Sol,强调在 Cerebras 上可达最高 750 tokens/s;7 月 22 日还发布 OpenAI Presence,定位为把 AI agents 落到客户与内部工作流的企业产品。

为什么重要:OpenAI 的重点不只是模型质量,而是延迟/吞吐与企业 workflow 的产品化。高速推理会改变 coding、客服、运营 agent 的交互预算;Presence 则显示大厂正在把“agent 可用性”从 demo 推向流程、权限和集成。

来源:OpenAI

3

Cloudflare Workers AI 进入“大模型”推理,首批上线 Kimi K2.5

摘要:Cloudflare 称 Workers AI 正式进入大模型阶段,开始在其 inference platform 上提供前沿开源模型,首个例子是 Moonshot AI 的 Kimi K2.5;同时 Agents Week 期间还更新了 Agents SDK、结构化输出、tool calling 和更长上下文窗口。

为什么重要:边缘/无服务器平台正在从“调用外部模型”转向“模型与 agent runtime 同栈部署”。对开发者而言,推理、tool、状态、网关和安全策略被平台打包,可能压低构建 agent 服务的运维门槛。

来源:Cloudflare Blog

4

NVIDIA 技术博客详解 Rubin GPU 架构,继续押注 agentic AI factory

摘要:NVIDIA 7 月 21 日文章《Inside NVIDIA Rubin GPU Architecture: Powering the Era of Agentic AI》把 Rubin 描述为面向常驻式 AI factory 的架构演进;此前 Vera Rubin NVL72 被定位为 rack-scale accelerator。

为什么重要:算力叙事从单次训练/聊天推理转向持续生产 intelligence 的“工厂”。这会影响集群网络、内存层级、功耗、调度和多租户推理的设计,也解释了 hyperscaler 与模型公司的长期 compute deal。

来源:NVIDIA Developer Blog

5

Qwen 生态继续把模型与 AI coding 工具链绑定

摘要:Qwen Code 近期周更包含 Agent Team 并行协作、durable /loop、/cd、MCP approval gate、permission bubbling、/compress-fast;Qwen 主页同时强调 Qwen-Image 20B MMDiT 在复杂文字渲染与精确编辑上的进展。

为什么重要:中国模型生态不再只拼 leaderboard,而是在补齐 IDE、agent loop、权限、MCP 和多模态生产力接口。Qwen 的节奏说明开源/开放模型要进入企业开发流程,工具链体验与安全边界同样关键。

来源:Qwen Docs / Qwen

其他值得关注