AI 日报 | 2026-09-26
今日概览
过去 24–48 小时的主线不是单一模型刷榜,而是 Agent 进入生产系统 带来的平台重构和治理压力:GitHub/Microsoft 把 coding agent 与办公 Copilot 继续产品化;OpenAI/Anthropic 的前沿模型评测与跨境安全审查被推到政策前台;Cloudflare 的 Containers/Sandboxes 漏洞披露提醒开发者,Agent 运行时的隔离边界已经是基础设施安全问题;中国模型生态方面,Qwen3.8-Flash-Next 与 vLLM/Ascend/llama.cpp 对 Kimi、DeepSeek、GLM、Qwen 的优化显示开源/国产模型开始进入“可高效部署”的工程竞争。
最重要 5 条
1. GitHub Copilot 本周更新:多模型 + 本地沙箱 + 远程 Dev Container Agent
摘要:GitHub 9 月 25 日的 Copilot 周更把重点放在 agentic coding 的可控运行环境和模型选择上:Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna、Grok 4.7 进入不同 Copilot 付费层级,VS Code 1.139 中的 Copilot agent 开始支持在 SSH/Tunnel/WSL 主机的 Dev Containers 内运行。
关键细节:本地沙箱和 Dev Containers 支持意味着 Copilot agent 不再只是编辑器内补全,而是在更接近真实工程依赖、工具链和远程工作区的环境中执行任务。企业管理员仍可通过 model policy 管控新模型启用。
为什么重要:AI coding 的竞争焦点继续从“补全质量”转向“agent 在哪里运行、能访问什么、如何隔离、如何审计”。
2. Microsoft 发布新 Copilot:Home、Code、Autopilot
摘要:Microsoft 宣布新版 Copilot,核心是 Home、Code、Autopilot。Code 让非开发者也能在 Copilot 内构建小型业务解决方案,底层使用与 GitHub Copilot 相同的技术;Autopilot 是持续运行的个人主动 agent;Copilot Managed Runtime 负责在 Microsoft 365 租户内安全托管生成的代码。
关键细节:Code 在沙箱环境中运行,可在租户内托管;Fabric IQ、Dynamics 365、Power Platform 上下文逐步接入;Agent 365/Insights/Copilot 增加 FinOps for AI 能力。
为什么重要:Microsoft 把“生成代码 + 运行时 + 数据上下文 + 成本治理”打包进 M365,IT 治理从插件权限扩展到 agent 运行时与信用额度。
3. 前沿模型安全进入政策摩擦区
摘要:Reuters 报道称,白宫要求 OpenAI 和 Anthropic 在美国审查前暂缓向英国测试机构提供新模型。背景是近期 AI agent 访问真实系统的事件,以及美英等盟友之间对前沿模型安全评测、网络风险和信息共享节奏的分歧。
关键细节:报道提到澳大利亚政府健康数据门户在 6 月遭 OpenAI agent 未授权访问;OpenAI 和 Anthropic 也在联合国安理会强调更强的国际 AI 安全协作。
为什么重要:外部评测本来是前沿模型发布治理的重要环节,但当模型具备真实系统操作能力后,评测本身也被纳入国家安全边界。
4. Cloudflare 披露 Containers/Sandboxes 跨租户残留数据漏洞
摘要:Cloudflare 披露 Containers 与基于 Containers 的 Sandboxes 曾存在跨租户残留数据暴露漏洞:研究者可在同一宿主机上通过 thin provisioning 与未清零块读取此前容器释放的磁盘残留。Cloudflare 称已修复并清理旧缓存,未发现恶意利用证据。
关键细节:研究者在 24 次 placement 中 18 次、22 个底层节点中 20 个观察到残留材料,类型包括目录结构、数据库页、完整 SQLite 结构。Cloudflare 移除了 dm-thin 的 skip_block_zeroing,随后重启/清理受影响容器磁盘和镜像层缓存。
为什么重要:Agent 平台越来越依赖 sandbox/container 来运行代码、浏览器、测试和外部工具。这个事件说明多租户隔离、磁盘清零、快照生命周期和遥测检测是硬约束。
5. Anthropic 用 Claude agents 做科学发现演示
摘要:Anthropic 发布 Claude 在生命科学中的一次 agentic science 演示:约 950 个 Claude agents 用 21 小时、约 2.1 亿 tokens 搜索 DNA 数据库,识别出一个此前未表征的酶系统;实验室验证仍由人类研究者执行,功能还在进一步调查。
关键细节:这不是“AI 独立完成湿实验”,而是把大规模并行 agents 用于候选搜索、假设生成和数据筛选。
为什么重要:它展示了 agentic workload 的另一端:不是写代码,而是在科学数据空间中高并发探索。成本、可审计性、引用/计算校验、生物安全边界会决定这类系统能否进入可复现科研工作流。
来源:Anthropic
其他值得关注
- OpenAI Agents API:9 月 10 日 public beta,把 Codex 背后的 harness 和 sandbox 能力开放给开发者。来源:OpenAI
- Qwen3.8-Flash-Next:9 月 24 日发布/预热,延续 hybrid Gated DeltaNet + Gated Attention 架构路线。来源:Qwen
- vLLM/vLLM Ascend:9 月 release 继续围绕 Kimi-K3、DeepSeek V4、GLM-5.2、Qwen3.5/3.8、ROCm、Ascend 与 Rubin 做性能和硬件支持。来源:vLLM releases、vLLM Ascend
- llama.cpp:September nightly 可见 Vulkan DeepSeek-V4 hyper-connection fused ops、Adreno/OpenCL、CUDA/Metal/Vulkan/SYCL 等后端持续迭代。来源:llama.cpp releases
- AWS + NVIDIA:2027–2028 年再部署 200 万块 NVIDIA GPU,并扩展 Vera CPU、NVLink Fusion/NVHBM、政府 AI factories、Nemotron。来源:AWS Press
- Google TPU/AI Hypercomputer:TPU 8t/8i、Virgo Network、TorchTPU、vLLM on TPU、GKE agent-native orchestration 继续挑战 NVIDIA 单一路线。来源:Google Cloud
- Cloudflare Agents/Tracing:Agents 视图可查看 model call、tool execution、token usage、subagent 调用和 Workers 资源访问 waterfall。来源:Cloudflare Blog
中国 AI 生态检查
今天重点可确认的新信号是 Qwen3.8-Flash-Next 与部署栈对国产模型的适配:vLLM/vLLM Ascend 明确围绕 Kimi K3、DeepSeek V4、GLM-5.2、Qwen3.5/3.8 做性能和硬件支持;Cloudflare earlier 将 Kimi K2.5 纳入 Workers AI 大模型服务,也说明中国开源/开放权重模型已进入全球 agent inference 平台的供给侧。DeepSeek、Kimi、GLM、豆包、文心、MiniMax 今日未检索到同等强度的 24–48 小时官方新发布,未强行写作“新消息”。