2026-09-24 AI行业动态

Opus 5.5降本提速;GPT-6 Sol/Luna+缓存;Grok 4.7;vLLM 0.30与MiMo-V2.6。

Anthropic OpenAI xAI Claude Opus 5.5 GPT-6 Grok 4.7 vLLM MiMo
2026-09-24 AI行业动态信息图:前沿模型竞价、推理栈与开源系列
下载本期采集素材 四路信源的原始整理稿 · Markdown · 40 KB 下载 ↓

一分钟速览

  • Anthropic 发布 Claude Opus 5.5:官方称多数工作接近 Fable 5.1 水准,相对 Opus 5 更便宜更快(API 约 $4/$20,缓存读 $0.20,输出速度 >30%)。
  • OpenAI 扩 GPT-6 家族:Sol / Luna 双型号落地,官方称相对上代约半价;同步推出更好的 prompt caching(缓存输入最高约 90% 折扣)。
  • xAI 发布 Grok 4.7:同价提 coding/agent 基准;Anthropic 同窗上线 Claude Marketplace,并称 Claude 协助刚果相关埃博拉变体应急。
  • 学术侧:Google Cloud 等提出 RRSI(正则化递归自改进);NVIDIA 发布 OSWorld-Pro,把电脑使用 agent 评测推进到过程级。
  • 开源与模型:vLLM 0.30.0 与 llama.cpp 0.5.0 同窗大版本;小米 MiMo-V2.6 全家桶上架 HF;Apple LensVLM-9B 与 BFL FLUX.3 Action 本窗新发。

执行摘要

  • 本三日(09-21→09-24):Opus 5.5、GPT-6 Sol/Luna、Grok 4.7 同场竞价。
  • Opus 5.5 官方称更便宜更快($4/$20,缓存读 $0.20);Sol $2/$10、Luna $0.10/$0.50。
  • GPT-6 缓存官方称最高约 90% 折扣;Claude Code 默认 5.5,Codex 吃进 Sol/Luna。
  • 学术抬 RRSI(harness 正则)与 OSWorld-Pro(CUA 过程评测)。
  • vLLM 0.30 + llama.cpp 0.5.0;MiMo-V2.6 新发;LensVLM / FLUX.3 Action;Qwen-Image 续热。

大厂与学术界动态

主线:Claude Opus 5.5——「放缓前沿」后的首发,用成本与速度换默认席位

这意味着什么:Anthropic 把旗舰叙事改成多数日常工作够用、跑起来更便宜更快。约 9 月 22 日发布 Claude Opus 5.5(亦见 产品页):称多数工作可对齐 Claude Fable 5.1,相对 Opus 5 更省钱、更快。这是「Pace the Frontier」后的首发产品落地;外部亦提到 Frontier Design、METR 等参与过相关评估。

人话版:以前选旗舰像买顶配跑车——贵、强、但多数通勤用不上;Opus 5.5 更像把「顶配驾驶辅助」下放到日常通勤价。官方 API 口径:输入/输出约 $4 / $20 每百万 token(相对 Opus 5 约低 20%);缓存读约 $0.20(约低 60%);输出速度官方称快 >30%。公司 bench 以公告页为准,落地前用自家工作流对照。同窗 Claude Code v2.1.280 默认 Opus 切到 claude-opus-5-5;Claude Marketplace 把 tools/agents/services 做成可浏览分发层——旗舰、默认 CLI、商店三件事同周推进。

适用谁:Claude API / Claude Code 用户——重跑定价表与默认模型切换影响;长对话盯缓存读价格。不适用:把「接近 Fable 5.1」当成高风险场景可无闸门使用——仍按自家风险分级与安全条款落地;公司 bench 勿与第三方 Arena 混谈。酶发现与公共卫生见次要/X 栏。

深入学习建议

主线:GPT-6 Sol & Luna + Prompt Caching——同代「重/轻」双型号,把长程 agent 成本压到可路由

这意味着什么:OpenAI 在 GPT-6 Astra 之上把同系能力铺到成本曲线下端——Sol 扛复杂 coding/agents,Luna 扛高吞吐短任务,并用更好的 prompt caching 打长对话账单。约 9 月 22 日同发 Sol & Luna 与 Better prompt caching;API/Codex/ChatGPT Work 渠道见 社区公告、Sol、Luna。

人话版:Astra 像旗舰会议室;Sol 像项目主力工位(长 coding/agent);Luna 像流水线工位(高吞吐短任务)。官方 API:Sol 约 $2 / $10、Luna 约 $0.10 / $0.50 每百万 token(相对上代约半价以官方为准);上下文与 max out 以模型页为准。更关键的是缓存:官方称默认提高命中,缓存输入读最高约 90% 折扣,并提供诊断/预热——长程 agent 反复塞同一系统提示与工具说明书时,账单可差一个数量级。Codex 0.156.0/0.156.1 写入全屏 TUI、默认语音与 Sol/Luna picker;openai-python v3.18.0 同步加标识——模型目录与 agent 产品同窗联动。

适用谁:默认路由、FinOps、长程 agent harness——先画「Astra/Sol/Luna/缓存命中」决策表再全量切。不适用:假设所有流量都能吃到 90% 折扣(冷启动、改前缀、短会话可能无感);促销价勿与长期价目混用。MentalHealthBench 与第三方评估原则放次要/X 栏。

深入学习建议

主线:RRSI 与 OSWorld-Pro——harness 自改进要正则,电脑使用 agent 要看过程

这意味着什么:学术窗(Mon21–Wed23)最值得抬的不是「终态对错」榜,而是harness 自改进如何不过拟合,以及电脑使用(CUA)如何评到子目标与失败类型。Google Cloud 等 RRSI 给递归自改进加正则(编辑预算退火 + critic/pruner);NVIDIA OSWorld-Pro 做过程级评测:300+ 任务、2800+ 子目标。

人话类比:RRSI 像私教加「训练量上限 + 旁观者挑刺」——防只练考试动作;OSWorld-Pro 像驾考从「有没有停进线」升级为逐步扣分。论文自报(复现前当上限):RRSI evolve 集最高约 +14.1、五份 OOD 约 +4.7、策略 token 约 −30%;Claude Opus 5 在 OSWorld-Pro 约 75.7% vs OSWorld 83.4%——过程评测更抠。加深:Weco AIDE²、CMU 等 CliffCompaction(有界成本最高约 −50%)、KEX-bench(只谈评测设计,不写利用步骤)。

适用谁:做 agent harness、RSI(递归自改进)实验、CUA 产品评测的研究与平台工程——把「进化集分数」与「OOD / 过程分」拆开记账。不适用:把论文增益直接当成生产默认提升;也不要把 KEX 读成教程——它是安全评测基准。Meta 官博本窗无新帖、MSR 站点抓取受限,故学术主线不硬凑大厂博客。

深入学习建议

X 动态

主线:Grok 4.7 同价提 coding——IDE 默认模型又多了一个可对照选项

这意味着什么:xAI 约 9 月 21 日发 Grok 4.7——价速对齐 4.6,同时把 coding/agent 基准往上推,直接影响 IDE 默认选型。官方称更大底座、更长困难任务 RL;价速同 4.6(约 $2/$6 per 1M);fast 变体约 2× 速、2× 价。公司表:CursorBench 4.0 约 46.3%(4.6: 40.4%)、Terminal-Bench 4.0 约 37.6%(4.6: 20.3%)。已进 Cursor / Grok Build / API——公司口径,接入前用自家任务盲测。

人话版:同价提分像票价不变却把准点率做上去——采购只能比「在我的航线上省多少时间」。与同周 Opus 5.5、GPT-6 Sol 放一张路由表更有用。同窗 X 高信号旁线:Anthropic 称相关全球卫生机构用 Claude 加快刚果埃博拉变体响应(须对照 Situation Report 核使用边界);Claude Marketplace 上线;MentalHealthBench(80+ 临床人员);Gemini 3.8 TTS 可控声线与 SynthID——扫官方链即可。

适用谁:IDE/agent 用户与模型采购——把 Grok 4.7 放进与 Opus 5.5 / Sol 的同题对照,而不是只看宣传页。不适用:把公司 bench 当行业排名;公共卫生读者应读 Situation Report 原文,勿以推文摘要代替事实核验。

深入学习建议

  • 精读 Grok 4.7 公告:价速、fast 变体、Cursor/Terminal bench 表,再用 10 个本地任务对照。
  • 扫 Claude Marketplace 与 Marketplace 博客,看 tools/agents 提交流程是否与你的分发策略相关。
  • 安全/健康产品读 MentalHealthBench;公共卫生读者对照 Anthropic 推文所链 Situation Report,核使用边界。

热门开源项目

主线:vLLM 0.30.0 + llama.cpp 0.5.0——服务端与本地推理同窗「大版本」对齐新模型节奏

这意味着什么:本窗最硬的基建信号是服务端推理与本地 GGUF 标准库同时跳出 night build,才能接住当周新权重。vLLM 0.30.0(约 9/22,762 commits / 315 contributors)亮点含 DeepSeek-V4.1-Flash(MXFP8 KV / FlashMLA)、Fast Start 权重热缓存、HiSparse、Model Runner V2。llama.cpp 0.5.0 伴随 ggml 0.25.0:后端性能、新模型覆盖(含 MiMo-V2.6)、server/router——0.5.0 级通常是可感知能力打包,而非日常 bxxxx。

人话版:vLLM 像塔台与廊桥——新机型要先改调度;llama.cpp 像登机箱标准——本地/边缘取决于接口是否升级。同窗 llm-compressor 0.14.0 官方称 GPTQ 路径约 15×(需自测);Codex 0.156 / Claude Code 2.1.280 的模型目录变更见大厂栏。旁线:unreal-agent 窗内新仓过千星、SkillSpector v2.12.0 加码 Skills 安全扫描——勿抢推理栈头条。

适用谁:自建 serving、云推理平台、GGUF 本地部署、量化压缩团队。不适用:把 Release 里的倍数与星数当质量认证;Trending 上的多 agent 工作台(如 orca)可扫,但以当页与 Release 为准,勿外推历史排名。

深入学习建议

模型相关

主线:小米 MiMo-V2.6 全家桶——开源权重 + RL 基建同期放,本窗 HF 最清晰的大系列信号

这意味着什么:本窗 HF Trending 同时出现 Pro/Flash/Distill,是最清晰的「大厂新系列」。Pro-RL、Flash-RL、Distill-Qwen-9B 约 9/21–22 创建,MIT;卡强调原生多模态、约 1M 上下文,以及跨编码·智能体·视觉·安全的混合 RL。新闻见 MiMo V2.6,技术报告挂 Pro 卡。AA 指数、UltraSpeed 等按厂商自称,不摘未交叉验证分数。

人话版:以前常是「丢一个权重自己训」;MiMo-V2.6 更像连菜谱和半成品一起给——Pro 旗舰、Flash 省算力、Distill 作研究起点,并声称开了大规模 RL 环境。适用谁:agent/开源 RL/本地多模态——先 Flash,研究看 Distill,旗舰对照技术报告。不适用:把 AA 指数或 UltraSpeed 倍数写进对外材料;商用前读卡内限制。本地覆盖可对 llama.cpp 0.5.0,权重叙事以本栏为准。

深入学习建议

主线:Apple LensVLM-9B 与 FLUX.3 Action——长文档「先扫后展」与生成厂跨进机器人;Qwen-Image-2.1 仅热度延续

这意味着什么:除 MiMo 外还有两条研究/交叉新卡;Qwen-Image-2.1 非本窗新发(上期已立,本窗是维护+生态续热)。Apple LensVLM-9B(Qwen3.5-9B,apple-amlr):先压成「小图」扫一眼,再工具式展开相关页——long-context / visual-text-compression;论文 2605.07019,代码 ml-lensvlm。BFL FLUX.3 Action(约 7B):画面+状态+指令→下一段动作与视频帧,含 SO-101/DROID 适配;见 文档。卡明文:关节目标需安全限位,base 非完整策略。

人话版:LensVLM 像先翻缩略图再只放大划线页——省上下文,不是假装读完。FLUX.3 Action 把「下一帧」接到「下一动作」——生成厂跨进机器人栈。Qwen-Image-2.1(卡、博客)本窗有维护与生态更新,勿写成新发。其余低优先见次要。

适用谁:长文档 VLM、视觉压缩、机器人 VLA/仿真到真机、本地出图工作流。不适用:把 FLUX.3 Action base 当可直接上真机的完整控制器;也不要把 Qwen-Image 续热写成「本窗首发」。

深入学习建议

次要动态

  • 酶发现(约 9/23):Anthropic 生命科学组称 Claude 发现带 CRISPR 样重复的新型酶系统并开实验室验证——科学 AI 选读。公告
  • Private AI Compute 记忆(约 9/24):DeepMind 称加入安全服务端持久记忆,端侧隐私体验扩向云端跨会话。博文
  • Gemini 3.8 TTS(约 9/23):自然语言控声线,100+ 语言方言,SynthID;进 AI Studio/API。DeepMind · blog.google
  • Muse Realtime Avatar(约 9/23):语音→实时表情数字人;官方给分辨率/延迟/并发与蒸馏 NFE,Video Seal 水印。博客
  • Light-O1 Preview:人视频→全身动作;开源约 6B(Apache 2.0);真机需独立控制器,成功率多为自报。报道
  • MentalHealthBench / 第三方评估原则:心理健康对话评测开源;另发第三方评估原则——治理选读。Bench · 原则
  • 企业扫尾:UiPath Cartographer;Teradata Tera Context/Harness(Q4 2026 可用窗口、未 GA)——等 GA 再跟。
  • 开源/HF 旁线:llm-compressor 0.14、unreal-agent、SkillSpector 2.12、orca;Hemmingway-1、Nemotron diarization、EVIE-8B;Bonsai/Xing4/DeepSeek Flash 热度延续勿当新发。

来源与延伸阅读

今日行动建议

  • 模型选型:把 Opus 5.5、GPT-6 Sol/Luna、Grok 4.7 放进同一张「价 / 缓存 / 自家 20 题」对照表,再决定默认路由,勿只看公司 bench。
  • 长程 agent FinOps:在 GPT-6 上打开 prompt caching 诊断,统计系统前缀命中率;Claude 侧核对缓存读 $0.20 口径是否进入成本模型。
  • CLI 用户:确认 Claude Code 是否已默认 claude-opus-5-5;Codex 0.156+ 是否已出现 Sol/Luna;非生产项目先冒烟再全量切。
  • Serving / 本地:评估升级 vLLM 0.30(新模型与 Fast Start)与 llama.cpp 0.5.0;量化团队自测 llm-compressor 0.14 后再采信加速倍数。
  • 开源模型:MiMo 先 Flash 冒烟、Distill 做研究起点;LensVLM 读论文再跑 demo;FLUX.3 Action 只当适配组件,真机务必加安全限位。
  • 评测 / 安全:CUA 团队对照 OSWorld-Pro 补过程日志字段;harness 做 RSI 的读 RRSI 正则设计;心理健康产品扫 MentalHealthBench 题型。
  • 科学 / 隐私选读:酶发现公告与 Private AI Compute 记忆博文各读一遍,记下「实验室验证」与「跨会话记忆」边界,勿写成已全面生产。
🎵 看累了听个音乐吧
跟鬼哥聊聊 AI