一分钟速览
- OpenAI DevDay(约 09-29)一口气放出 20+ 项:GPT-6.1 Sol 官方称多项基准接近 Astra、标准 API 价约其 1/5;dots 以 Astra 驱动常驻云电脑 agent;另开 Ultrafast 速度档、Pro 500 与 Decisions API 预览。
- Anthropic 同周发布 Claude Sonnet 5.5:同价
$2/$10,官方称更快约 30%+、多数工作最高可省约 30% 成本;Terminal-Bench 4.0 官方报约 70.6%。 - Anthropic 研究文评估智谱 GLM-5.3 开源权重的先进网络能力扩散:防护弱、可被简单手段绕过——与闭源限量「玻璃房」叙事对照。
- 开源侧:Ollama v0.35 本地 Decision Models、openai/mcp-extensions 新仓、Codex 0.159 可中途打断;Hugging Face 高信号是小米 MiMo MOPD 升级与 TeleOCR / Ming-omni / GLM NVFP4 部署旁线。
- 勿当事实:社区流传的 Gemini 4 Pro 基准「领先榜」尚无 Google 官方确认;Liquid d1 决策模型热度可扫、数字待核。
执行摘要
- DevDay 主导:GPT-6.1 Sol(近 Astra、约 1/5 价)+ dots 常驻 agent + Ultrafast / Decisions。
- Sonnet 5.5 同周抢
$2/$10中端工程位,终端基准官方报大幅跃迁。 - 安全:Anthropic GLM-5.3 网络能力扩散 + NVIDIA OpenShell/OASP。
- 决策品类升温;Hub 侧 MiMo MOPD 与 TeleOCR、Ming-omni、GLM NVFP4。
- 先重测 Sol vs Sonnet,再试点 dots 权限与本地决策/沙箱。
大厂与学术界动态
主线:OpenAI DevDay——近旗舰压进日常价,常驻 agent 开闸
这意味着什么:本窗最大产品洪峰不是「再发一个旗舰名」,而是 OpenAI 把 接近 Astra 的能力压到日常可买的 Sol 价位,同时把对话助手正式产品化成 可委托、可离线推进的常驻 agent(dots),并用速度档与决策 API 把计费与编排拆开。约 9 月 29 日 DevDay 一口气 20+ 项,总览见 DevDay 2026 Recap;核心三条是 GPT-6.1 Sol、dots,以及 Ultrafast / Pro 500 / Decisions API(见 Recap 与开发者文档)。
人话版:以前买旗舰像订头等舱——贵、满、偶尔才坐;Sol 6.1 更像「商务舱日常飞」——官方称 agentic coding、computer use、专业工作负载多项接近 Astra,标准 API 输入/输出约 $2 / $10 per 1M tokens(约 Astra 的 1/5),缓存输入约 $0.10(相对标准输入约 −95%)。官方自报对照包括:DeepSWE 匹配 Astra、成本约 1/5;AutomationBench 相对 Opus 5.5 约 +2.2 pp(成本约 1/3);OSWorld 2.0 相对 GPT-6 Sol 约 +7 pp、距 Astra 约 −2.1 pp;事实错误回答约 11.4%→7.7%。API id gpt-6.1-sol;已在 ChatGPT Work / Codex / API 对 Plus+ 开放,尚未进普通 Chat。安全附录称网络安全 Critical、生化学 High,与 Astra 同 safeguards 栈(见 deployment safety 页)。媒体称原定 GPT-6.1 Astra 因安全评估未发——作背景报道,勿写成已确认产品决策。
dots 则是另一类赌注:由 GPT-6 Astra 驱动的 always-on 智能体,自带云电脑,官方称可连 4000+ 应用/插件,用户离线时仍可推进项目;可在 ChatGPT / Slack / Teams 交互,并设自主边界与禁区。先向 Pro / Business Premium / Enterprise(合格市场)滚动开放,官方称档位内无额外费用。类比:Sol 6.1 是换一辆更省油的主力车;dots 是雇一名「住在公司云电脑里的项目助理」——你睡觉时它还在改稿、跑脚本、调应用。权限与禁区文档比 demo 视频更值得先读。
同窗工程 SKU:付费速度档 Ultrafast(官方称 Codex 上最高约 8× / 约 300 tok/s,API 约 6×);GPT-6 Astra Ultrafast 已在 API / ChatGPT Work / Codex 可用(Work/Codex 侧绑定 Pro 500 与 Enterprise);Sol Ultrafast 即将跟进。新订阅 Pro 500(约 $500/月)含 Ultrafast 与约 25× Plus 用量,并重开 Pro 200(细节以官网为准)。Decisions API(有限预览)用 GPT-6 Luna 在封闭选项集上做实时决策(分类、路由、agent 下一步),输出为可选答案而非长生成——把「高吞吐结构化决策」从通用 chat 拆成专用原语。另有 Codex Security Cloud、Marketplace 等工程向条目,见次要。
适用谁:工程默认路由与采购、企业 agent 平台、Codex 重度用户、API/编排层。不适用:把官方自报基准直接写进对外 SLA;假设 dots 已对所有 Chat 用户开放;把 Ultrafast 宣传吞吐当你家网络与配额下的实测。上期 Live Avatar / 长视频 / Suncatcher 不复述。
深入学习建议
- 精读 Introducing GPT-6.1 Sol 与 System Card PDF:标出可用面(Work/Codex/API vs Chat)与安全档。
- 产品侧读 Introducing dots:权限、云电脑、禁区与滚动开放条件。
- 工程侧扫 DevDay Recap + Ultrafast 指南;Decisions 等完整 docs 再落地。
- 用 10 条自家 coding/agent 任务盲测 Sol 6.1 vs 现网默认;另开一条 dots 试点只开最小应用白名单。
主线:Claude Sonnet 5.5——中端工程主力与 Sol 6.1 同价位对打
这意味着什么:Anthropic 在 Opus 5.5 之后迅速补齐「日常工程/文档」中端——同价位更快更省,并宣称终端与代码基准大幅跃迁。约 9 月 28 日发布 Claude Sonnet 5.5(Claude 5.5 家族第二款):相对 Sonnet 5,官方称输出更快约 30%+、多数工作最高可省约 30% 成本;价位仍 $2/$10 per 1M tokens;API id claude-sonnet-5-5;已上 Claude API / Bedrock / GCP / Azure;Haiku 5.5 预告数周内。官方称其为首个带 cyber safeguards 的 Sonnet。
人话版:如果把 Opus 当「专家顾问」、Haiku 当「前台速记」,Sonnet 就是大多数团队真正每天点的「主力工程师座位」。5.5 的叙事不是换座位名,而是同一张价签上把速度与 token 账单拧紧,并把终端代理能力从「能试」推到「敢当默认」。官方自报:Terminal-Bench 4.0 约 70.6%(Sonnet 5 约 10.3%;Opus 5.5 Xhigh 约 66.4%);FrontierCode Max 约 46.2% / Xhigh 约 52.1%;CursorBench 约 55.5%;OSWorld 2.1 partial 约 80.1%;约 1M 上下文。数字均为官方自报,复测前当上限。
与 Sol 6.1 同周对位的读法:两边都在抢「$2/$10 日常重负载」——OpenAI 用「近 Astra」叙事,Anthropic 用「相对上代 Sonnet 的速度/成本 + 终端跃迁」叙事。选型别只看总分榜:看你们真实负载是偏 coding agent / 终端、偏 文档与知识工作,还是偏 computer use;再看 SDK 是否已暴露模型 id 与新 thinking 类型(见开源栏 Anthropic SDK)。
适用谁:Claude 默认路由的工程与产品团队、多云 Bedrock/GCP/Azure 客户、终端/编码 agent 评测。不适用:把 Terminal-Bench 跃迁外推成「所有 IDE 任务都翻倍」;假设 Haiku 5.5 已可用;忽略 cyber safeguards 对红队/安全工具链的行为变化。
深入学习建议
- 精读 anthropic.com/claude-sonnet-5-5 与 平台概述:标出价格、上下文、可用云与 safeguards。
- 与 Sol 6.1 做同题盲测(终端、多文件 refactor、长文档),记录延迟、费用与失败模式,勿只抄厂商表。
- SDK 读者同步看 anthropic-sdk-python v1.9.0 的
claude-sonnet-5-5与between_toolsthinking。 - 安全/红队单独核对 cyber safeguards 对既有评估脚本的影响。
主线:NVIDIA OpenShell / OASP——把 agent 安全从「提示词」沉到沙箱与网卡
这意味着什么:当 DevDay 与 Sonnet 把 agent 能力铺开时,NVIDIA 用开源运行时回答「跑起来之后怎么关进笼子」。约 9 月 28 日发布 Open Agent Safety Platform 与 OpenShell:分层参考架构覆盖沙箱、策略证明、线速旁路监控;OpenShell 0.1.0(Vera CPU 沙箱)官方称 Apache 2.0,无需改写 agent 即可强制沙箱与凭证隔离,兼容 Codex / Claude Code 等。BlueField-4 上的 Sentry 面向「在硅片侧持续监控」——把漂移与逃逸从应用层日志,下沉到运行时与加速器旁路。
人话版:大多数团队的 agent 安全还停在「系统提示里写不许乱来」或「出站代理黑名单」;OpenShell 更像给每个 agent 发一张带权限的工牌 + 隔离工位——代码不用大改,先把文件系统、凭证和网络边界卡住。OASP 则是参考蓝图:测试到部署一路怎么监控。学术/治理旁线可并读:OpenAI Towards safety cases for frontier AI training(约 09-28/29)主张前沿 RL 前应具备结构化安全文档(alignment / containment / monitoring),并强调勿让自动 grader 看见 CoT(防监控规避);Google Research Diffusion Controller(页约 09-29)用侧网络增强文生图 prompt 对齐(官方称对基线约 90% win rate)——生成控制选读。
适用谁:企业 agent 平台 SRE/安全、已在跑 Codex/Claude Code 的团队、AI 工厂功耗与密度规划。不适用:把 0.1.0 参考实现当成「插上即合规」认证;把 MaxLPS 的 40%/49.2% 未复测写进容量合同;用 safety cases 长文替代你们自己的 threat model。
深入学习建议
- 先读 OpenShell 博文 再读 OASP 参考文:画出沙箱 / 策略 / 监控三层对照自家网关。
- 在一台非生产机对 Codex 或 Claude Code 做 OpenShell 冒烟:凭证隔离与文件系统边界是否可强制。
- 治理读者精读 safety cases 文 的 CoT 监控段落。
- 生成团队选读 Diffusion Controller。
X 动态
主线:开源网络能力扩散 + 「决策模型」热——DevDay 余波里的两条安全/品类线
这意味着什么:X 与公开讨论层本窗不只在转发 DevDay 截图,更把两件「会改风险与架构选型」的事推到台前——人人可下的开源权重已具备先进网络能力且防护弱,以及 「决策」正在从 chat 副产品变成独立品类(OpenAI Decisions、Liquid d1、本地 SystemOne 同周共振)。主证据不在传闻帖,而在 Anthropic 研究文 GLM-5.3 and the spread of advanced cyber capabilities(约 09-29):评估智谱 Z.ai / GLM-5.3 开源权重可自主完成端到端 exploit 构建;相对 Claude Mythos Preview(限量 Glasswing)能力跃迁类似;关键是防护弱——模拟中简单手段绕过率约 64%–100%,同测对受保护 Claude 未成功。文中引用 NIST CAISI(约 09-17)称其为迄今最强开源网络能力模型,约落后美前沿聚合指标 4 个月(见 CAISI 新闻稿)。数字为机构/论文口径,勿写成攻击教程。
人话版:以前「强网络能力」像关在玻璃房的限量样机——申请、审计、监控齐全;开源权重扩散后,像把接近同档的工具箱放到公共货架上,而箱锁(防护)很松。对企业的启示不是「去下载玩 exploit」,而是:红队假设要更新、出站与代码执行沙箱要按「开源可复现攻击链」重估、开源治理不能只看通用 bench。同周 xAI / Elon 宣称 Grok 4.7 在 AA cyber index 第一——属官方自报与第三方榜,方法与是否含 safeguard-off 需另核,本窗只作对照信号。
决策品类热:OpenAI Decisions API(见大厂栏)用 Luna 做封闭选项实时决策;Liquid 宣称首个 decision model d1,称在 Hugging Face Decision Index 上首次超过 Jev(Today’s News / 生态转发为主,缺稳定官方长文 URL,数字待核);本地侧 Ollama SystemOne 与 firelex/jeff 同窗(见开源栏)。类比:通用大模型像全能秘书写长邮件;决策模型像闸机——只输出「过 / 不过 / 置信度」,适合路由、工单分流、agent 选下一步。另:Gemini 4 Pro 泄露基准榜(DeepSWE / Terminal-Bench / OSWorld 等「领先」叙事、2M 上下文与较低价)在 Today’s News 流传,无 Google 官方确认——可存档跟踪,禁止当成已发布事实写入结论或对外材料。
适用谁:安全/政策/对齐、企业红队与开源治理、agent 路由与决策栈选型。不适用:复述或教学任何 exploit 步骤;把 CAISI/Anthropic 数字当采购唯一依据;把 Gemini 4 Pro 泄露表写成已发布产品能力。
深入学习建议
- 精读 Anthropic GLM-5.3 研究文 + CAISI/NIST:只记威胁模型与防护差距,不记攻击细节。
- 对照自家:开源代码执行、浏览器/电脑使用代理、依赖安装路径是否默认按「强网络能力开源模型」级别隔离。
- 决策栈:扫 DevDay Recap 的 Decisions 段;Liquid d1 等官方博客/可复现榜再深;本地先试 Ollama SystemOne。
- Gemini 4 Pro:建立「待核」跟踪条目,等 Google 官方材料再扩写。
热门开源项目
主线:本地 Decision Models——Ollama SystemOne 与 jeff 把「分类路由」从解析文本改成结构化概率
这意味着什么:本窗开源最高信号的产品面,是把 结构化决策 从云 API 叙事落到本地可跑。ollama/ollama v0.35.0(约 09-29 05:23 SGT)新增基于 TypeSafe Jev API 的 /v1/systemone Decision Models:返回选项、概率与置信度而非长文本;现提供 Nimble、Tev1 等库模型;题型含 choice / noul / score。同窗新仓 firelex/jeff(约一天内冲到约 1033★)发布面向零样本分类的 Qwen3.5 / Gemma 4 小模型微调(Jev 同款请求格式),并指向 HF 上 Jeff-Qwen3.5-* 权重。与 OpenAI Decisions API、Liquid d1 同周出现,说明品类正在「云原语 + 本地可训」双向铺开。
人话版:以前用本地 LLM 做工单分流,常常是「让模型写一段话再正则抠标签」——偶发跑题、难校准。SystemOne 像把模型换成答题卡填涂机:题目选项固定,输出是概率与置信度,下游直接路由。jeff 则是「你自己有标签体系时,可以按同一请求格式微调小模型」。适用路由、客服分流、agent 选工具;不适合需要开放生成的长文写作主路径。
适用谁:本地推理、Agent 路由、客服/工单、想自训决策头的团队。不适用:把星标增速当质量认证;假设所有既有 chat 模板不改就能接到 /v1/systemone;把决策小模型当通用聊天替身。
深入学习建议
- 精读 Ollama v0.35.0 中 SystemOne / 三种题型说明,跑通一条
choice冒烟。 - 对照 firelex/jeff README 与 HF 权重,评估是否值得用自家标签微调。
- 与云端 Decisions API 画一张「延迟 / 隐私 / 可训 / 选项集变更成本」对照表再选型。
主线:DevDay 落地到仓库——mcp-extensions、Codex 0.159、Anthropic SDK Sonnet 5.5
这意味着什么:大厂发布若只停在博客,开发者接不住;本窗三条仓库级更新把 DevDay / Sonnet 5.5 焊进可安装契约。OpenAI 新仓 openai/mcp-extensions(约 09-29 创建,窗口内约 225★)提供把 MCP 插件做成 ChatGPT「一等公民」的 SDK 与规范(侧栏入口、文件扩展处理器、Composer @ 提及、扩展表单等)——官方把插件扩展面开源成可安装的 TS/Python SDK。openai/codex rust-v0.159.0(约 09-29 16:05 SGT)新增可选 instant_interrupt:可在模型回复或长 code-mode 调用中用新输入改道,并改进欢迎屏、警告查看器与 Mermaid 渲染;Windows 控制台/沙箱与 TLS 修复偏生产向。Anthropic anthropic-sdk-python v1.9.0 与 TypeScript sdk-v0.129.0 同步加入 claude-sonnet-5-5、between_tools thinking,以及工具调用可与流式回复并行;cache diagnostics 标为 GA。
人话版:mcp-extensions 像把「ChatGPT 插件插座说明书」开源成 SDK——你按规范做,才能进侧栏与 @ 提及;Codex 0.159 像给长时间跑的编码代理加了方向盘中途纠偏——不用干等跑完再开新会话;SDK 发版则是「模型名写进客户端合同」——应用层可以立刻改默认模型与 thinking 类型。社区热点旁线:KKKKhazix/AIHOT 约一天冲到约 3156★,自托管 AI 热点日报框架——作热度对照,勿当厂商 release。
适用谁:ChatGPT/MCP 插件开发者、Codex 日活、Anthropic 应用。不适用:把星标异常写成技术突破;未读 instant_interrupt 就在生产默认全开。
深入学习建议
- mcp-extensions:从 README Showcase 进
docs/spec.md,再装 TS 或 Python SDK 做最小侧栏扩展。 - Codex:读 0.159.0 New Features,在长 refactor 任务上试
instant_interrupt改道。 - Anthropic:升级 SDK 后核对模型 id 与
between_tools;跑一条多工具流式并发样例。 - 兴趣者扫 AIHOT 架构与 topics 再决定是否 fork。
模型相关
主线:MiMo-V2.6 MOPD——多教师蒸馏专门压「agent 重复调工具」
这意味着什么:本窗 Hugging Face 几乎没有新 frontier 文本底座;最硬的官方新卡是小米对已发布 MiMo-V2.6-Flash/Pro-RL 再发的 MOPD 检查点。XiaomiMiMo/MiMo-V2.6-Flash-MOPD 与 Pro-MOPD(created 约 09-27 落窗):多教师 on-policy 蒸馏(MOPD2)+ 专项压低 agent 场景下的 tool-call 重复调用。Flash / Pro 卡内宣称为大型 MoE(参数量待核)。基座仍是窗前 Flash-RL / Pro-RL——叙事是「RL 基座 → 可部署修复版」,不是再发一个全家桶名。
人话版:agent 重复调同一个工具,像助理不停拨同一个电话确认——账单与延迟双杀。MOPD 检查点像给这只毛病开了专项补丁:用多教师 on-policy 蒸馏把「别重复拨」印进权重。采集快照 likes 仍低(Flash-MOPD 约 42 / Pro-MOPD 约 20),说明曝光尚未追上技术叙事——选型看卡内 Technical Report §5.6 与 tool-call 博客,用自家 harness 复测重复率,勿只看下载数。
适用谁:Agent / 多模态长上下文产品、跟进小米开源路线的评测。不适用:把卡内 MoE 参数、1M 上下文、重复率降幅未复现就写进对外材料;把 MOPD 写成「今日新发底座 LLM」。
深入学习建议
- 对照 Flash-MOPD / Pro-MOPD 与对应 RL 基座:同一 agent 任务集统计 tool-call 重复率与总 token。
- 读卡内 Technical Report PDF §5.6 与 博客。
- 部署前核 MIT 许可与 GitHub MiMo 推理路径。
主线:TeleOCR、Ming-flash-omni、GLM-5.3-Flash-NVFP4——文档 VLM / Omni / 量化部署三线并行
这意味着什么:其余高信号是本窗更新而非新架构头条——分别打文档解析、开源 Omni、大 MoE 可上线量化。XingChen-AGI/TeleOCR(~1.2B 文档解析 VLM,原 NaviDC-OCR 更名;lastModified 约 09-29 落窗;likes 约 870 / downloads 约 30k)统一数字 PDF 与拍摄文档,挂 arXiv:2608.12898 与 GitHub;卡宣称 SOTA 分数一律待核。inclusionAI/Ming-flash-omni-2.0(Ling-2.0 MoE:卡称 100B total / 6B active;lm 约 09-29)定位多模态理解 + 语音/图像生成一体,是原仓而非 Comfy 包装。nvidia/GLM-5.3-Flash-NVFP4(lm 约 09-30 05:30 SGT;downloads 约 54k)是 NVIDIA Model Optimizer 对 zai-org/GLM-5.3-Flash 的 NVFP4 预量化权重,面向 vLLM/SGLang——典型「底座已立 → 量化进产线」,勿当新模型发版。
人话版:TeleOCR 像轻量「文档扫描仪大脑」——PDF 与手机拍照走同一条解析;Ming-omni 像稀缺的「听说读写一体」开源实验台;NVFP4 像把巨型 Flash 底座打成更省显存的货运箱——箱子变了,货还是原来的 GLM-5.3-Flash。DeepSeek-V4.1-Flash、Qwen3.8、Audio8 / Nemotron 日记等仍是热度延续,勿写成今日新发。旁线:GLiNER2.5-Decide(340M 级任意标签分类)、Qwen3Guard-Stream、typed-decisions 数据集与决策品类同题,可扫。
适用谁:文档智能 / RAG、多模态原型、推理解耦与 Agent/RAG 降本。不适用:把量化卡当新架构;把 Comfy/Uncensored GGUF 热度写进选型;用卡内 SOTA 句替代 OmniDocBench 自测。
深入学习建议
- TeleOCR:卡 + arXiv + GitHub;用自家财报/合同样张对照数字 PDF 与拍照。
- Ming:读 模型卡 与 GitHub Ming,先估 100B 级部署成本再原型。
- NVFP4:对照 量化卡 与原卡,在 vLLM/SGLang 上测精度掉点与吞吐;配方见 Model-Optimizer。
次要动态
- OpenAI safety cases(约 09-28/29):前沿训练安全文档与 CoT 监控规避——见大厂 NVIDIA 主线并读链接。
- Diffusion Controller(Google Research,页约 09-29):文生图 prompt 对齐侧网络;HPS-v2 约 90% win rate 为官方自报。
- DSX MaxLPS(NVIDIA):同功耗预算多部署约 40% GPU、吞吐官方称约 +49.2%——算力厂选读。
- Codex Security Cloud / Marketplace:DevDay 工程向;开源模型接入 Codex 等细节待核官方 docs。
- arXiv 抽读(论文自报):意识框架 2609.35618;MSR ROFT 2609.35741;Night Science 2609.35706;Meta RSI 蒸馏 2609.30652;Amazon TCSAlgBench 2609.35606。
- Liquid d1 / Gemini 4 Pro 泄露榜:品类热与待核传闻——见 X 栏;勿当已核实事实。
- Grok 4.7 AA cyber index 第一:官方自报对照信号。
- HF 旁线:GLiNER2.5-Decide、colipri、Qwen3Guard-Stream、typed-decisions;LTX IC-LoRA 信号弱;Uncensored/Heretic/Comfy 包装降权。
- 刻意不重复上期:Live Avatar、长视频 Co-Director、Suncatcher、Opus 5.5 首发、GPT-6 Sol/Luna 首发、九圈、CAVEAT 等仅作语境。
来源与延伸阅读
- OpenAI:DevDay Recap · GPT-6.1 Sol · System Card PDF · dots · Ultrafast · safety cases · deployment safety
- Anthropic:Claude Sonnet 5.5 · 平台概述 · GLM-5.3 网络能力
- NIST:CAISI GLM-5.3
- NVIDIA:OASP · OpenShell
- Google Research:Diffusion Controller
- GitHub:Ollama v0.35.0 · mcp-extensions · Codex 0.159.0 · anthropic-sdk-python v1.9.0 · sdk-typescript v0.129.0 · jeff · AIHOT
- Hugging Face:MiMo Flash-MOPD · Pro-MOPD · TeleOCR · Ming-flash-omni-2.0 · GLM-5.3-Flash-NVFP4 · GLM-5.3-Flash
- arXiv:2609.35618 · ROFT 2609.35741 · Night Science 2609.35706 · RSI 2609.30652 · TCSAlgBench 2609.35606 · TeleOCR 2608.12898
- 媒体背景:TechCrunch on Sol 6.1(非官方确认「Astra 未发」原因)
今日行动建议
- 默认路由重测:用 10 条自家 coding / 终端 / 文档任务盲测 GPT-6.1 Sol vs Claude Sonnet 5.5(同记延迟、费用、失败模式);更新团队默认模型表。
- dots 权限试点:若在 Pro/Business/Enterprise 合格市场,只开最小应用白名单跑一条常驻任务;先读禁区与云电脑权限段,再谈扩大连接数。
- SKU 与账单:重度 Codex 用户核对 Ultrafast / Pro 500 是否划算;非重度先盯 Sol 6.1 缓存价与 Work 可用面,勿为速度档冲动升级。
- 决策栈冒烟:云端扫 Decisions API 预览资格;本地跑 Ollama v0.35 SystemOne 一条
choice;需要自训再看 jeff。 - 安全假设更新:读 Anthropic GLM-5.3 文与 CAISI 摘要,按「强网络能力开源权重」重估代码执行/出站沙箱;OpenShell 对 Codex 或 Claude Code 做非生产冒烟。
- 模型部署:Agent 团队对比 MiMo MOPD vs RL 基座的 tool-call 重复率;文档流水线试 TeleOCR;GLM Flash 产线评估 NVFP4 掉点。
- 待核纪律:Gemini 4 Pro 泄露榜、Liquid d1 超 Jev 数字、媒体「Astra 6.1 未发」原因——只跟踪、不写入对外结论,等官方材料。
