一分钟速览
- 今日正面战场不在「新基座」,而在 Agent Harness(驾驭层):DeepSeek 官方预览、LangChain deepagents-talon 稳定版、YC「先改 harness」叙事同窗撞车。
- 选型话术从「谁第一」切到 任务面:Astra 偏代理/电脑操作,Fable 偏精细设计;浏览器类摘要数字约 77.3% vs 56.2%(待核)。
- 创作演示在对冲:Higgsfield 用 Astra 做城市抗灾仿真;开源侧用 Fable 5.1 跑通儿童 3D 小游戏,反驳「只有一家能做整游戏」。
- 权威研究线本窗无高信号;模型 Hub 大厂几乎无新基座——GLM-5.3-Flash 窗口更新、MiniCPM5-2B 下载量过低暂缓主力试跑。
- 工程优先序:先固定记忆/工具/规则/反馈回路,再决定换不换旗舰模型;把 harness 当产品,而不是当「装模型的壳」。
执行摘要
时区:Asia/Singapore · 覆盖窗口约 2026-09-07 晨 → 2026-09-08 09:07 SGT · 证据标签:FACT / 官方自报 / 待核
今天没有又一次「大厂基座发版」的热闹,权威研究线扫描结论也是 主线收录 0——OpenAI Sep 6 双帖(Alien Mind / Research Acceleration)已在昨日深读,本窗只作指针、不复盘。真正挤进工程注意力的,是 harness 正面战场 与 选型口径切换 两条并行主线。
人话版: 模型像引擎,harness 像驾驶舱加工具箱。YC Today’s News 把话说得很直——很多人报「不重训、只改记忆/工具/规则/反馈」,任务完成率能从「半残」跳到「可用」;百分比数字一律 待核,但方向与同窗 GitHub 发布高度同构:FACT DeepSeek Harness dsh-v0.1.3-alpha.2(插件化子代理、Web Workspace、默认工具改 read/write/edit)、FACT LangChain deepagents-talon==0.0.7(Discord、可检索历史、MCP 热重载 + Slack/GitHub OAuth 的 batteries-included 稳定版),再叠 Qwen Code preview.2、Qwen-MM-Plugins、Codex rust alpha——赛道信号是「谁把驾驭层产品化」,不是「谁再堆一层框架」。
第二条主线是 从榜单到任务面:Today’s News 汇总开发者实测印象——Astra 偏代理/电脑操作、Fable 偏精细设计;浏览器类任务摘要约 77.3% vs 56.2%,价位都在约 $10–50 / 百万 token 档——数字来自新闻卡,待核原测评。Higgsfield 官方自报用 Astra 搭虚拟城市做海浪/地震参数实验;同时有人公开儿童小游戏 + 做法,称 Fable 5.1 也能跑通 3D/整游戏——对冲「只有一家能做」的演示叙事。
对工程/学习的即时含义: 本周评测表请按「操作面 / 设计面 / 长程编码面」分列,不要只贴一张总榜;自建 agent 先盘点 harness 缺口(记忆持久化、工具授权、规则注入、反馈回路),再决定要不要追下一代旗舰。模型 Hub 动作以窗口更新与轻量新卡为主——勿写成「今日扎堆发基座」。
主线 1:Agent Harness 正面战场——模型是引擎,驾驭层才是方向盘
背景与触发
窗口内最响的工程信号,不是又一个「从零写的 agent 框架」,而是 官方 / 准官方 harness 同时加码,并与社区讨论「先改外围架子」对齐。Harness(驾驭层)一句话:把模型接到真实工具、记忆、规则与人机回路上的那一层运行时——不是权重本身,而是「怎么开」。
FACT(DeepSeek Harness v0.1.3-alpha.2,约 2026-09-07T13:59:29Z,仓 ★ 约 215k 级):官方定位为插件化 Agent Harness 预览——子代理排队 / Steer、Web Workspace、默认工具改为 read / write / edit。对「自建 coding-agent 栈」的人,这是 DeepSeek 正面撞赛道的产品动作;纯 API 调用方可以跳过实现细节,但仍应读懂其默认工具面收缩:从「什么都能碰」改成「读写编辑优先」——更像给工程师发一套可控扳手,而不是整间无人车间钥匙。
同窗 FACT(deepagents-talon==0.0.7,约 2026-09-07T20:59:56Z,★ 约 29k):LangChain 把 batteries-included harness 推到 正式版标签语义——Discord 通道、可检索历史、MCP 热重载,并加上 Slack / GitHub OAuth。和 DeepSeek 的 alpha 预览形成对照:一边是模型厂自研驾驭层试水,一边是编排生态把多通道 + MCP + 子代理收成可安装产品。对多 agent / 办公 IM / MCP 团队,这份 changelog 比再追一个「新框架 README」更有用。
周边同场加码(扫 changelog 级,不单开主线):
| 信号 | 一句话 | 标签 |
|---|---|---|
Qwen Code v0.23.1-preview.2 | web-shell 动态 workflow、IPC 拒收/过期消息、session catalog | FACT · 约 09-07 05:50Z · ★≈27k |
| Qwen-MM-Plugins | 跨 harness 原生多模态插件集;窗内 push、无新 Release | FACT · push ≈09-07 17:22Z · ★≈2.8k |
OpenAI Codex rust-v0.154.0-alpha.6 | 又发一枚 Rust alpha;release body 几乎空 | FACT · ≈09-07 18:03Z · ★≈122k |
| HyperFrames v0.8.31 | HTML→视频小版本;Studio 流式读媒体 | FACT · 工程补丁;短视频流水线会碰到 |
机制 / 产品形态(人话 + 对照)
类比: 换一台更大马力的引擎,挡位、仪表、后视镜坏了,照样开不好车。YC Today’s News 本窗讨论的核心主张正是:不重训模型,只把 记忆 / 工具 / 规则 / 反馈 四件套修好,任务表现可以「跳很大」——摘要里出现 OpenClaw 约 30%→95.5%、Prime Agent 部分测到 100% 等说法,一律标 待核(来自新闻卡转述,未见本窗独立复现)。方向可采信的部分是:收益经常落在封装层,而不是再等下一张基座权重。
把 DeepSeek / LangChain / Qwen / Codex 放在同一张「驾驭层能力表」上看:
| 轴 | DeepSeek Harness alpha | deepagents-talon 0.0.7 | Qwen Code preview / MM-Plugins | Codex rust alpha |
|---|---|---|---|---|
| 定位 | 模型厂自研 coding harness | 编排生态 batteries-included | 官方 CLI + 跨 harness 视觉插件 | 对标 coding agent 持续微迭代 |
| 工具面 | 默认 read/write/edit | MCP 热重载 + OAuth 通道 | web-shell workflow;多模态插件 | body 空,盯 tag 即可 |
| 成熟度 | alpha,宜 clone 试 | 稳定版语义,值得扫 changelog | preview,已跟者升级 | alpha 连发,非大功能日 |
| 对谁 | 自建 harness | Discord/Slack/MCP 团队 | Qwen 栈用户 | 版本跟踪者 |
机制级要点(写进工程笔记即可):
- 子代理排队 / Steer: 不是「多开几个聊天窗」,而是把任务切片、优先级与人工纠偏做成一等公民——对应你是否能在轨迹里看到「谁在等、谁被打断」。
- Web Workspace: harness 开始默认带「可观察工作区」,而不是只回一段文本;和 computer-use / 代码执行沙箱同一哲学——执行环境主权在应用方。
- MCP 热重载 + OAuth: 工具目录会变、凭证会轮换;协议无状态不等于你的会话/授权无状态(承接前几日 MCP 主线,不复述)。
- 默认工具收缩为读写编辑: 看起来「变弱」,其实是把破坏面从「任意 shell」收到「可审计文件操作」——和安全评测里的 deny-write / allowlist 同向。
热仓边栏(非主线,但同主题):FACT M3E Canvas(★≈4680,demo)——浏览器里画 Material 3 界面,一键生成 prompt 喂给 coding agent,强调设计→agent 零后端;Trendshift 自报数据 待核。另有同日新建的 holo-card-studio(★≈835,created 2026-09-07)把「描述/图 → Blender 卡牌 + Three.js」收成 skill——说明 skills / harness 叙事已从纯编码扩到视觉生产,infra 读者可忽略。
证据与边界
| 声明 | 标签 | 来源 |
|---|---|---|
| DeepSeek Harness / talon / Qwen Code / Codex / HyperFrames 版本与时间戳 | FACT | 各 GitHub Release 页 |
| 「先改 harness 可大幅跳分」及 30%→95.5% / 100% 等 | 待核 | Today’s News 卡转述 YC 讨论 |
| M3E Canvas 星数与 demo 可访问 | FACT;Trendshift 排名 待核 | GitHub + demo 站 |
| Codex alpha body 空 = 无功能 | 推断谨慎 | 仅说明 release notes 未写,不代表无 commits |
开放问题: DeepSeek Harness 预览默认工具面是否会在正式版重新放开 shell?talon 的 MCP 热重载在生产多租户下的隔离边界?二者与「可移植 skills 包」生态如何互操作——本窗无一手答案,待核后续 changelog。
对工程与产品的启示
- 本周实验设计: 固定同一模型,只改 harness 四件套(记忆持久化、工具授权表、系统规则、失败反馈),报告 Δ——别一上来就换旗舰。
- 采购话术: 问供应商「你们的 agent 产品差异在权重还是在驾驭层?」;若答不出轨迹、干预率、工具 allowlist,差在运营不在模型名。
- 安全默认: 新 harness 若仍默认宽 shell,先收成 read/write/edit + 显式 escalate;对齐 DeepSeek 预览的收缩方向。
- 跟踪清单: DeepSeek alpha 可 clone;talon 0.0.7 扫 changelog;Qwen Code / MM-Plugins 已跟者升级;Codex 只盯 tag;HyperFrames 仅视频流水线需要。
主线 2:选型从榜单到任务面——Astra 操控、Fable 细活,演示叙事正在对冲
背景与触发
旗舰发版后的第 4–5 天,讨论焦点自然从「发布会总分」滑向「我这单任务该用谁」。Today’s News 本窗给出的开发者对照印象很清楚:Astra 偏代理 / 电脑操作;Fable 偏精细设计——不是道德判断,是任务面分工。摘要卡还给出浏览器类任务约 Astra 77.3% vs Fable 56.2%、价位同落在约 $10–50 / 百万 token——待核原测评方法与样本量;能写进笔记的只有「方向:操控面 Astra 口述更强,设计细活 Fable 口述更强」。
并行发生的是 演示叙事对冲:一边有厂商用最强 computer-use 模型做「虚拟城市抗灾实验」;一边有人用开源小游戏证明「整游戏」不是独家绝技。对产品与学习读者,这比再转一篇「谁赢了」更有用——你要的是可复现工作流,不是品牌忠诚。
机制 / 产品形态
人话: 选模型像选相机——风光机和街拍机都能出片,但你不会拿同一张「总榜 DxO」决定今晚拍夜景还是拍证件照。浏览器代理、像素级 UI 改稿、长程编码、3D 场景生成,是四张不同的「任务面」;把它们压成一个冠军名,下一步一定买错。
任务面对照(摘要卡印象 + 演示,非官方排行榜):
| 任务面 | 更常被点名的方向 | 本窗信号 | 证据标签 |
|---|---|---|---|
| 浏览器 / 电脑操作代理 | Astra | Today’s News:浏览器类约 77.3% vs 56.2% | 待核 摘要卡 |
| 精细设计 / 细活 | Fable | 同卡「偏精细设计」口述 | 待核 |
| 城市仿真 / 参数实验 | Astra + 厂商工作流 | Higgsfield:调海浪/地震测建筑 | 官方自报 演示 |
| 整游戏 / 3D 小游戏 | Fable 5.1 开源复现 | 儿童小游戏 + GitHub 做法公开 | 待核 帖文与仓需点开核验 |
| 价位锚 | 两边同档 | 约 $10–50 / 百万 token | 待核 摘要卡 |
Higgsfield 演示(官方自报,完整度看视频):用 GPT-6 Astra 搭虚拟城市,调节海浪 / 地震等参数观察建筑响应——属于 computer-use / 仿真 demo 浪潮续集,不是论文级气候或结构工程结论。正确读法是:旗舰 CU 正在被接进垂直创意工具链;错误读法是「AI 已经替代土木仿真软件」。
开源对冲(待核):有人公开儿童向小游戏与做法,称 Fable 5.1 也能跑通 3D / 整游戏流程并附 GitHub。意义不在「分数翻盘」,而在:演示叙事若写成「只有一家能做整游戏」,开源复现会立刻打脸——工程学习价值是可点开的工作流,不是口号。
Codex→3D 场景教程本窗亦有转发,属弱增量工具链参考,不进主栏深挖。
证据与边界
| 声明 | 标签 | 来源 |
|---|---|---|
| Astra vs Fable 任务面印象与 77.3% / 56.2% / 价位档 | 待核 | Today’s News 选型卡 |
| Higgsfield 城市仿真 demo 存在 | 官方自报 | Higgsfield 公开演示帖 |
| Fable 5.1 跑通开源小游戏 | 待核 | 公开帖 + 所称 GitHub;需点开核验 |
| 「只有 Astra 能做整游戏」 | 应降级为营销话术 | 与开源对冲并存时勿单边引用 |
开放问题: 浏览器类百分比的题目集、步数上限、是否允许人工干预?Fable「精细设计」优势是否在静态视觉评分、还是在多轮改稿稳定性?本窗没有原测评 PDF/仓库,一律待核。
对工程与产品的启示
- 内部评测表改版: 至少三列——操作面(browser/CU)、设计面(视觉/改稿)、编码面(长程 repo)——禁止只用一个「综合分」做采购。
- 演示验收: 厂商 demo 必须附「可复现步骤 + 失败案例」;只有高光视频 → 标 官方自报,不进决策。
- 学习路径: 复制开源小游戏工作流 1 次,比追 10 条「谁更强」帖更有复利;同时用同一题集在两条模型上跑,记录干预次数。
- 成本: 价位同档时,差异更可能来自失败重试与人工接管,而不是标价本身——仪表盘要记「成功任务全成本」。
次要动态
模型 Hub(无新大厂基座)
窗口至约 09:08 SGT:大厂几乎无新基座,动作以更新与轻量新卡为主——勿写成发版日。
| 模型卡 | 信号 | 建议 | 标签 |
|---|---|---|---|
| zai-org/GLM-5.3-Flash | 窗口官方更新(mod≈09-07 12:13Z);快且便宜的多模态对话;likes≈2133、dl≈78 万、MIT | 开源中文/多模态优先可跟 | FACT |
| openbmb/MiniCPM5-2B | 窗口新卡;标长上下文 + 工具调用;dl≈13 | 端侧/轻量可看,暂缓主力试跑 | FACT;能力 待核 |
| tencent/EVIE-Preview-4.5B | 视觉文档检索(非聊天) | 文档 RAG 相关可扫;部分 EVIE 卡 dl=0 慎选 | FACT |
| IFM/K2-Horizon-MoVA-36B-A4B | 开源 MoE 文本,窗内再更新 | 扫一眼即可 | FACT |
仅热度降权:Spark-X2.5-4B 冲榜前列(待核);Qwen3.8 / DeepSeek-V4-Vision / TimesFM / MiniMax-H3 中枢未变。数据集 openbmb/UltraData-* 有更新但下载个位数。Uncensored 魔改、downloads=0 的卡日报忽略。
权威研究 / CSR(本窗低信号)
研线裁决:主线收录 0。可备案、默认不深读:
- Google Research · 亚太超长航线尾迹规避实飞(Sep 7)— contrail avoidance
- DeepMind · AI for the Planet APAC 加速器(Sep 7)— accelerator
- OpenAI · 乌克兰独立媒体 AI 支持(Sep 7)— supporting independent journalism
arXiv 为 Labor Day 后首个 /new 窗口,无大厂挂名高热——宁缺毋滥。
指针:OpenAI Sep 6 双帖(不复盘)
Alien Mind(监控承压 / 自愿放缓)与 Research Acceleration(automated research intern、3.1× agent-workdays 等 官方自报)已在 2026-09-07 深读成对展开。本窗 X 侧仍有转发余波,不重复机制级复盘;需数字与刹停故事请回昨日正文与 An Alien Mind、Research Acceleration。
来源与延伸阅读
- DeepSeek Harness:dsh-v0.1.3-alpha.2
- LangChain deepagents:deepagents-talon==0.0.7
- Qwen Code:v0.23.1-preview.2 · Qwen-MM-Plugins
- OpenAI Codex:rust-v0.154.0-alpha.6
- HyperFrames:v0.8.31
- 设计→agent:M3E Canvas · demo
- 创意 skill:holo-card-studio
- 选型与 harness 讨论:Today’s News 卡(Astra vs Fable;YC「先改 harness」)— 数字 待核
- 仿真 demo:Higgsfield 城市抗灾演示帖(官方自报)
- 开源对冲:Fable 5.1 儿童小游戏公开帖(待核)
- 模型卡: GLM-5.3-Flash · MiniCPM5-2B · EVIE-Preview-4.5B
- 研究/CSR 备案:Google contrail · DeepMind APAC 加速器 · OpenAI 乌克兰媒体支持
- 昨日指针(不复盘):An Alien Mind · Research Acceleration
今日行动建议
- 固定模型、只改 harness: 选一个你已在用的 coding agent,今天只动记忆 / 工具 allowlist / 规则 / 失败反馈四项中的两项,写清前后成功率与人工干预次数。
- clone 试 DeepSeek Harness alpha: 重点看子代理排队与默认 read/write/edit;纯 API 业务可只读 Release 说明,不必上生产。
- 扫 talon 0.0.7 changelog: 若团队已用 Discord/Slack 或 MCP,评估热重载与 OAuth 是否减少「重启整栈才能换工具」的摩擦。
- 改一版内部选型表: 至少拆操作面 / 设计面 / 编码面三列;把 Today’s News 的 77.3% / 56.2% 标成 待核,用自己的 10 条题复测后再决策。
- 演示对冲练习: 花 30–60 分钟点开 Fable 5.1 开源小游戏做法(链接 待核 需自验),对照 Higgsfield 高光视频——记下「可复现步骤缺什么」。
- 模型跟进纪律: GLM-5.3-Flash 可作中文多模态便宜底座观察;MiniCPM5-2B 等 dl 上来再主力试跑;EVIE 只在文档 RAG 场景扫。
- 研究日历: 本窗权威线空窗属正常;把精力留给 harness 实验,Alien Mind / Acceleration 数字需要时回 9/7,勿在日报里二次扩写。
