证据标注 FACT 16 官方自报 8 待核 24 7 个信源

2026-09-08 AI行业动态

Harness 正面战场:DeepSeek/LangChain 驾驭层加码;选型从榜单切到 Astra 操控 vs Fable 细活。

Harness DeepSeek LangChain Astra Fable Agent GitHub HuggingFace
2026-09-08 AI深读:Agent Harness 驾驶舱与 Astra/Fable 任务面对照

一分钟速览

  • 今日正面战场不在「新基座」,而在 Agent Harness(驾驭层):DeepSeek 官方预览、LangChain deepagents-talon 稳定版、YC「先改 harness」叙事同窗撞车。
  • 选型话术从「谁第一」切到 任务面:Astra 偏代理/电脑操作,Fable 偏精细设计;浏览器类摘要数字约 77.3% vs 56.2%(待核)。
  • 创作演示在对冲:Higgsfield 用 Astra 做城市抗灾仿真;开源侧用 Fable 5.1 跑通儿童 3D 小游戏,反驳「只有一家能做整游戏」。
  • 权威研究线本窗无高信号;模型 Hub 大厂几乎无新基座——GLM-5.3-Flash 窗口更新、MiniCPM5-2B 下载量过低暂缓主力试跑。
  • 工程优先序:先固定记忆/工具/规则/反馈回路,再决定换不换旗舰模型;把 harness 当产品,而不是当「装模型的壳」。

执行摘要

时区:Asia/Singapore · 覆盖窗口约 2026-09-07 晨 → 2026-09-08 09:07 SGT · 证据标签:FACT / 官方自报 / 待核

今天没有又一次「大厂基座发版」的热闹,权威研究线扫描结论也是 主线收录 0——OpenAI Sep 6 双帖(Alien Mind / Research Acceleration)已在昨日深读,本窗只作指针、不复盘。真正挤进工程注意力的,是 harness 正面战场 与 选型口径切换 两条并行主线。

人话版: 模型像引擎,harness 像驾驶舱加工具箱。YC Today’s News 把话说得很直——很多人报「不重训、只改记忆/工具/规则/反馈」,任务完成率能从「半残」跳到「可用」;百分比数字一律 待核,但方向与同窗 GitHub 发布高度同构:FACT DeepSeek Harness dsh-v0.1.3-alpha.2(插件化子代理、Web Workspace、默认工具改 read/write/edit)、FACT LangChain deepagents-talon==0.0.7(Discord、可检索历史、MCP 热重载 + Slack/GitHub OAuth 的 batteries-included 稳定版),再叠 Qwen Code preview.2、Qwen-MM-Plugins、Codex rust alpha——赛道信号是「谁把驾驭层产品化」,不是「谁再堆一层框架」。

第二条主线是 从榜单到任务面:Today’s News 汇总开发者实测印象——Astra 偏代理/电脑操作、Fable 偏精细设计;浏览器类任务摘要约 77.3% vs 56.2%,价位都在约 $10–50 / 百万 token 档——数字来自新闻卡,待核原测评。Higgsfield 官方自报用 Astra 搭虚拟城市做海浪/地震参数实验;同时有人公开儿童小游戏 + 做法,称 Fable 5.1 也能跑通 3D/整游戏——对冲「只有一家能做」的演示叙事。

对工程/学习的即时含义: 本周评测表请按「操作面 / 设计面 / 长程编码面」分列,不要只贴一张总榜;自建 agent 先盘点 harness 缺口(记忆持久化、工具授权、规则注入、反馈回路),再决定要不要追下一代旗舰。模型 Hub 动作以窗口更新与轻量新卡为主——勿写成「今日扎堆发基座」。

主线 1:Agent Harness 正面战场——模型是引擎,驾驭层才是方向盘

背景与触发

窗口内最响的工程信号,不是又一个「从零写的 agent 框架」,而是 官方 / 准官方 harness 同时加码,并与社区讨论「先改外围架子」对齐。Harness(驾驭层)一句话:把模型接到真实工具、记忆、规则与人机回路上的那一层运行时——不是权重本身,而是「怎么开」。

FACT(DeepSeek Harness v0.1.3-alpha.2,约 2026-09-07T13:59:29Z,仓 ★ 约 215k 级):官方定位为插件化 Agent Harness 预览——子代理排队 / Steer、Web Workspace、默认工具改为 read / write / edit。对「自建 coding-agent 栈」的人,这是 DeepSeek 正面撞赛道的产品动作;纯 API 调用方可以跳过实现细节,但仍应读懂其默认工具面收缩:从「什么都能碰」改成「读写编辑优先」——更像给工程师发一套可控扳手,而不是整间无人车间钥匙。

同窗 FACT(deepagents-talon==0.0.7,约 2026-09-07T20:59:56Z,★ 约 29k):LangChain 把 batteries-included harness 推到 正式版标签语义——Discord 通道、可检索历史、MCP 热重载,并加上 Slack / GitHub OAuth。和 DeepSeek 的 alpha 预览形成对照:一边是模型厂自研驾驭层试水,一边是编排生态把多通道 + MCP + 子代理收成可安装产品。对多 agent / 办公 IM / MCP 团队,这份 changelog 比再追一个「新框架 README」更有用。

周边同场加码(扫 changelog 级,不单开主线):

信号一句话标签
Qwen Code v0.23.1-preview.2web-shell 动态 workflow、IPC 拒收/过期消息、session catalogFACT · 约 09-07 05:50Z · ★≈27k
Qwen-MM-Plugins跨 harness 原生多模态插件集;窗内 push、无新 ReleaseFACT · push ≈09-07 17:22Z · ★≈2.8k
OpenAI Codex rust-v0.154.0-alpha.6又发一枚 Rust alpha;release body 几乎空FACT · ≈09-07 18:03Z · ★≈122k
HyperFrames v0.8.31HTML→视频小版本;Studio 流式读媒体FACT · 工程补丁;短视频流水线会碰到

机制 / 产品形态(人话 + 对照)

类比: 换一台更大马力的引擎,挡位、仪表、后视镜坏了,照样开不好车。YC Today’s News 本窗讨论的核心主张正是:不重训模型,只把 记忆 / 工具 / 规则 / 反馈 四件套修好,任务表现可以「跳很大」——摘要里出现 OpenClaw 约 30%→95.5%、Prime Agent 部分测到 100% 等说法,一律标 待核(来自新闻卡转述,未见本窗独立复现)。方向可采信的部分是:收益经常落在封装层,而不是再等下一张基座权重。

把 DeepSeek / LangChain / Qwen / Codex 放在同一张「驾驭层能力表」上看:

轴DeepSeek Harness alphadeepagents-talon 0.0.7Qwen Code preview / MM-PluginsCodex rust alpha
定位模型厂自研 coding harness编排生态 batteries-included官方 CLI + 跨 harness 视觉插件对标 coding agent 持续微迭代
工具面默认 read/write/editMCP 热重载 + OAuth 通道web-shell workflow;多模态插件body 空,盯 tag 即可
成熟度alpha,宜 clone 试稳定版语义,值得扫 changelogpreview,已跟者升级alpha 连发,非大功能日
对谁自建 harnessDiscord/Slack/MCP 团队Qwen 栈用户版本跟踪者

机制级要点(写进工程笔记即可):

  1. 子代理排队 / Steer: 不是「多开几个聊天窗」,而是把任务切片、优先级与人工纠偏做成一等公民——对应你是否能在轨迹里看到「谁在等、谁被打断」。
  2. Web Workspace: harness 开始默认带「可观察工作区」,而不是只回一段文本;和 computer-use / 代码执行沙箱同一哲学——执行环境主权在应用方。
  3. MCP 热重载 + OAuth: 工具目录会变、凭证会轮换;协议无状态不等于你的会话/授权无状态(承接前几日 MCP 主线,不复述)。
  4. 默认工具收缩为读写编辑: 看起来「变弱」,其实是把破坏面从「任意 shell」收到「可审计文件操作」——和安全评测里的 deny-write / allowlist 同向。

热仓边栏(非主线,但同主题):FACT M3E Canvas(★≈4680,demo)——浏览器里画 Material 3 界面,一键生成 prompt 喂给 coding agent,强调设计→agent 零后端;Trendshift 自报数据 待核。另有同日新建的 holo-card-studio(★≈835,created 2026-09-07)把「描述/图 → Blender 卡牌 + Three.js」收成 skill——说明 skills / harness 叙事已从纯编码扩到视觉生产,infra 读者可忽略。

证据与边界

声明标签来源
DeepSeek Harness / talon / Qwen Code / Codex / HyperFrames 版本与时间戳FACT各 GitHub Release 页
「先改 harness 可大幅跳分」及 30%→95.5% / 100% 等待核Today’s News 卡转述 YC 讨论
M3E Canvas 星数与 demo 可访问FACT;Trendshift 排名 待核GitHub + demo 站
Codex alpha body 空 = 无功能推断谨慎仅说明 release notes 未写,不代表无 commits

开放问题: DeepSeek Harness 预览默认工具面是否会在正式版重新放开 shell?talon 的 MCP 热重载在生产多租户下的隔离边界?二者与「可移植 skills 包」生态如何互操作——本窗无一手答案,待核后续 changelog。

对工程与产品的启示

  1. 本周实验设计: 固定同一模型,只改 harness 四件套(记忆持久化、工具授权表、系统规则、失败反馈),报告 Δ——别一上来就换旗舰。
  2. 采购话术: 问供应商「你们的 agent 产品差异在权重还是在驾驭层?」;若答不出轨迹、干预率、工具 allowlist,差在运营不在模型名。
  3. 安全默认: 新 harness 若仍默认宽 shell,先收成 read/write/edit + 显式 escalate;对齐 DeepSeek 预览的收缩方向。
  4. 跟踪清单: DeepSeek alpha 可 clone;talon 0.0.7 扫 changelog;Qwen Code / MM-Plugins 已跟者升级;Codex 只盯 tag;HyperFrames 仅视频流水线需要。

主线 2:选型从榜单到任务面——Astra 操控、Fable 细活,演示叙事正在对冲

背景与触发

旗舰发版后的第 4–5 天,讨论焦点自然从「发布会总分」滑向「我这单任务该用谁」。Today’s News 本窗给出的开发者对照印象很清楚:Astra 偏代理 / 电脑操作;Fable 偏精细设计——不是道德判断,是任务面分工。摘要卡还给出浏览器类任务约 Astra 77.3% vs Fable 56.2%、价位同落在约 $10–50 / 百万 token——待核原测评方法与样本量;能写进笔记的只有「方向:操控面 Astra 口述更强,设计细活 Fable 口述更强」。

并行发生的是 演示叙事对冲:一边有厂商用最强 computer-use 模型做「虚拟城市抗灾实验」;一边有人用开源小游戏证明「整游戏」不是独家绝技。对产品与学习读者,这比再转一篇「谁赢了」更有用——你要的是可复现工作流,不是品牌忠诚。

机制 / 产品形态

人话: 选模型像选相机——风光机和街拍机都能出片,但你不会拿同一张「总榜 DxO」决定今晚拍夜景还是拍证件照。浏览器代理、像素级 UI 改稿、长程编码、3D 场景生成,是四张不同的「任务面」;把它们压成一个冠军名,下一步一定买错。

任务面对照(摘要卡印象 + 演示,非官方排行榜):

任务面更常被点名的方向本窗信号证据标签
浏览器 / 电脑操作代理AstraToday’s News:浏览器类约 77.3% vs 56.2%待核 摘要卡
精细设计 / 细活Fable同卡「偏精细设计」口述待核
城市仿真 / 参数实验Astra + 厂商工作流Higgsfield:调海浪/地震测建筑官方自报 演示
整游戏 / 3D 小游戏Fable 5.1 开源复现儿童小游戏 + GitHub 做法公开待核 帖文与仓需点开核验
价位锚两边同档约 $10–50 / 百万 token待核 摘要卡

Higgsfield 演示(官方自报,完整度看视频):用 GPT-6 Astra 搭虚拟城市,调节海浪 / 地震等参数观察建筑响应——属于 computer-use / 仿真 demo 浪潮续集,不是论文级气候或结构工程结论。正确读法是:旗舰 CU 正在被接进垂直创意工具链;错误读法是「AI 已经替代土木仿真软件」。

开源对冲(待核):有人公开儿童向小游戏与做法,称 Fable 5.1 也能跑通 3D / 整游戏流程并附 GitHub。意义不在「分数翻盘」,而在:演示叙事若写成「只有一家能做整游戏」,开源复现会立刻打脸——工程学习价值是可点开的工作流,不是口号。

Codex→3D 场景教程本窗亦有转发,属弱增量工具链参考,不进主栏深挖。

证据与边界

声明标签来源
Astra vs Fable 任务面印象与 77.3% / 56.2% / 价位档待核Today’s News 选型卡
Higgsfield 城市仿真 demo 存在官方自报Higgsfield 公开演示帖
Fable 5.1 跑通开源小游戏待核公开帖 + 所称 GitHub;需点开核验
「只有 Astra 能做整游戏」应降级为营销话术与开源对冲并存时勿单边引用

开放问题: 浏览器类百分比的题目集、步数上限、是否允许人工干预?Fable「精细设计」优势是否在静态视觉评分、还是在多轮改稿稳定性?本窗没有原测评 PDF/仓库,一律待核。

对工程与产品的启示

  1. 内部评测表改版: 至少三列——操作面(browser/CU)、设计面(视觉/改稿)、编码面(长程 repo)——禁止只用一个「综合分」做采购。
  2. 演示验收: 厂商 demo 必须附「可复现步骤 + 失败案例」;只有高光视频 → 标 官方自报,不进决策。
  3. 学习路径: 复制开源小游戏工作流 1 次,比追 10 条「谁更强」帖更有复利;同时用同一题集在两条模型上跑,记录干预次数。
  4. 成本: 价位同档时,差异更可能来自失败重试与人工接管,而不是标价本身——仪表盘要记「成功任务全成本」。

次要动态

模型 Hub(无新大厂基座)

窗口至约 09:08 SGT:大厂几乎无新基座,动作以更新与轻量新卡为主——勿写成发版日。

模型卡信号建议标签
zai-org/GLM-5.3-Flash窗口官方更新(mod≈09-07 12:13Z);快且便宜的多模态对话;likes≈2133、dl≈78 万、MIT开源中文/多模态优先可跟FACT
openbmb/MiniCPM5-2B窗口新卡;标长上下文 + 工具调用;dl≈13端侧/轻量可看,暂缓主力试跑FACT;能力 待核
tencent/EVIE-Preview-4.5B视觉文档检索(非聊天)文档 RAG 相关可扫;部分 EVIE 卡 dl=0 慎选FACT
IFM/K2-Horizon-MoVA-36B-A4B开源 MoE 文本,窗内再更新扫一眼即可FACT

仅热度降权:Spark-X2.5-4B 冲榜前列(待核);Qwen3.8 / DeepSeek-V4-Vision / TimesFM / MiniMax-H3 中枢未变。数据集 openbmb/UltraData-* 有更新但下载个位数。Uncensored 魔改、downloads=0 的卡日报忽略。

权威研究 / CSR(本窗低信号)

研线裁决:主线收录 0。可备案、默认不深读:

arXiv 为 Labor Day 后首个 /new 窗口,无大厂挂名高热——宁缺毋滥。

指针:OpenAI Sep 6 双帖(不复盘)

Alien Mind(监控承压 / 自愿放缓)与 Research Acceleration(automated research intern、3.1× agent-workdays 等 官方自报)已在 2026-09-07 深读成对展开。本窗 X 侧仍有转发余波,不重复机制级复盘;需数字与刹停故事请回昨日正文与 An Alien Mind、Research Acceleration。

来源与延伸阅读

今日行动建议

  1. 固定模型、只改 harness: 选一个你已在用的 coding agent,今天只动记忆 / 工具 allowlist / 规则 / 失败反馈四项中的两项,写清前后成功率与人工干预次数。
  2. clone 试 DeepSeek Harness alpha: 重点看子代理排队与默认 read/write/edit;纯 API 业务可只读 Release 说明,不必上生产。
  3. 扫 talon 0.0.7 changelog: 若团队已用 Discord/Slack 或 MCP,评估热重载与 OAuth 是否减少「重启整栈才能换工具」的摩擦。
  4. 改一版内部选型表: 至少拆操作面 / 设计面 / 编码面三列;把 Today’s News 的 77.3% / 56.2% 标成 待核,用自己的 10 条题复测后再决策。
  5. 演示对冲练习: 花 30–60 分钟点开 Fable 5.1 开源小游戏做法(链接 待核 需自验),对照 Higgsfield 高光视频——记下「可复现步骤缺什么」。
  6. 模型跟进纪律: GLM-5.3-Flash 可作中文多模态便宜底座观察;MiniCPM5-2B 等 dl 上来再主力试跑;EVIE 只在文档 RAG 场景扫。
  7. 研究日历: 本窗权威线空窗属正常;把精力留给 harness 实验,Alien Mind / Acceleration 数字需要时回 9/7,勿在日报里二次扩写。
🎵 看累了听个音乐吧
跟鬼哥聊聊 AI