过去两年,AI 行业一直在争论 GPT、Claude 和 DeepSeek 谁的模型更强。但到了 2026 年 8 月,竞争开始向下移动一层:DeepSeek 发布 DeepSeek Harness,OpenAI 更明确地展现 Codex 作为开放 Agent 基础设施的形态,Earendil 也发布《What is a Harness?》,讨论 Harness 的技术组成与用户所有权。
这一期,我们聊聊 Harness 为什么不只是包在模型外面的 Agent Framework,而是正在成为影响 Agent 表现、开发者生态、任务成本、执行轨迹,甚至模型后训练的关键变量。
当模型能力逐渐接近,下一轮竞争可能不再只是“谁拥有最强模型”,而是谁能率先转动最强的 **Model × Harness** 飞轮。
你会听到
- Harness 到底是什么,为什么同一个模型换一个 Harness 就像换了一个产品
- 为什么 Agent 能力更接近 `Model × Harness`,而不是单独由模型决定
- DeepSeek-V4-Flash 的后训练释放了什么信号
- Harness 为什么正在从运行环境延伸为训练环境
- 真实 Agent 执行轨迹为什么可能成为下一代训练数据
- DeepSeek、OpenAI 与 Earendil / Pi 对 Harness 的三种不同主张
- Harness 为什么可能同时形成平台飞轮和数据飞轮
- Agent 商业模式为什么可能从按 Token 计费转向按任务或结果计费
- 谁可能掌握 Agent 时代的控制层、计量层与后训练入口
#时间轴
00:00|Harness 为什么突然成为竞争焦点
DeepSeek、OpenAI 和 Earendil 在相近时间集中谈论 Harness。一个后台工程概念,开始变成前台产品品类。
01:02|Agent 的能力不只取决于模型
同一个模型进入不同 Agent 产品,表现可能截然不同。上下文、工具调用、错误恢复、压缩、子 Agent、人工审批和停止条件,都由 Harness 参与决定。
01:52|Agent = Model × Harness
很多被视为“模型能力”的结果,实际上测到的是模型与 Harness 的组合能力。Harness 本身会影响成功率、速度、Token 消耗和单次成功成本。
02:36|DeepSeek-V4-Flash 后训练释放的信号
在模型架构和规模没有明显变化的情况下,V4 Flash 通过重新后训练提升多项 Agent 基准表现;部分代码 Agent 测试运行在 DeepSeek Harness 极简模式中。
03:06|Harness 从运行环境走向训练环境
训练一个擅长 Agent 任务的模型,绕不开工具选择、错误恢复、任务拆解、子 Agent 调度、Token 效率和停止条件。Harness 定义的不只是模型在哪里运行,也包括模型学习怎样行动的行为环境。
04:12|真正值钱的可能不是插件,而是执行轨迹
一条真实任务轨迹记录了 Agent 如何计划、调用工具、遭遇失败、进行恢复、接受人工干预并最终完成任务。这类数据教给模型的不只是“如何回答”,而是“如何把事情做成”。
05:13|平台飞轮与数据飞轮
Harness 的潜在飞轮是:标准带来采用,采用带来真实任务,任务产生执行轨迹,轨迹帮助改进评估、奖励设计和后训练,进而提升 Agent 表现。
06:06|DeepSeek Harness 的战略价值
“Everything is a Plugin”强调模型、工具、沙箱、调度循环、子 Agent 和界面的可替换性。DSH 的长期价值可能不只是一个开源框架,而是建立 Model 与 Harness 协同演化的生态基础。
07:11|DeepSeek 与 OpenAI:可组合还是可嵌入
DeepSeek 更强调重新拼装 Agent 的可组合性;OpenAI 更强调把成熟 Agent 能力接入业务系统的可嵌入性。两条路线背后,对应开放运行时生态与一体化模型闭环。
08:47|Earendil / Pi:Harness 应该属于谁
Earendil 除了定义系统提示词、工具、Agent 循环和模型转换层,还强调用户可以拥有并改造自己的 Harness。模型可以替换,但工具、会话、工作流和历史状态可以留在用户手里。
09:33|三种 Harness 叙事
DeepSeek 强调可组合,OpenAI 强调可嵌入,Earendil / Pi 强调可拥有。Harness 的定义之争,本质上也是 Agent 控制层的归属之争。
10:20|Harness 会成为 Agent 时代的 CUDA 吗
事实标准会吸引开发者和工具围绕它优化。与传统平台不同,Harness 还可能连接真实任务产生的行为数据。
10:52|从 Token 价格到单次任务成本
企业真正关心的不是每百万 Token 多便宜,而是完成一次任务需要几步、多少次工具调用、几个 Agent,以及多少人工介入。
11:17|Harness 可能成为结算基础设施
如果 Agent 服务从按资源计价走向按任务或效果计价,Harness 所记录的步骤、工具、人工干预和任务结果,就可能成为计量与结算的基础。
11:42|真正难复制的是 Agent 行为数据库
代码可以 Fork,插件可以重写,API 可以兼容;真正难复制的是大量真实 Agent 如何一步一步完成任务,以及其中哪些路径有效、哪些调用只是浪费。
12:35|模型战争正在下沉
表面争夺运行时,再往里是开发者生态和执行轨迹,最终连接下一代模型后训练。真正值得关注的是谁能率先转动 Model × Harness 的复利飞轮。
本期核心判断
谁定义主流 Harness,谁就更有机会影响 Agent 应该如何行动;谁拥有规模最大、质量最高并且合法可用的真实执行轨迹,谁就更可能获得下一代 Agent 后训练的优势。
补充说明
开源 Harness 获得大量采用,并不意味着维护者会自动获得用户的执行轨迹。数据飞轮能否成立,还取决于托管服务、遥测设计、用户授权、企业隐私要求,以及社区是否主动回传评测结果。节目中相关讨论应理解为一种有条件成立的战略可能性。
## 本期关键词
Harness、AI Agent、DeepSeek Harness、DSH、DeepSeek-V4-Flash、OpenAI Codex、Pi、Earendil、Agent Runtime、后训练、执行轨迹、Agentic Loop、子 Agent、Token 成本、按任务计费、模型中立、开发者生态