工具测评 · FENGDAO AI RESEARCH

双阶段 DeepSeek Harness 预设:先把模型立稳,再上全量工具

一周拿下 2188 颗星的 dsh-anchored-standard 走的是一条克制的路线:先用极简预设让 DeepSeek 模型对齐,再挂上完整的 Standard 工具集,分两步把 agent 跑稳。

2026年8月16日3 分钟读完冯导AI研究院11 次阅读#deepseek#deepseek-harness#agent工程
双阶段 DeepSeek Harness 预设:先把模型立稳,再上全量工具
用最少工具把模型先立稳,再分批放工具,是目前 DeepSeek Harness 接入里性价比最高的一条路径。

适合:想在 DeepSeek 上搭 agent、又被工具过载和输出漂移折磨过的开发者与团队。

先说结论

很多 DeepSeek Harness 插件一上来就把工具铺满,模型还没坐稳就先忙着调 API。结果是看起来功能很全,真跑起来要么空转,要么乱调用。dsh-anchored-standard 这个项目把节奏拆成了两段:先用 Minimal-aligned bootstrap 把模型的边界和语气打稳,再把完整的 Standard 工具集挂上去。它一周能拿下 2188 颗星,根本原因就是把“先立住,再扩量”这件事做成了默认动作。

真正的问题

把 DeepSeek 接到 agent 框架里,真正的难点从来不是“有没有工具”。同一个模型,配的工具一复杂,输出就开始漂移:今天稳如老狗,明天同一个 prompt 就能跑偏。问题出在三层:

第一层是对齐基线不固定。同一个底层模型,没有明确边界的话,调用工具的先后、解释问题的方式都会随手感漂移。第二层是工具负担过载。工具一多,模型选择困难,间接让响应变慢、成本变高。第三层是评测指标没对齐。很多项目只贴分数,没说清楚在哪条 prompt、哪类任务下测的,参考价值有限。

dsh-anchored-standard 的解法很直接:用 Minimal-aligned bootstrap 当地基,把模型先“摁”在一个稳定的回答区间里;再上 Standard 工具集做功能扩展。等于是先测地基,再盖楼。

怎么做更省力

如果你打算自己接 DeepSeek Harness,没必要从零配起。沿用这个项目的两段式思路,会比硬塞工具高效得多:

阶段目标关键动作收尾标志
Bootstrap锁语气与边界只给最简工具,跑固定评测集风格稳定,输出可控
Standard扩展能力挂全量工具,加真实业务场景完成度与一致性兼顾

第一步的省力点在于:工具越少,模型越容易“听话”。bootstrap 阶段把标准对话、提示词模板和轻量工具先跑通,等输出曲线平稳之后再加复杂能力。第二步的省力点在于:先用 Project2 98/99 这类基础集验证,再让 Standard 工具集进场,避免一上来就撞上工具兼容性问题。

代码全在仓库里,主语言是 JavaScript,结构和注释都偏向直接抄。如果你打算二次封装,完全可以照着它的两阶段脚本拆成自己的 bootstrap.json 和 standard.json,再按需接入业务工具。

哪些坑要避开

一是不要跳过 bootstrap 阶段。直接上 Standard 工具集,表面上节省时间,实际上模型的行为会很不稳定,后续调试成本反而更高。二是不要把“分数”当唯一标准。Project2 98/99 这类指标是用来判断基线是否稳定,不是拿来炫技的。三是注意工具命名冲突。Standard 工具集一旦和你的业务系统同名,模型选择会混乱,最好在接入前做一次工具去重。四是留意调用频率与 token 成本。工具越多,单轮调用的隐藏开销越大,上线前最好跑一轮压测。

现在就能动手

打开仓库,看一遍 release 说明和 bootstrap 配置,对照自己的 prompt 先跑一次 Minimal-aligned 基线。等输出风格稳了,再按业务需要把 Standard 工具集分批挂上去,每加一类就回归一次评测集。如果想顺便整理一份给团队看的接入方案,可以把这两阶段的配置和指标丢进 Markdown 智能编辑器,快速生成一份可直接交付的接入说明。

继续阅读