DeepSeek 开源 Harness(dsh)后,自建 Agent 运行时的决策点不止架构。本文聚焦四种运行模式怎么对应业务、仅追加事件日志如何补上评测闭环,以及自建前 4 个判断维度与 0.1 版风险。
上个月我们帮一家物流客户迁移多智能体系统,卡点不在模型,在运行时:一体化框架把循环、工具、会话全部耦合,升级一个插件就要重发整个服务。8 月 26 日 DeepSeek 开源了 Harness(dsh)开发者预览版,用 MIT 许可把「智能体基础设施」拆成可替换插件。这篇文章拆解四种运行模式怎么接业务、事件日志如何补齐评测闭环,以及自建 Agent 运行时前该做的 4 个判断。
LangChain、CrewAI 这类框架把智能体循环、工具调用、记忆、模型端点打包成一个整体。业务想定制其中一环,就得动框架内部;框架升级版本时,还可能踩到破坏性变更。插件化框架的工程信号,在 开源底座重开选型窗口:Qwen 2.4T 权重开放与插件化框架的工程信号 一文里也有对照。
dsh 构建在 Cordis 元框架之上,采用微内核架构:模型适配器、工具注册表、沙箱环境、会话状态处理器、事件分发器、用户界面都作为独立插件加载,彼此隔离、可以替换。换模型端点(远程 API 与本地推理服务器之间切换)不需要改核心逻辑,通过 YAML 或 JSON 声明式配置指定环境约束、插件依赖和运行时参数即可。
| 对比维度 | 一体化框架 | dsh 微内核运行时 |
|---|---|---|
| 组件关系 | 紧耦合模块 | 独立插件、可替换 |
| 切换模型端点 | 改代码 + 重部署 | 改声明式配置 |
| 扩展工具 | 侵入框架内部 | 注册表插拔 |
| 执行回放 | 通常没有 | 仅追加事件日志 |
| 成熟度 | 生态较稳 | 0.1 预览版 |
0.1 预览版内置四种基础配置,对应不同的执行约束:
选型时不用一上来就四套都上。先想清楚业务是偏「读网页做判断」还是「批量调工具跑流程」,前者从 Standard 起步,后者从 Code 起步更省事。
我们做 Agent 评测时最头疼的是中间状态不可见:失败之后分不清是模型判断错、工具调用错,还是上下文被污染。dsh 的事件日志是仅追加的,用户消息、工具调用、中间推理状态、Token 指标、子智能体派发全部写入同一条执行轨迹。
这条结构化轨迹能做三件事:执行历史回放、执行错误隔离、对不同运行中的模型行为做基准测试。对准备自建的企业,评测闭环往往比框架本身更值钱——评测不闭环,后续优化全是盲改。我们内部给客户做多智能体项目时,也一直把「可回放」作为运行时选型的硬条件,相关讨论可看 智能体基础设施迁移:K3 开源、托管升级与搜索组件三线并进。
dsh 开源不等于每个团队都应该自建。我们给客户用的判断框架是 4 个问题,四个都回答「是」才建议自建:
四个维度里,沙箱安全最容易被低估。我们见过不止一个团队为了「灵活」放开 Shell 权限,最后被安全评审卡住上线。运行时里真正花时间的往往不是模型调用,而是护栏代码,Agent Framework 运行时选型:98.4% 代码是护栏不是模型 对这个问题拆得更细。
dsh 仍处于活跃开发者预览阶段。Reddit LocalLLaMA 社区与 GitHub Discussions 上的讨论,集中在响应式生命周期管理和动态插件注册。观察者普遍提醒:扩展契约和配置模式仍可能出现破坏性变更,社区生态也还没有稳定下来。
建议先在隔离环境用 Standard 或 Creator 模式跑 PoC,验证插件替换、事件日志能否满足你的场景,再决定是否进入生产。别把刚上线的业务直接押在 0.1 版上。
如果团队正在做智能体基础设施选型,可以参考我们过往的多智能体交付案例与选型复盘,或者直接和我们聊聊你们的场景,查看完整案例与联系蓝曜炬辉。
不是替代关系。LangChain 提供一体化的开发体验,dsh 是更底层的执行运行时,把智能体循环、工具、模型端点拆成相互解耦的插件层。可以用 dsh 做运行时,上层自己编排业务逻辑。
不建议。扩展契约和配置模式仍可能破坏性变更,插件生态未稳定。先在隔离环境用 Standard 或 Creator 模式做 PoC,验证插件替换与事件日志满足需求后再评估。
三件事:回放执行轨迹、隔离执行错误、对不同模型的同一任务做基准测试。评测与故障定位都依赖这条可回放记录。
已经在自建 Agent 运行时、被一体化框架的耦合拖累、或者需要评测闭环的团队。只做现成编排的团队,暂时没有迁移必要。