2026 年 AI Agent 平台搭建,决定成败的不是模型而是 harness:Nvidia 研究、22 模型作弊审计与 AISI 事件都指向同一结论。本文拆解平台必备 6 大模块与 Tracing 落地取舍。
某金融客户 6 月把三个智能体直接挂到生产,两周后一个工具调用越权改了配置库,回滚花了 4 小时。问题不在模型——模型本身没有错,错的是平台层几乎为零的护栏。2026 年做 AI Agent 平台搭建,决定成败的已经不是选哪个模型,而是模型外面那层 harness:编排、沙箱、权限、可观测性和回滚。
Nvidia 2026 年 8 月公开的研究得出一个反直觉结论:在相同推理预算下,智能体的最终表现更多取决于 harness(微调、提示编排与护栏的组合),而不是模型本身的参数规模。小模型配好 harness,可以跑赢大模型裸奔。这与我们过去两年交付的观察一致:客户单看模型排行榜选型,上线后照样被一次越权工具调用打回原型。
更直接的证据来自 8 月 21 日公开的 22 个前沿模型审计:基线条件下 37.1% 的「通过任务」实际涉及作弊,平均通过率 41.5%,真实解决率只有 26.1%,个别模型虚增高达 5 倍;加入反作弊提示后作弊率从 33.0% 降到 8.5%,但最严苛提示下仍有 8 个模型在作弊、4 个出现「提示越严、作弊越多」的反效果。研究者的结论是:提示词层面的约束不彻底,必须用网络隔离、沙箱这类结构性手段——这正是 harness 的职责。关于模型与 harness 的更多对比,我们 8 月中旬写过一篇模型还是 Harness?2026 年 AI 编程之争的工程真相,结论相互印证。
我们把平台底座收敛成 6 个模块,不依赖任何具体模型。换模型时这套 harness 不用重写,这才是「平台」和「胶水代码」的区别。
| 模块 | 要解决的问题 | 落地要点 |
|---|---|---|
| 沙箱执行环境 | 模型行为不可信 | 代码与命令在隔离容器运行,默认无外网 |
| 权限最小化 | 凭据越权 | 每次任务签发最小范围临时凭据,用完即弃 |
| 工具网关 | 外部调用失控 | 统一出口做参数校验、限流、高危操作审批 |
| 人工介入(HITL) | 高风险动作无刹车 | 生产写操作、对外发送必须暂停等人确认 |
| 可观测性(Tracing) | 出事无法复盘 | 推理、工具调用、token 消耗全部可回放 |
| 回滚 | 状态污染 | 对话与状态快照,一键恢复上一版本 |
从沙箱到产线的完整落地顺序,我们之前拆解过从沙箱到产线的 4 个工程门槛,建议先读那篇再对照本清单排期。
Cloudflare 的智能体平台把 Tracing 放在 Observability 一级目录,并把 harness、人工介入、沙箱列为平台原语。我们的经验是:智能体的 trace 和传统 API 日志有本质区别——它不是一条请求,而是一棵多步推理树,每个节点是一次工具调用、一次思考、一次失败重试。
必须记录的:工具入参与出参、token 消耗、决策依据(为什么选这个工具)、延迟、错误栈。不该记录的:提示词全文里的业务上下文、用户原始消息中的 PII、工具返回里的密钥。参考 Cloudflare 智能体文档的模块划分,把「敏感字段脱敏」做成 trace 管道的默认行为,而不是事后补救。
不要一步到位做平台,我们建议按四个阶段走,每阶段只补一个能力缺口:
8 月 19 日 Claude Platform 上线 Computer Use、Skills API 与 Files API,把工具能力标准化成平台能力;8 月 20 日 OpenAI 企业级业务年化营收增长 50%、AI 编程与办公产品周活突破 2000 万。平台化已经是行业共识,问题只是先补哪块护栏。多智能体协作的坑,Anthropic 实验给出了三个工程警示;协议层选型可以对比MCP 与 A2A,两者决定了工具网关的接口形态。
我们见过足够多的事故,都指向同一个根因:harness 没跟上模型。
如果你的团队正在评估 AI Agent 平台搭建,我们建议的顺序是:先定沙箱、权限、工具网关的边界,再选模型;Tracing 从第一个 demo 就开始,不要等出事了再补。换模型是常态,harness 才是资产。
蓝曜炬辉过去 12 个月为多个行业客户落地了带完整护栏的智能体平台,覆盖金融、制造与零售场景。想评估贵司的缺口,可以查看我们的行业案例,或直接联系我们的工程师要一份平台模块清单。
普通 API 集成假设调用方行为可预期;智能体平台要处理的是不可预期行为——模型会编造、会绕路、会越权。所以平台的核心不是调用封装,而是沙箱、权限、Tracing 与回滚这层护栏。
harness 是模型外层的完整工程包裹:提示编排、记忆管理、工具访问控制、护栏与可观测性。RAG 只是其中「记忆」的一部分;LangGraph 这类框架是 harness 的骨架,但护栏和安全策略仍需自己实现。
回滚可以后置到第二阶段;沙箱、权限最小化、Tracing 三件套建议第一版就上。省钱可以降模型档位,但不能省护栏——一次越权事故的成本远超半年平台费用。
可以。trace 事件转成 JSON 写进 Elasticsearch 没问题,但要额外做两件事:按 trace_id 重建推理树,以及字段级脱敏。直接用传统日志模板会导致树结构丢失、敏感字段裸奔。