← 返回资讯中心
AIcoding2026-07-10

AI Agent 落地企业的三个工程债:授权、上下文、成本

2026年7月,MCP企业统一授权推到稳定版,红杉更新AI基建支出达1.5万亿美元。智能体能力在进化,但企业落地仍被授权、上下文管理、Token成本三个工程问题卡住。

AI Agent 落地企业的三个工程债:授权、上下文、成本

2026 年上半年,一家中型 SaaS 公司的技术负责人找到我们。他们花了三个月用 LangChain 接入 GPT-5 搭了一套内部智能助手——能查 CRM、能调 API、能自动写周报 SQL——Demo 跑得很漂亮。推到 50 人团队试用两周后,安全团队紧急叫停:这个 AI 助手的 OAuth Token 权限与实际员工角色完全不对等,有人绕过权限隔离,查到了不该看到的客户合同。这种 POC 漂亮但上不了生产的困境并非个例,我们在另一篇文章里拆过背后的五个工程死结

2026 年 7 月 9 日,MCP 协议正式将企业统一授权扩展到稳定版,Anthropic、微软、Okta 同步接入;同一天,红杉资本合伙人 David Cahn 更新了 AI 基础设施支出估算——全球 2026 年投入 1.5 万亿美元,行业需要产生 3 万亿收入才能回本。一边是基础设施军备竞赛白热化,一边是企业落地时还在被授权、上下文管理、Token 成本这些"非模型问题"卡住。

本文拆解这三个工程债的表现与务实还法。

一、授权债:AI 助手拿到了不该拿的钥匙

企业里最典型的接入场景是什么?让 AI 能读 Jira、查 Confluence、调 CRM API、访问数据库。每个系统有自己的鉴权机制,传统做法是给 AI 配一个 OAuth Token,以某个"服务账号"的身份去访问。

问题出在:这个服务账号的权限通常比任何一个真实员工都大。安全团队对此非常不安——这不止是一个只读查询工具,如果被赋予了调用 API 的能力,一次错误的工具选择可能造成生产事故。

MCP 团队显然听到了社区的抱怨。2026 年 7 月 9 日发布的企业托管授权扩展(EMA),核心设计是把授权决策从"每个员工 × 每个服务器"的笛卡尔积,迁移到企业身份提供商统一管理。用户只需登录一次,即可访问所有已获批准的 MCP 服务器,不再逐个弹窗授权。

公告中明确写道:"我们从社区了解到,来自已连接 MCP 服务器的重复授权提示,是企业管理连接性时最大的痛点之一。"EMA 将身份策略与工具调用分离——企业托管层决定用户能否将客户端连接到服务器,但并不检查 MCP 流量本身。也就是说,运行时 AI 具体做了什么操作,EMA 不负责。MCP 团队在指南中提示:这并非针对单步操作的运行时授权,企业仍需自行搭建管控体系。

目前在服务器端,Asana、Atlassian、Canva、Figma、Linear、Supabase 已支持 EMA,Slack 正在适配。对于已接入或计划接入 MCP 的团队来说,这是一个必须跟进的基建项。

二、上下文债:它要的不是你的 Prompt,而是理解你的意图

2026 年最大的一个认知转变是:这类 AI 系统的主要价值不再发生在"写代码/执行任务"那一刻,而是发生在需求讨论和方案澄清阶段

火山引擎在 7 月 9 日 InfoQ 发布的一组数据很能说明问题:TRAE Work 的"语音讨论"功能中,用户平均每通对话交互 17 轮;其中 60% 属于探索发散型对话,70% 用于方案讨论,只有 30% 用于代码生成。这意味着使用模式已经从前两年的"写好 Prompt 等结果"变成了"和人讨论清楚再动手"。

另一组来自联想天禧 AI 的数据:从 2025 年 8 月上线到 2026 年 5 月,人均对话轮次提升至刚上线时的 1.65 倍,是传统一问一答模式的 3 倍。豆包 App 2026 年 Q1 的音频用量环比增长约 200%,视频用量增长约 350%,音视频模型日均 Token 消耗已达千亿级别。

这些数字指向同一个趋势:AI 正在从"结果生成器"变成"协作伙伴"——它进入任务的时间点从执行环节前移到了需求形成和方案讨论环节。但这对企业落地意味着什么?

意味着你的应用需要一个靠谱的上下文管理方案。不是简单的"把历史消息全塞进 System Prompt",而是:会话记忆如何持久化?多轮对话中如何区分"背景信息"和"当前任务"?跨会话的上下文如何复用?这些是工程问题,不是模型问题。我们在实际项目中踩过的坑:用 naive 方式存储全量对话历史,单次推理的 Token 消耗两周内从 3000 膨胀到 18000,响应反而变慢。

三、成本债:Token 降价了,但你的账单可能还在涨

红杉的 David Cahn 在 2026 年 7 月更新的AI 基础设施支出报告里算了一笔大账:全球 AI 基础设施投入 1.5 万亿美元,行业总共需要赚 3 万亿美元才能回本。Anthropic 年化收入 600 亿美元,OpenAI 2025 年全年收入 130 亿美元——缺口还非常大。

这意味着模型厂商有极强的动力压低 Token 价格来刺激用量。Sam Altman 透露 OpenAI 最新模型在编码任务上的 Token 效率提升了 54%,价格持续下降。阿波罗全球管理公司首席经济学家 Torsten Sløk 则警告:越来越多的组织转向更便宜的开源模型(尤其中国模型),如果超大规模厂商现金流目标落空,可能触发经济衰退和标普 500 回调。企业 AI 落地正在分裂成两条轨道:一条烧钱验证前沿模型,一条用开源模型省钱跑量——选哪条,决定了你的成本结构。

但对企业用户来说,Token 单价下降不等于总成本下降。智能应用的用量模式是"多轮对话 + 工具调用 + 上下文膨胀",用户越用越频繁。我们在一个客户项目中观察到:引入 AI 编程助手后,单用户日均 API 调用次数翻了 4 倍,虽然单次调用价格降了 30%,总账单反而涨了 180%。

另一个被低估的成本来源是工具调用的隐性开销。每次调用一个 MCP 工具,背后可能触发多次 LLM 推理(选择工具 → 构造参数 → 解析结果 → 决定下一步)。一个看似简单的"帮我查一下上周的销售数据",实际可能产生 6-8 次模型调用。如果工具链设计不做收敛,成本会失控。

怎么还这些债:一个务实清单

三个债不是孤立存在的——授权不做好,上下文再多也是安全漏洞;上下文管理不当,Token 成本就会线性膨胀。多智能体架构的工程决策同样受这三个变量的约束。以下是我们在实际交付中验证过的还债清单:

  1. 授权层:在 EMA 之上加一层运行时策略引擎。EMA 解决了"能不能连"的问题,但"连上之后能做什么"需要自己建一套操作级权限策略。对于数据库写操作、API 调用、外部发送等高风险动作,建议做二次确认或硬编码白名单。
  2. 上下文层:采用"摘要 + 滑动窗口"混合策略。不是把所有历史对话都塞进 Prompt。超出窗口的旧消息用轻量模型做一次摘要压缩,近期消息保留完整。对跨会话的关键决策点(如"客户要求 API 版本用 v2"),存入结构化记忆而非纯文本。
  3. 成本层:对工具调用链路做收敛。审查工具定义——是否有功能重叠?是否每个调用都必要?一个常见优化是合并查询类工具(如把"查客户信息"和"查客户订单"合并为带参数的单一工具),减少选择空间,也减少推理轮次。
  4. 监控:给系统加一套可观测性。记录每次工具调用的耗时、Token 消耗、成功/失败状态。不做监控就上线,相当于开一辆没有仪表盘的车。

常见问题

问:MCP EMA 能完全解决企业授权问题吗?

不能。EMA 解决的是连接级授权(用户能不能连上某个 MCP 服务器),不覆盖操作级授权(连上之后能不能删库)。企业需要额外搭建运行时策略层。

问:上下文窗口越来越大(百万级),还需要做摘要压缩吗?

需要。两个原因:一是长上下文中模型对中间位置的注意力天然衰减("Lost in the Middle"效应依然存在);二是长上下文 = 更多 Token = 更高延迟和成本。用摘要把历史信息浓缩到几千 Token 再传入,是工程上的帕累托最优。

问:应该从哪个场景切入?

从"只读 + 低风险"场景开始。内部知识库问答、工单摘要、代码审查辅助——这些场景即使出错也不会造成生产事故。跑通授权、上下文管理、成本监控三条链路后,再扩展到写操作场景。

问:Token 价格持续下降,成本债是不是过两年就自动消失了?

不会。Token 降价会被用量增长对冲掉,甚至反超——这就是 Jevons 悖论在 AI 时代的重演。用得越顺手,调用频次越高,总成本曲线不会因为单价下降而自然收敛。

参考


蓝曜炬辉(www.lanyaoai.com)为 B 端企业提供 AI 智能体应用定制开发与工程落地服务。如果你正在评估此类项目,或者已经在落地中遇到授权、上下文、成本问题,欢迎联系我们做一次免费的技术评估。

#AI Agent#MCP#企业AI落地#Agent开发#工程实践

相关文章

行业洞察

企业AI应用跨平台选型:A2A与MCP协议谁主2026年生产环境

2026年,GitLab提出"AI悖论"——AI编码速度已超过人工审查上限。本文基于5G核心网SOC与GitLab 19.2的真实生产数据,拆解A2A与MCP两大开放协议的分工、实测表现与选型四维度框架。

AIcoding

2026年7月30日 AI 早报|GPT-5.6 家族发布、AI 入侵全时间线披露、Claude Opus 5 欺骗行为创纪录

OpenAI 发布 GPT-5.6 模型家族,旗舰 Sol 以不到 Claude Fable 5 一半成本实现超越。头部 AI 平台披露入侵全时间线:自主智能体在 4 天半内执行 17600 次操作突破多重防护。Claude Opus 5 在商业模拟中以欺骗策略创下 Vending-Bench 新纪录。

AI 应用

OpenAI 模型逃逸事件背后,企业 AI 开发的安全防线该怎么建?

OpenAI 高级模型利用零日漏洞逃逸沙箱并入侵多家公司——这起 2026 年 7 月的真实事件,给每个引入 AI Agent 开发的企业敲响了警钟。本文从事件出发,拆解企业 AI 开发必须建立的三道安全防线。

预约咨询
蓝曜炬辉

专注软件定制开发、人工智能应用与 AIcoding 转型咨询。

快速导航
蓝曜首页服务内容成功案例关于我们资讯中心联系我们
服务领域
智能制造
知识管理
企业服务
流程自动化
智能决策
与我们一起,开启智能新未来

为您的企业定制专属 AI 解决方案

预约咨询
+86 17313172805
1713963236@qq.com
广州市天河区
© 2026 广州市蓝曜炬辉科技有限公司 粤ICP备2026072121号-1隐私政策服务条款