复盘一个 8 周交付的零售小程序 AI 导购项目:五层架构、会话编排、检索增强、内容安全与 6 个工程坑,附成本与周期估算。
2026 年上半年我们连续接了三个"把大模型装进小程序"的需求,第一个踩坑最多:某连锁零售客户要求 8 周上线小程序 AI 导购,顾客开口问商品就能得到带链接的答案。最后按期交付,但过程中踩过的坑值得单独写一篇。

大模型本身已经不是门槛,门槛在于场景和数据够不够得着。腾讯在 9 月初的 WorkBuddy 生态发布会讲得很直白:AI 提效"不取决于一个工具有多强,而取决于它能连接多少数据、多少能力,能走进多少真实的场景"(见 InfoQ 发布会报道)。小程序恰好同时满足三点:微信生态自带登录、支付、订阅消息,回答能立刻变成订单,而不是停在对话框里。
同场发布会还有一层信号:腾讯把智能体能力开放给 30 多个硬件品牌和 100 多个共创伙伴,理由是上下文散落在各系统与行业经验里,一家公司收不齐。企业自己的小程序恰恰是收齐上下文的地方——浏览、加购、历史订单都是第一方数据,合规边界比公域清晰。
行业节奏也在往企业侧倾斜:9 月 5 日某旗舰模型先向 Pro、Enterprise 等企业套餐开放,个人订阅延后数天(见 AIHOT 转 The Decoder 的报道)。企业场景优先吃到新能力,是 2026 年的普遍做法。
需求本身不复杂:顾客问"这款咖啡豆和上次买的那袋有什么区别""破壁机适合几人用",小程序给出带商品卡片的回答;店员端还要能查库存。难点在数据——商品库在 ERP,会员在 CRM,库存每天同步两次。我们按五步走:
时间线看着顺,实际第 5–6 周返工最多,原因写在第 4 节。
客户最初想直连模型接口省网关成本,被我们劝住。原因很实际:密钥下发到端上等于裸奔,域名白名单、限流、审计、合规留痕都难落地,出一次事故省下的钱全赔回去。选型与决策的完整链条,我们另有一篇专门展开(见 企业 AI 小程序开发的选型与上线关键决策)。最终结构分五层:
| 层级 | 职责 |
|---|---|
| 小程序端 | 对话界面、商品卡片、订单跳转,不持有密钥 |
| 业务网关 | 登录态、限流、按调用方计费、操作审计 |
| 会话编排 | 上下文裁剪、意图路由、工具调用与结果回写 |
| 模型网关 | 多模型路由、超时降级、token 成本统计 |
| 数据工具 | 检索增强、库存与会员查询、内容安全复核 |
五层里最容易做砸的是会话编排。首版我们直接把最近 20 轮对话全塞进提示词,单次调用成本随轮数上涨,上线第二周就被财务约谈。改成"最近 3 轮原文 + 更早内容摘要 + 商品命中记录"后成本才回到可控区间。
其中第 3 条是典型的"一开始用 X,后来发现 Y":直接给模型喂参数表最快,但可维护性最差;改成查数据后,商品上新与调价不再依赖提示词改动。这类系统上线后真正缺的不是更多模型,而是能判断 AI 答案好坏的人(见 小程序 AI 应用最缺的是判断力)。
第一个项目踩完坑,后面两个同类项目(本地生活、连锁餐饮)明显提速。下表是我们的经验区间(单位:周):
| 模块 | 首个项目 | 模板复用后 |
|---|---|---|
| 小程序前端 | 2 | 1 |
| 会话与网关 | 2 | 1 |
| 模型网关与降级 | 1 | 0.5 |
| 检索与数据工具 | 1.5 | 1 |
| 内容安全与合规 | 0.5 | 0.5 |
| 灰度、压测与上线 | 1 | 1 |
| 合计 | 8 | 5 |
交付能压到 8 周,一部分要归功于 2026 年的 AI 编码工具,但别高估它:InfoQ 报道华为鸿蒙场景时指出,ArkTS 语料少,同一模型在成熟生态与新生态上的表现差距明显(见 InfoQ 鸿蒙 AI Coding 报道)。选型前先确认目标端的工具链成熟度,别默认哪里都一样快。
运行期成本大头是模型调用与巡检。日均几千次对话的中型零售小程序,月成本大约等于一个初级运营的薪水,换来 7×24 应答。这是量级感受不是精确账单,真要立项得拿并发与调用量单独测算。
如果你也在评估把 AI 放进自家小程序,可以先翻翻我们做过的同类型交付案例,再带着场景到联系页做一轮可行性判断——先聊方案,不急着谈报价。
技术上可以,生产不建议。密钥下发到端上、限流审计难做、内容安全难兜底;省下的网关成本会在事故里还回去。
需要。对话内容是典型的 UGC 形态,上线前要接审核与留痕;商品推荐还要在输出层过滤绝对化用语。
能做。先接商品库与业务库接口,让答案长在实时数据上;知识库后面再补,不要让模型背静态文档。
大头在模型调用费与提示词、知识更新。建议每周留半天做回答抽检与规则更新,比攒到事故再修便宜。