从锐龙 AI Max PRO 400 的 128GB 统一内存出发,算清桌面端 AI 应用的显存预算,拆解常驻多智能体需要同机运行的模块,并给出本地与云端、桌面端与移动端的部署边界。
某金融行业客户今年 8 月的选型会上,争论点不是 GPU 峰值算力,而是一台工作站到底能不能把量化大模型、向量库和三个常驻智能体同时装进内存。9 月 10 日 AMD 在北京媒体沙龙给出的数字是:锐龙 AI Max+ 395 最高 128GB 统一内存,其中最高 96GB 可分配为显存。

这个数字对做桌面端项目的人意味着什么,取决于你把「定制」理解成做一个更好看的客户端,还是理解成把一整套推理与编排装进用户桌上那台机器。
传统 PC 的独立显存容量相对有限,而模型权重、长上下文和多模态输入对容量的需求一直在涨。统一内存让 CPU 与 GPU 指向同一内存池,系统不必在彼此隔离的两个空间之间反复搬运数据,也就为本地大模型、长上下文检索和多智能体并发留出了更大空间。
但「装得下」和「跑得动」是两件事。按平台公开说明,实际能跑多大规模仍取决于量化精度、上下文长度、KV Cache 占用和推理框架的优化程度。我们做容量估算时通常走四步:
四笔账算完你会发现,96GB 这个可分配显存上限并不宽裕——它刚好把 70B 级量化模型、长上下文和两三个智能体放进一台 1L 工作站,再往上就得砍上下文或者换更激进的主权重量化。这也是为什么我们接项目时会先要一份数据规模与并发智能体数量的清单,而不是先问预算。
当本地 AI 从单个聊天助手变成多智能体协作,机器要扛的就不只是模型本身。向量数据库、RAG 检索链路、工具服务、权限管理和任务调度模块要和模型同机运行,部分智能体还需要持续驻留后台等待事件。客户端外壳怎么定,会直接决定后面能不能顺利挂载本地运行时,Electron 与 Tauri 的选型与 AI 原生改造属于动工前就该想清楚的一步。
星漪科技展示的 Flowy AI PC 用 Agentic PC 架构统一管理模型调度、智能体服务、工具调用和硬件资源,思路是避免不同应用各装一套模型和运行环境。首界科技的 Nova 工具链覆盖推理环境、开源模型、图像生成、语音识别与合成、OCR,结合 ROCm 与 PyTorch 做部署适配,NovaStudio 再提供应用分发、更新和商业化的入口。
我们踩过的坑正在这里:早期给客户做桌面端助手时,每个功能模块各自打包一份推理运行时,同一块盘上躺着三份模型文件,内存里同时驻留两个框架,机器还没开始干活就吃掉一半余量。后来改成单运行时加多租户模型加载,冷启动时间短了约 40%。如果平台层已经把这一层收拢,项目里需要自己写的胶水代码会明显变少。
另一个容易被低估的是异构调度。平台集成了 CPU、GPU、NPU 三类计算单元,合理分工是 GPU 承担大模型与多模态批量推理,NPU 处理低功耗常驻轻任务,CPU 负责编排、工具调用和传统软件逻辑。要真吃到这个红利,操作系统、推理框架和应用层都得配合做任务拆分,否则多出来的那一类单元只会闲置。
这次沙龙展示的案例里,本地部署集中在数据敏感、结果需要审计的场景。生寰未来把大语言模型、蛋白质语言模型和序列设计模型部署在本地设备上,用于尚未公开的实验数据;昆仑元与上海财经大学金融智能研究院合作的端侧金融智能体,由推理框架负责模型运行与任务编排,把投资检索、量化研究、组合归因、合规风控和文档处理封装成可调用工具;赛博物联的智能标书助手在本地读取数百页招标文件,提取资质条件、废标条款、评分标准和时间节点。
但本地不等于全离线。ViPro 影视智能体采用本地与云端协同:脚本、素材和提示词在本地处理,视频渲染这类重计算任务按需调用云端资源。创造进化的智能 VC 工作站同样把商业计划书、访谈记录和内部知识库留在本地,公开信息检索按需联网。
我们在做取舍时会拉一张清单:
同样一套智能体能力,放到不同终端上,边界完全不一样。
| 维度 | 桌面端(本地工作站) | 移动端 | 云端 |
|---|---|---|---|
| 内存上限 | 统一内存池,最高 128GB,其中最高 96GB 可作显存 | 受端侧内存与功耗约束,通常只跑量化小模型 | 按需扩容,可承载超大模型 |
| 常驻能力 | 多个智能体与向量库可常驻后台 | 后台策略与省电限制会随时回收进程 | 天然常驻,但每次调用附带网络与费用成本 |
| 数据边界 | 敏感数据不出内网,操作可留痕 | 数据在设备上,但设备易丢失 | 需数据处理协议,跨境场景另有合规成本 |
| 典型任务 | 长上下文检索、多模型协同、投标与科研分析 | 轻量问答、语音交互、单任务助手 | 超大模型推理、实时联网检索、视频渲染 |
移动端的限制不在算力峰值,而在后台驻留策略——系统随时可能回收你的常驻进程,长任务只能拆成可恢复的分段;端侧智能体与语音交互的拐点正是从这个约束里长出来的。桌面端的价值是「可以一直开着」:常驻进程、本地文件系统访问、外设与内网直连,这些恰好是专业智能体最需要的。云端的优势在弹性与版本跟随。
这也解释了 AI NAS 为什么会被一起展示:当团队只有几个人、又不想把资料搬到公有云,本地存储加本地推理的组合比「每人一台工作站」更划算。六联智能展示的产品线里就包含基于该平台的 AI NAS,以及计划于 2026 年第四季度量产的 AXB88P-02 1L AI 工作站与 AXB35-03 2L Mini AI PC。
参数量不是唯一变量。按 0.5 字节每参数估算,70B 级量化模型权重约 35GB,叠加长上下文 KV Cache、向量库和常驻会话预算后,96GB 可分配显存才留出余量。再大的模型即使装得下,也要接受更激进的量化精度或更短的上下文。
看瓶颈在哪。多模型同时加载、长文档检索、多智能体并发这类容量型负载,内存池化更友好;追求单次推理吞吐、对延迟极其敏感的速度型负载,独立显存的带宽优势仍在。桌面端这套系统通常更偏前者。
除客户端界面外,至少要算上推理运行时与模型管理、向量库与检索链路、工具服务(文件读写、内部接口、文档解析)、权限与审计、任务调度和更新分发。如果要跑在内网,还得留出离线安装与模型灰度更新的通道。
能力可以下沉,形态要重做。移动端适合轻量问答、语音交互和单任务助手,需要压缩上下文、把长任务拆成可恢复片段,并接受常驻进程被系统回收的现实。真要跑常驻多智能体,最终还是回到桌面端或本地服务器。
取决于调用频次。低频场景下硬件一次性投入摊不开,按量付费的云端更划算;高频、数据敏感、又需要保留完整操作记录的场景,本地的边际成本优势才显现。AMD 方面也提到,端云如何分工取决于模型规模、响应速度、数据敏感程度和总体成本,而不是单向的「全都放本地」。
如果你正在评估把哪部分 AI 能力放到用户桌面上,先别急着定硬件。把业务场景与数据边界发过来,我们会给出一份可行性评估,包含容量预算、常驻模块清单和端云切分建议;外壳还没定的,可以先对照这份跨平台技术选型实战复盘,再决定从哪个形态起步。完整交付过程可看项目案例,需要直接聊内网审计与合规边界的走沟通入口。