概念与构成WHAT IS AN AGENT
AI 智能体(Agent)指以大语言模型为核心、能够自主拆解任务、调用外部工具并根据反馈迭代的软件系统。 与"一问一答"的对话应用不同,智能体在推理范式上引入了行动环节:ReAct 等经典工作将"推理(Reason)— 行动(Act)—观察(Observe)"组织为循环,使模型可以在工具环境中逐步逼近目标[1]。
一个可落地的智能体通常由五部分构成:模型(推理内核)、编排(任务规划与流程控制)、 工具(搜索、代码执行、数据库、API)、记忆(对话上下文与向量知识库)、网关 (鉴权、限流与审计)。工程量往往集中在后四者,而非模型本身。
部署智能体前需要先回答两个问题:模型从哪来(调用 API 还是私有化推理)与 数据放哪里(能否出域)。这两个答案决定了整条技术路线,见第 03 节的形态对比。
参考架构REFERENCE ARCHITECTURE
私有化或混合部署的智能体系统,参考架构分为五层。各层独立演进、独立扩容:
图 1 · 智能体系统参考架构(推理层与数据层不出内网,网关层统一对外)
推理层是成本与体验的核心:开源模型(Qwen、DeepSeek 等)配合 vLLM 等推理引擎部署在 自有 GPU 上[2],通过连续批处理(continuous batching)把单卡吞吐提升数倍; 编排层建议无状态化,会话状态外置到数据层,便于横向扩容;网关层则承担提示词注入过滤与 调用审计,是安全合规的第一道闸门[5]。
若业务需要调用外部大模型 API(混合形态),出口应收敛到网关层的统一代理,避免密钥散落在业务代码中, 同时对出域内容做脱敏审查——这一层做扎实,后续通过等保或行业审计会顺利得多。
部署形态对比DEPLOYMENT MODES
三种部署形态没有绝对优劣,取决于数据敏感度、调用量级与团队运维能力三要素:
| 维度 | 纯 API 调用 | 私有化推理 | 混合形态 |
|---|---|---|---|
| 数据出域 | 全部请求出域 | 数据不出内网 | 敏感走私有、通用走 API |
| 起步成本 | 零硬件,按量付费 | 需 GPU 节点 | 低 |
| 单位成本 | 随调用量线性增长 | 规模化后边际成本递减 | 视配比 |
| 模型可控性 | 受供应商更新节奏约束 | 版本、量化、微调完全自主 | 部分自主 |
| 运维要求 | 低 | 需 GPU 运维与监控 | 中 |
| 适合阶段 | 验证期 / 调用量小 | 调用量稳定 / 数据敏感 | 多数成长期团队 |
表 1 · 智能体部署形态对比(以"数据是否出域"为第一决策要素)
工程实践中的常见路径是:先用 API 验证业务闭环,调用量与数据敏感度上来后,把高频链路迁到私有化推理。 迁移时编排层与工具层可原样保留,仅替换推理端点——这也是架构上把推理层独立出来的原因。
显存与吞吐估算SIZING & THROUGHPUT
私有化推理的第一个问题是"我的模型需要多大显存"。工程上可用参数量 × 精度字节数 × 1.2 冗余 做快速估算(冗余覆盖激活值与框架开销),下表给出常见规模的经验值:
| 模型规模 | FP16 显存(约) | INT4 量化显存(约) | 参考硬件 |
|---|---|---|---|
| 7B | ≈ 17 GB | ≈ 5 GB | 单卡 24G(RTX 4090 级) |
| 14B | ≈ 34 GB | ≈ 10 GB | 单卡 24G(INT4)/ 单卡 48G(FP16) |
| 32B | ≈ 77 GB | ≈ 22 GB | 单卡 48G(INT4)/ 双卡(FP16) |
| 72B | ≈ 173 GB | ≈ 48 GB | 多卡 48G 组合 / 80G 级 |
表 2 · 显存需求经验估算(不含长上下文 KV Cache 扩展,选型应留 20% 以上余量)
两点修正因素必须计入:其一,KV Cache 随并发与上下文长度线性增长——32K 上下文、高并发场景的 KV Cache 可能超过模型权重本身,vLLM 的 PagedAttention 通过分页管理显著缓解这一问题[2]; 其二,INT4 量化会带来小幅质量损失,客服、检索类任务基本无感,复杂推理与代码生成建议 FP16 或 INT8。
吞吐侧,验证指标用每秒输出 token 数(TPS)与首 token 时延(TTFT):交互式智能体要求 TTFT 控制在 1 秒内体验才流畅;批处理任务则优先堆吞吐。压测可用推理引擎自带基准工具,按目标并发跑 15 分钟取稳态值。
实施清单CHECKLIST
- 基线压测:用真实业务 prompt 集跑目标并发 15 分钟,记录 TPS / TTFT / 显存峰值三条曲线。
- 工具沙箱:代码执行、Shell 等高危工具放入隔离沙箱,限制网络与文件系统范围。
- 网关审计:所有调用记录 prompt 摘要、token 消耗与工具调用链,出域请求统一代理并脱敏。
- 降级路径:私有推理不可用时自动回落到备用 API 端点,编排层配置超时与重试预算。
- 版本管理:模型权重、量化方案与编排代码三者版本绑定,回滚需整体回滚。
- 成本看板:按业务线统计 token 消耗与 GPU 利用率,利用率长期低于 30% 应合并实例。
选 GPU 机型时先明确目标模型与量化方案,再对照表 2 的显存档位加 20% 余量; 拿不准时以真机实测的压测数据为准——本站 GPU 机型支持免费测试[6]。
小结SUMMARY
智能体部署的决策顺序是:先定数据边界(出不出域),再定部署形态(API / 私有化 / 混合), 最后按模型规模与并发压测定硬件。架构上把推理、编排、网关三层解耦,是后续扩容与换模型成本最低的路径。 工程量集中在工具沙箱与网关审计——这两处决定系统"能不能上生产",而非"能不能跑起来"。