先说清楚一个大多数人算错的账:自托管 AI Agent,VPS 是小钱,模型 API 才是大头。一台年付 VPS 一两百块人民币就够跑 OpenClaw / Hermes / nanobot,但 Agent 挂机跑任务的 token 消耗,一个月几十到几百块很常见——我们在《OpenClaw VPS 安全指南》里拆过这笔账,社区的原话是”很多教程只算 VPS 钱,结果用户上线一周被 API 账单吓到”。
这篇就把 API 这半边的账算清楚:渠道有哪几类、价格为什么会差出好几倍、上线前怎么四步选定渠道。
先看结论,对号入座
| 你的情况 | 建议 |
|---|---|
| 刚部署完 Agent,还没配 API | 先看第一节搞懂三类渠道,再走第三节的四步比价流程 |
| 已经在用,但账单超预期 | 直接看第二节”价差从哪来”,大概率是线路选贵了或没用上缓存 |
| 预算紧,先试水 | 国产模型官方渠道起步,单价低;或聚合平台的免费额度档 |
| 跑长任务/浏览器自动化 | 优先看缓存命中价和峰谷计价,比看标价重要 |
一、Agent 的”粮食”从哪来:三类模型 API 渠道
自托管 Agent 本体只做调度和工具执行,推理全部走外部模型 API。渠道就三类:
| 渠道类型 | 代表 | 优势 | 短板 | 适合谁 |
|---|---|---|---|---|
| 官方直连 | 各大模型厂商自己的 API 平台 | 价格透明、稳定、无中间商 | 一家一个 key、一套计费,多模型要开多个账号 | 只用一两个固定模型的人 |
| 聚合平台(中转) | OpenRouter、各类国内聚合站 | 一个 key 调上百个模型,OpenAI 兼容接口换模型只改模型名 | 质量参差,加价幅度和线路稳定性差别巨大 | 想灵活切换模型、懒得管多账号的人 |
| 本地推理(Ollama) | VPS 上自己跑开源模型 | 零 API 费用、数据不出机器 | 吃内存(8G 起步)、CPU 推理速度慢 | 隐私敏感、任务量小的人 |
三条路不互斥。社区常见玩法是混合:日常轻任务走本地小模型或低价国产 API,重任务再切高价模型。OpenClaw 2.0 的安装引导本身就支持复用已有 CLI 登录态、API Key 和本机 Ollama 模型,切换成本不高。
聚合平台这类渠道,选之前一定先横向比价——同一个模型在不同平台、不同线路下的报价能差出好几倍。我们自己也维护了一个比价工具:灵客 AI(baigonghe.com),收录上百个模型的实时价格表,还按厂商和模型统计了近 7 天的调用量份额,能直接看出大家都在用什么、哪家线路在降价。利益相关:这是我们自己的另一个项目,所以比价结论你自己交叉验证,本文只讲方法。
二、价差从哪来:同一个模型为什么能差好几倍
很多人比价只看”每百万 token 单价”,这是个误区。真实成本 = 单价 × 调用量 × 缓存命中率 × 失败重试率,四个变量每一个都能把账单拉开差距:
1. 线路价差。 同一个模型往往有多条供给线路(官方直供、第三方转发、批量折扣通道),聚合平台上同模型不同线路的价差可以到十几倍。低价线路的代价通常是并发限制、高峰期排队或者偶发断流——Agent 挂机跑长任务时,断流意味着重试,重试意味着重复计费。
2. 缓存命中价。 大量 Agent 任务的请求高度相似(同样的系统提示词、同样的工具定义),支持提示缓存的平台能把这部分成本压到标价的十分之一以下。选渠道时问清楚缓存策略,比盯着标价砍价有用得多。
3. 峰谷计价。 部分国产模型分时段计价,低谷时段调用显著便宜。如果你的 Agent 跑的是不紧急的批量任务(比如夜间整理、定时抓取摘要),把调度挪到低谷时段就是白捡的折扣。
4. 折扣门槛。 不少渠道的大额折扣要求月消耗达标,中小调用量根本够不到。看价格表时认准”你这个量级实际能拿到的价”,不是宣传页上最大的那个折扣。
三、上线前四步比价流程(照着做就行)
第一步:列出你的任务画像。 你的 Agent 每天跑多少轮对话?单轮大概多少 token(系统提示词 + 上下文 + 输出)?有没有浏览器自动化这类烧 token 的大户任务?先估个日均调用量。
第二步:拿目标模型跑 10 次典型任务。 别拿聊天水任务测,用你真实会让 Agent 干的活。记录实际 token 消耗,乘以日均次数,得到月消耗估算。这一步的数比任何价格表都重要。
第三步:横向比价。 打开两三个比价入口——灵客 AI 的价格表、OpenRouter 的模型页、目标模型官方定价页——把同一模型的不同线路报价摆在一起,按第二步的月消耗量算出各方案的月成本。注意把缓存命中价和峰谷价算进去。
第四步:小额充值实测一周。 选定渠道后先充最小档,把 Agent 挂上真实任务跑一周,看两个数:实际扣费和估算的偏差、高峰期的失败率。偏差大或者失败率高就换线路,聚合平台的好处就是换线路只改一个模型名。
四、VPS 这半边的账:别为 API 型 Agent 超配
API 模式下 Agent 本体非常省资源:nanobot 1G 内存就能跑,OpenClaw 建议 2G 起,Hermes 官方最低 4G。真正吃配置的是浏览器自动化(无头浏览器单实例峰值 800MB~2.5G)和本地模型推理(8G 起步)——如果你两样都不碰,把钱花在 API 预算上比堆 VPS 配置划算。
需要一台常驻机器的话,我们的老结论不变:预算敏感选 RackNerd 的 AI VPS 档($21.99/年 1G 起),大陆方向要操作流畅选 <a href=”https://bwh88.net/aff.php?aff=71166″ target=”_blank” rel=”nofollow noopener sponsored”>搬瓦工 CN2 GIA-E</a>(本站是搬瓦工导购站,走链接下单我们拿佣金,价格不变)。具体分档在《QClaw 停运迁移指南》第四节有完整对照表。
常见问题 FAQ
问:模型 API 聚合平台靠谱吗?
分平台。看三个信号:是否明码标价到线路级别、有没有真实的调用量数据可查、失败重试的计费规则是否写清楚。另外永远不要在聚合平台账号里囤大额余额,用多少充多少。
问:Agent 一个月到底要花多少 API 费?
轻度使用(每天几十轮对话、国产模型为主)一个月十几到几十块;挂浏览器自动化或者用高价模型跑长任务,几百块也正常。所以第二节和第三节的估算流程比任何”平均数”都可靠。
问:OpenClaw / Hermes 怎么换 API 渠道?
两者都支持 OpenAI 兼容接口,在配置文件里改 base URL、API key 和模型名三个字段即可,不用重装。改完先跑一轮测试任务确认扣费正常。
问:本地跑 Ollama 是不是就零成本了?
API 费是零,但硬件成本不是:8G 内存起步的 VPS 年租通常够你调用好几次月国产 API,而且 CPU 推理速度(2~12 tokens/s)只适合轻量任务。隐私敏感场景才值得,纯为省钱通常不划算,这笔账在《搬瓦工部署 DeepSeek/Ollama 实战》里拆过。
问:为什么同一个模型价格差那么多?
供给线路不同:官方直供、批量折扣通道、第三方转发的成本结构不一样,低价线路往往伴随并发限制或高峰排队。价差本身就是信息——异常低的价格要怀疑线路质量和”模型不对版”风险。
问:key 泄露了怎么办?
立即在平台侧吊销该 key 并新建,同时检查 Agent 配置文件和仓库里有没有硬编码残留。这也是我们在各篇 Agent 部署指南里反复强调”密钥进 .env、设额度上限”的原因。
延伸阅读
- 2026 年跑 OpenClaw 选什么 VPS:方案对比与安全加固清单
- 2026 年跑 Hermes Agent 选什么 VPS
- QClaw 停运、Muse 进不来:把 AI Agent 养在自己 VPS 上
- Codex 部署到 VPS 完整教程
- 搬瓦工部署 DeepSeek/Ollama 实战
*本站为搬瓦工导购站,文中含联盟链接,通过链接购买本站获得佣金,不影响你的价格。灵客 AI(baigonghe.com)为本站运营方维护的另一项目,文中已如实披露。API 价格与平台政策变动快,本文方法写于 2026 年 9 月,实操请以各平台实时页面为准。*