AI出海推理怎么部署?香港GPU服务器与API成本对比
2026 世界人工智能大会于 7 月 20 日在上海闭幕。本届大会展示了 4486 项展品,351 款产品全球首发,预计达成意向采购金额约 203.6 亿元。华为昇腾 950 超节点也首次以 1024 卡集群形式公开亮相,面向万亿参数模型训练和高并发推理等大规模场景。
这些产品代表了 AI 基础设施的上限,但不等于每个 AI 出海团队都需要从集群起步。
多数中小团队并不训练基础模型,而是在做智能客服、知识库问答、内容生成、OCR、语音转写、搜索推荐或垂直 Agent。它们首先需要解决的是推理部署:模型能不能装下、并发够不够、每次调用成本是多少,以及服务器放在哪里才能让目标用户访问得更快。
超节点解决的是大规模训练和海量并发问题。对尚在验证商业模式的 AI 应用来说,一台配置匹配的香港 GPU 服务器,或者一套“云 API+自部署”的混合架构,往往更符合实际预算。
第一步:先分清自己是在训练模型,还是部署AI应用
AI 项目最容易出现的预算错误,是还没分清工作负载,就先按照“训练大模型”的标准购买硬件。
可以先把业务分成以下几类:
如果业务只是调用外部模型 API,服务器主要负责用户登录、数据库、支付、任务队列和 API 转发,并不需要因为产品带有“AI”两个字就配置 GPU。
如果需要把开源模型部署到自己的服务器上,模型参数量、量化精度、上下文长度和并发请求数,才会共同决定显存下限。
第二步:模型参数量只是显存计算的起点
量化可以降低模型推理时的显存和计算成本。Hugging Face Transformers 当前支持多种 8-bit 和 4-bit 量化方案,使原本无法装入单张 GPU 的模型有机会在较小显存中运行。
一个便于初步估算的公式是:
模型权重体积≈参数量×每个参数所占位数÷8
以 INT4 为例,每个参数理论上约占 0.5 字节:
- 7B 模型的纯权重约为 3.5GB;
- 14B 模型的纯权重约为 7GB;
- 32B 模型的纯权重约为 16GB。
但这只是“权重能否装下”的理论起点,不是实际部署所需的全部显存。
推理时还需要为量化元数据、运行框架、激活值、CUDA 工作空间和 KV Cache 预留空间。上下文越长、同时处理的请求越多,KV Cache 占用通常越明显。生产环境还需要为流量波动和模型加载留出余量。
可以按下面的范围做第一轮容量规划:
这张表只能用来筛选配置,不能代替压力测试。
同一个 14B 模型,在短上下文、单用户测试时可能运行正常;换成长文档问答、十几个并发请求后,就可能因为 KV Cache 增长而出现显存不足。多模态模型还可能包含视觉编码器等额外组件,不能只按语言模型参数量计算。
CPU能不能跑AI推理
能跑不等于适合上线。
嵌入模型、文本分类、小型 OCR、规则增强模型和离线批处理,在请求量不高时可以先用 CPU。普通香港云服务器也可以承担向量数据库、API 网关、任务调度和业务后台。
但对需要实时逐字输出的语言模型,CPU 通常更适合内部测试、低频调用或成本极度敏感的场景。只要开始追求较低首 Token 时间、稳定吞吐和多用户并发,GPU 的价值就会明显增加。
第三步:按Token付费还是固定月付,要按真实流量算
第三方模型 API 的优势是上线快。
团队不需要管理 GPU、驱动、推理框架和模型更新,验证产品时只需按调用量付费。缺点是成本会随输入和输出 Token 增长,模型价格、速率限制和服务策略也由平台决定。
自部署的特点正好相反:服务器费用相对固定,但需要自己承担部署、监控、安全、扩容和故障处理。
判断两种方案时,不要只比较一百万 Token 的标价,应分别计算完整月成本。
API模式月成本
输入 Token 数÷100万×输入单价
+输出 Token 数÷100万×输出单价
+向量、重排序、图片或语音等附加调用费用
自部署月成本
GPU服务器月租
+存储和备份
+公网带宽
+运维时间
+监控和安全
+冗余节点成本
自部署的盈亏平衡点可以粗略理解为:
固定月成本÷单次请求使用API的平均成本
真正有参考价值的数据,不是后台的注册用户数,而是连续 7~30 天的实际调用日志:
- 每天有多少次请求;
- 平均输入和输出 Token 是多少;
- 高峰期每秒有多少并发;
- 有多少时间 GPU 处于空闲状态;
- 业务能否接受排队;
- 模型更新频率有多高。
哪些业务更适合继续用API
以下情况不必急着迁移自部署:
- 产品仍在验证阶段;
- 请求量小且波动大;
- 不确定最终使用哪个模型;
- 团队没有模型运维人员;
- 需要随时切换不同厂商的最新模型;
- 自部署服务器大部分时间会处于空闲状态。
哪些业务可以评估自部署
出现以下信号时,可以开始测试自部署:
- 月度 Token 用量持续增长;
- 流量已经形成相对稳定的基线;
- 需要固定模型版本,避免输出频繁变化;
- 对数据流向和日志保存有明确要求;
- API 限速已经影响业务;
- 需要自定义量化、微调或推理参数;
- 固定服务器成本低于持续增长的 API 账单。
比较稳妥的方式通常不是一次性全部迁移,而是采用混合架构:
日常、高频和可预测的请求走自部署模型;复杂、低频或需要更强能力的任务继续调用外部 API。自部署服务异常时,API 还可以作为临时回退通道。
第四步:香港节点的价值,不只是“免备案”
对话类 AI 应用的用户体验通常包含几个部分:
用户到服务器的网络往返时间+请求排队时间+模型预填充时间+逐 Token 生成时间
vLLM 等推理框架会将首 Token 时间、排队时间和生成时间分别记录。也就是说,GPU 性能只是体验的一部分;如果用户距离推理节点较远,网络往返同样会增加整体等待时间。
香港是同时服务中国大陆、港澳台和部分东南亚用户时常见的折中节点,但它并不是对所有地区都最优。
面向中国大陆用户
部署香港节点时,不能只看机房地理距离,还应看具体线路。
普通国际 BGP、CTGNet、CN2 GT 和 CN2 GIA 的高峰期表现可能不同。即使同样标注“香港服务器”,中国电信、中国联通和中国移动用户的访问路径也可能不一样。
SellBGP 当前香港 GPU 服务器产品页列出的可选配置覆盖 RTX、L4、L40S、A100 和 H100 等 GPU,并标示接入 CN2 GIA 回国线路。产品页当前给出的中国大陆方向平均延迟参考为 20~40ms,但这一数据不能代表所有城市、运营商和时段,下单前仍应使用目标用户网络进行测试。
建议至少测试:
- 中国电信、中国联通和中国移动;
- 华南、华东和华北入口;
- 普通时段和 20:00~23:00 晚高峰;
- Ping、MTR 和真实 HTTPS 请求;
- 首 Token 时间,而不是只看网络延迟。
面向东南亚用户
如果主要用户集中在新加坡、马来西亚、印度尼西亚或泰国,香港可以作为候选节点,但不应默认一定比新加坡更快。
更合理的做法是同时测试香港和新加坡节点,再根据用户分布决定:
- 大陆用户占比较高,可优先测试香港优化线路;
- 东南亚用户占绝对多数,新加坡节点可能更合适;
- 两边都有核心用户,可以采用香港主节点加东南亚边缘接入,或按地区进行流量调度。
“免备案”不等于没有合规要求
香港服务器通常不需要办理中国大陆的 ICP 备案,这有利于缩短网站和 API 的基础设施上线流程。
但“免备案”只涉及 ICP 备案,不代表业务不需要遵守其他规则。用户数据、模型内容、软件授权、目标市场隐私要求和行业监管,仍需根据业务性质单独评估。
自部署也不等于数据天然安全。团队仍需处理:
- API 身份认证和权限控制;
- HTTPS 和传输加密;
- 对话日志是否保存;
- 敏感字段脱敏;
- 数据库和备份访问权限;
- 模型及依赖组件的漏洞更新;
- 管理端口和 Jupyter 服务暴露风险。
香港GPU服务器还是香港云服务器
两种产品解决的不是同一个问题。

香港云服务器更适合作为 AI 应用的业务层:运行前端、用户系统、数据库、向量检索、消息队列和模型 API 网关。
香港 GPU 服务器则负责实际推理或微调。两者也可以组合部署,把公网业务和 GPU 计算分开,避免所有服务都挤在同一台机器上。
AI出海团队可以按三个阶段部署
第一阶段:先验证业务,不急着买GPU
产品尚未确认用户需求时,可以使用:
- 一台香港云服务器;
- 第三方模型 API;
- 托管数据库或自建轻量数据库;
- 基础日志和调用成本监控。
这一阶段重点不是压低单次 Token 成本,而是确认用户是否愿意持续使用和付费。
第二阶段:用真实数据测试自部署
当请求量稳定后,选择一个高频任务迁移到自部署模型,并进行至少一轮压力测试。
重点记录:
- 首 Token 时间;
- 每秒输出 Token 数;
- 单请求总延迟;
- 最大稳定并发;
- 高峰期排队时间;
- 显存占用;
- GPU 利用率;
- 每千次请求的实际成本。
不要只在命令行中测试一次生成速度。生产环境的输入长度、输出长度和并发量,与单用户演示通常差别很大。
第三阶段:再决定扩卡还是横向扩容
单卡性能不足时,不一定要立即购买更昂贵的 GPU。
需要先判断瓶颈:
- 模型装不下:增加显存或使用多卡;
- 并发不够:增加副本并做负载均衡;
- 长上下文太慢:优化上下文、缓存和预填充;
- GPU 利用率低:调整批处理和调度;
- 网络延迟高:更换线路或增加区域节点;
- 流量波动大:保留 API 作为弹性补充。
只有确认单机已经持续满载,并且业务需求稳定,扩容才有明确依据。
超节点解决“造模型”,中小团队先解决“用模型”
WAIC 展示的超节点和万卡集群,代表了大模型训练、高并发推理和系统级算力的发展方向。对模型厂商、科研机构和头部平台来说,这些基础设施非常重要。
但对多数 AI 出海团队而言,第一步不是复制一座智算中心,而是把下面四笔账算清楚:
- 模型多大,需要多少显存;
- 请求量多高,API 和自部署哪个更便宜;
- 用户在哪里,节点和线路是否匹配;
- 团队能否承担模型运维、安全和容灾。
如果当前仍处于产品验证期,可以先用香港云服务器承载业务系统,通过 API 快速试错;如果调用量已经稳定,或者需要控制数据流向,可以进一步评估香港 GPU 服务器,将高频推理任务逐步迁移到自部署模型。
先用一台合适的服务器跑通业务闭环,再根据真实并发扩容,通常比一开始按照“万卡集群”的叙事配置预算更稳妥。