GPU VPS 市场在 2025-2026 年变化速度很快,新型号不断上线,定价也在调整。我写这篇文章的重点是帮你理解各家的定位和适用场景,具体价格以各家官网实时套餐为准,不要依赖任何二手报价。
为什么 AI 工作负载需要 GPU
CPU 做 AI 推理不是不行,但速度差距是数量级的。一个 7B 参数的语言模型在普通 CPU 服务器上跑,生成速度可能是每秒几个 token,勉强能用;同样的模型在 RTX 4090 上跑,速度可以达到每秒 80-100 token 以上,体验完全不同。
模型越大,差距越明显。70B 以上的模型在 CPU 上几乎不可用,必须上 GPU。
训练和推理对 GPU 的需求也不一样。推理(inference)是用训练好的模型生成输出,对显存带宽要求高,RTX 4090 这类消费级高端卡表现很好;训练(training)和微调(fine-tuning)对算力和显存容量要求更高,A100、H100 这类数据中心卡优势明显。
主流 GPU 型号对比
选服务商之前先搞清楚 GPU 型号的差异,否则容易被营销语言带偏。
| GPU | 显存 | 适合场景 | 性价比 |
|---|---|---|---|
| RTX 4090 | 24GB | 推理、Stable Diffusion、Ollama | 高 |
| L40S | 48GB | 推理、大模型部署 | 中高 |
| A100 40GB/80GB | 40/80GB | 训练、微调、大模型 | 中 |
| H100 | 80GB | 大规模训练、前沿模型 | 低(贵) |
| MI300X(AMD) | 192GB | 超大模型推理 | 中(较新) |
RTX 4090 是目前性价比最高的推理卡,24GB 显存能跑大多数 7B-13B 模型,跑 Stable Diffusion XL 也很流畅。价格比数据中心卡便宜得多,RunPod 和 Vast.ai 上的 4090 小时租金通常是 H100 的十分之一左右。
H100 是目前最强的训练卡,NVLink 互联多卡训练效率高,但价格昂贵,个人用户和小团队很难负担,主要是企业 AI 研究在用。
主流服务商逐一评估
Vultr GPU Cloud
Vultr 是最早向普通开发者开放 GPU 实例的服务商之一。产品线包括 NVIDIA L40S 和 A100,按小时计费,全球多个节点可选。
优势是生态完整——Vultr 的 VPS、对象存储、Kubernetes、负载均衡都在同一个平台,GPU 实例可以和其他资源无缝配合,适合需要完整云基础设施的中小团队。部署体验和普通 VPS 差不多,有 Marketplace 镜像可以快速启动预配置的 AI 环境。
定位是中端,价格比 RunPod 贵,但比 CoreWeave 便宜,平台稳定性和支持质量更有保障。
DigitalOcean GPU Droplets
DigitalOcean 在 2024 年推出了 GPU Droplets,搭载 NVIDIA H100,定位开发者友好。
DO 的最大优势是操作简单,界面和文档在主流云厂商里一直是最好上手的。如果你已经在用 DigitalOcean 跑其他服务,GPU Droplets 加进来完全没有额外学习成本。Kubernetes 集成也成熟,适合需要把 AI 推理服务容器化部署的场景。
价格在 H100 供应商里属于中等区间,以官网实时报价为准。
Lambda Cloud
Lambda 是专注 AI 的 GPU 云,不卖普通 VPS,只做 GPU 计算。产品线覆盖 RTX 4090、A100、H100,部分时期有 H200 和 B200 供应(库存变化频繁,选购前确认)。
在 AI 研究圈和开发者社区里口碑很好,原因是价格相对大厂便宜,而且平台本身就是为 AI 工作负载设计的,PyTorch、CUDA 环境预装,启动就能用,不需要自己配深度学习环境。
缺点是节点地区覆盖不如综合云厂商广,有时候热门 GPU 型号库存紧张需要排队。适合 LLM 训练、微调、AI 研究场景。
CoreWeave
CoreWeave 是企业级 AI 云,NVIDIA 是其重要投资方,GPU 资源规模很大,H100、A100 集群都有。
定位不是个人开发者,而是需要大规模 GPU 集群的企业 AI 团队。OpenAI、Stability AI 这类公司是它的目标客户。价格谈判空间大,但通常需要签合同,不是按小时随用随走的模式。
如果你是个人开发者或者小团队,CoreWeave 不是第一选择,门槛和定价都不太合适。
RunPod
RunPod 是 GPU 租赁市场,介于云服务商和 P2P 算力平台之间,价格是主流选项里最低的区间之一。RTX 4090 的小时租金可以压到很低,A100 和 H100 也有竞争力的价格。
支持 Pod(短期实例)和 Serverless 两种模式,Serverless 适合推理 API,只在有请求时计费。社区活跃,有大量预构建的 AI 模板,Stable Diffusion、ComfyUI、Ollama 都有一键启动镜像。
缺点是供应商是第三方主机提供资源,稳定性比自营云厂商有一定差距,对于生产环境需要做好容错准备。个人项目、实验、原型开发用起来很省钱。
Vast.ai
Vast.ai 是更彻底的 GPU 算力市场,价格可以比 RunPod 更低,因为它允许个人用户出租自己的 GPU。你可以在上面找到非常便宜的 RTX 3090、4090 甚至 A100 实例,适合预算极有限的场景。
代价是稳定性更难保证,供应商质量参差不齐,实例可能随时被回收。用于实验和学习没问题,不适合跑需要持续在线的生产服务。
TensorWave
TensorWave 主要提供 AMD MI300X GPU,这是目前显存最大的商用 AI 加速卡之一,192GB HBM3 显存可以直接把超大模型完整装进去,不需要量化或分片。
适合需要跑 70B 以上未量化大模型的场景,或者对 AMD ROCm 生态有偏好的团队。在中文社区讨论度不高,平台相对较新。
Crusoe Cloud
Crusoe 定位 AI 专用基础设施,有 H100 和 H200 供应,特点是用可再生能源和油田伴生气驱动数据中心,在企业 ESG 层面有一定吸引力。产品本身是严肃的企业级 AI 云,不是面向个人开发者的选项。
按工作负载选服务商
不同 AI 任务对 GPU 的要求差异很大,对应的最优选择也不同。
跑 Ollama 做本地 LLM 推理:RTX 4090 是性价比最高的选择,24GB 显存跑 Q4 量化的 13B 模型完全够用,RunPod 或 Vast.ai 上的 4090 价格最实惠。
Stable Diffusion 和 ComfyUI 图像生成:RTX 4090 同样是首选,VRAM 够用,生成速度快,Vultr 和 RunPod 都有成熟的一键镜像。
LLM 微调(LoRA/QLoRA):A100 80GB 是性价比较好的选择,显存够大,Lambda Cloud 和 RunPod 都有供应。
大规模模型训练:H100 是现阶段最优选择,CoreWeave 和 Lambda 都有,但价格昂贵,适合有预算的团队和企业。
跑 70B 以上未量化模型:考虑 TensorWave 的 MI300X,或者多卡 A100/H100 方案。
| 工作负载 | 推荐 GPU | 推荐服务商 |
|---|---|---|
| Ollama 推理 | RTX 4090 | RunPod / Vast.ai |
| Stable Diffusion | RTX 4090 | RunPod / Vultr |
| ComfyUI | RTX 4090 | RunPod |
| LLM 微调 | A100 80GB | Lambda / RunPod |
| 大规模训练 | H100 | Lambda / CoreWeave |
| 超大模型推理 | MI300X / H100 | TensorWave / CoreWeave |
| 开发测试环境 | RTX 4090 / L40S | Vultr / DigitalOcean |
租 GPU 还是买 GPU
这个问题在 RTX 5090 这类消费级旗舰卡出来之后更常被讨论。
买一块 RTX 4090 大约需要 $1,500-$2,000,按 RunPod 上 4090 的租金算,差不多等于租用 1,500-2,000 小时。如果你每天要用 8 小时以上,6-8 个月就回本了,之后等于白用。
但买卡的代价是:前期资金压力、设备折旧、电费、散热噪音,以及 GPU 型号迭代带来的贬值风险。
我的判断是:如果你的 GPU 使用率超过每天 4-6 小时,买卡长期更划算;如果是偶尔实验或者项目制使用,租更灵活。训练任务通常是短期高强度,租比较合适;推理服务如果流量稳定,买卡部署在自己的服务器上可能更经济。
按预算选服务商
预算最敏感、可以接受一定不稳定性:Vast.ai 价格最低,Ollama 和 Stable Diffusion 实验首选。
个人开发者、中小团队:RunPod 在价格和稳定性之间取得了比较好的平衡,生态也成熟。
需要完整云基础设施:Vultr 或 DigitalOcean,GPU 实例可以和存储、网络、Kubernetes 配合使用,平台稳定性更有保障。
AI 研究和专业训练:Lambda Cloud,价格比大厂合理,环境对 AI 工作负载优化,社区资源多。
企业级大规模 GPU 集群:CoreWeave 或 Crusoe,需要谈合同,不适合个人用户。