所有博客
技术多云调度

跨云调度:为什么一张 GPU 要能在多家云之间自由选择

同一个训练任务,不同云厂商的报价和库存可能差出一大截。这篇讲清楚 RunWhere 的多云模式:自带多家云账号、实时比价、用 gpuSkuKey 锁定选中的报价。

RRunWhere Team·2025年5月2日·7 分钟阅读
跨云调度:为什么一张 GPU 要能在多家云之间自由选择

你有没有这样的经历:在一家云下单一台 A100,排队半天还没拿到;切到另一家一看,同配置的机器有现货,价格还便宜一截。

这就是多云要解决的问题:不把自己绑死在单一厂商的供给和价格波动里

单一云厂商的三个痛点

  • 供给不稳定:热门 GPU 型号经常缺货,尤其是热门区域。任务排不排队,全看那一家今天的库存。
  • 价格差异:同一机型在不同云、不同区域的报价差异可观;再加上各家活动力度不同,长期用一家的固定价格未必划算。
  • 厂商锁定:一旦深度依赖某家的专有 API 和存储,想搬家成本极高,议价能力归零。

RunWhere 的多云模式:你的账号,统一入口

RunWhere 本身不转售算力。你把阿里云、腾讯云、华为云、百度云中已有的账号接进来(角色授权,随时可收回),平台把这些账号里的供给变成一个统一的入口:

  1. 接入:在控制台按向导授权各家云账号,状态变为 healthy 即接入完成;
  2. 比价:控制台「价格」页按 GPU 型号看各家的实时报价,可以按厂商和计费模式筛选;CLI 里 runw price recommend -f train.yaml --top 3 也能拿到推荐报价;
  3. 锁定:每个报价对应一个 gpuSkuKey,写进 YAML 的 resources 字段,这次任务就用这个确定的价格和机型;
  4. 执行:平台在你选中的那个云账号里创建节点、准备环境、启动任务,结束后自动释放。
resources:
  gpuNum: 1
  gpuSkuKey: "比价后选中的报价标识"

整个过程里,你面对的是一份 YAML、一套命令;背后用哪朵云,只是一次报价选择。

数据怎么办

跨云话题里最常见的担忧是数据迁移。在 RunWhere 的 BYOA 模式下这个问题不存在:你的数据始终在你自己云账号的对象存储里,任务就提交到数据所在的那朵云、那个账号里跑。没有「把几百 GB 训练集从一朵云搬到另一朵云」的环节。

如果哪天想换云,也是同一套逻辑:新账号授权接入,改一个 gpuSkuKey 重新提交。代码、环境声明、数据原封不动。

什么时候需要多云,什么时候不需要

诚实地说,不是所有人都需要多云:

  • 如果你的用量稳定、单一厂商的折扣已经谈得很好,多云带来的收益有限;
  • 但如果你经常遇到「想用的机型没货」「账单越来越看不懂」「担心被一家绑定」,多云模式的价值就很直接——把选择权拿回到自己手里。

比价不需要任何承诺:注册后在价格页看看各家的实时报价,和你现在的支出对比一下,答案一目了然。

想体验 RunWhere.ai?

Free 永久免费,自带云账号,无需信用卡,30 秒启动第一个 GPU 任务。

免费开始 →