Blog

RunWhere 博客

GPU 云选型、AI 训练成本优化、环境复现技巧——来自平台真实数据的一手经验。

15 分钟跑通第一个 GPU 任务:runw 实战手记

15 分钟跑通第一个 GPU 任务:runw 实战手记

不写一句框架代码,只用一份 YAML 和四个命令,把训练任务从本机跑上云。这篇按官方文档的最短路径完整走一遍:安装、登录、sync、submit、logs,以及第一次最该注意的计费细节。

Read More
自带云账号(BYOA):为什么我们把数据主权放在第一位
2026年7月9日·7 min

自带云账号(BYOA):为什么我们把数据主权放在第一位

算力平台通常让你把钱充进平台、把数据存进平台。RunWhere 选了另一条路:GPU 跑在你自己的云账号,数据 100% 驻留你的对象存储,平台只收订阅。这篇讲讲这条路为什么难、但值得。

BYOA数据安全产品思考
显存不够用?8 个实用 GPU 显存优化技巧
2025年5月25日·9 min

显存不够用?8 个实用 GPU 显存优化技巧

A100 80G 跑 7B 模型微调还 OOM?问题往往不是显卡不够大,而是显存使用方式有优化空间。8 个从易到难的显存优化技巧。

技术GPU显存优化
竞价实例训练指南:用几折价格跑完大模型微调
2025年5月18日·7 min

竞价实例训练指南:用几折价格跑完大模型微调

竞价实例价格通常只有按量计费的 3-5 折,但随时可能被回收。这篇文章教你如何安全地用竞价实例跑训练:高频 checkpoint、监听中断信号、选对任务类型。

成本优化竞价实例微调
从 Jupyter 到生产训练:5 个常见错误和解决方案
2025年5月10日·6 min

从 Jupyter 到生产训练:5 个常见错误和解决方案

很多团队在 Jupyter Notebook 里实验通过后,直接拿来跑生产训练。这篇文章总结了 5 个最容易踩的坑,以及如何避免。

最佳实践训练Jupyter
跨云调度:为什么一张 GPU 要能在多家云之间自由选择
2025年5月2日·7 min

跨云调度:为什么一张 GPU 要能在多家云之间自由选择

同一个训练任务,不同云厂商的报价和库存可能差出一大截。这篇讲清楚 RunWhere 的多云模式:自带多家云账号、实时比价、用 gpuSkuKey 锁定选中的报价。

技术多云调度
自动停机:RunWhere 如何帮你省掉大笔 GPU 账单
2025年4月18日·5 min

自动停机:RunWhere 如何帮你省掉大笔 GPU 账单

训练跑完忘关机是 GPU 浪费的头号元凶。RunWhere 的自动停机在任务进程退出后立即释放资源,计费精确到秒,彻底消灭空跑计费。

自动停机成本优化