Blog
RunWhere 博客
GPU 云选型、AI 训练成本优化、环境复现技巧——来自平台真实数据的一手经验。
15 分钟跑通第一个 GPU 任务:runw 实战手记
不写一句框架代码,只用一份 YAML 和四个命令,把训练任务从本机跑上云。这篇按官方文档的最短路径完整走一遍:安装、登录、sync、submit、logs,以及第一次最该注意的计费细节。
Read More
2026年7月9日·7 min
自带云账号(BYOA):为什么我们把数据主权放在第一位
算力平台通常让你把钱充进平台、把数据存进平台。RunWhere 选了另一条路:GPU 跑在你自己的云账号,数据 100% 驻留你的对象存储,平台只收订阅。这篇讲讲这条路为什么难、但值得。
BYOA数据安全产品思考
2025年5月25日·9 min
显存不够用?8 个实用 GPU 显存优化技巧
A100 80G 跑 7B 模型微调还 OOM?问题往往不是显卡不够大,而是显存使用方式有优化空间。8 个从易到难的显存优化技巧。
技术GPU显存优化
2025年5月18日·7 min
竞价实例训练指南:用几折价格跑完大模型微调
竞价实例价格通常只有按量计费的 3-5 折,但随时可能被回收。这篇文章教你如何安全地用竞价实例跑训练:高频 checkpoint、监听中断信号、选对任务类型。
成本优化竞价实例微调
2025年5月10日·6 min
从 Jupyter 到生产训练:5 个常见错误和解决方案
很多团队在 Jupyter Notebook 里实验通过后,直接拿来跑生产训练。这篇文章总结了 5 个最容易踩的坑,以及如何避免。
最佳实践训练Jupyter
2025年5月2日·7 min
跨云调度:为什么一张 GPU 要能在多家云之间自由选择
同一个训练任务,不同云厂商的报价和库存可能差出一大截。这篇讲清楚 RunWhere 的多云模式:自带多家云账号、实时比价、用 gpuSkuKey 锁定选中的报价。
技术多云调度
2025年4月18日·5 min
自动停机:RunWhere 如何帮你省掉大笔 GPU 账单
训练跑完忘关机是 GPU 浪费的头号元凶。RunWhere 的自动停机在任务进程退出后立即释放资源,计费精确到秒,彻底消灭空跑计费。
自动停机成本优化