Serverless AI 推理

按请求计费、冷启动换免运维:适合长尾低频模型服务,高频高并发仍是 GPU 常驻的天下。

定位:Serverless GPU(函数计算 + GPU、RunPod Serverless、Repl icate 类)把「运维一台 GPU 机器」变成「注册一个函数」。代价是冷启动与单价上浮。

适用判据:原型验证、内部工具、夜间批处理、长尾模型路由——交给 Serverless;核心业务高并发——常驻 GPU + 自动伸缩。

国内可选:阿里云函数计算 GPU 模式、部分推理平台的按次计费档;海外:RunPod Serverless、Replicate(按秒计价,模型即 API)。

常见问题

Serverless 推理什么时候比包 GPU 划算?
负载画像决定的:请求稀疏(日均千次以下)、单请求短(秒级)、能容忍冷启动(数百毫秒到数秒)时,按请求计费的成本可以只有常驻 GPU 的 10%–30%。高频稳定流量则反过来,常驻更便宜也更稳。
冷启动问题怎么缓解?
三个手段:平台侧的预留并发(花小钱保温)、模型常驻显存的缓存策略、以及把流量集中到少数模型版本上减少冷实例数量。
↑