标签: Dynamo

0

大模型服务崩一次为什么要几分钟才能回来:NVIDIA“影子引擎”把 283 秒恢复压到 7.3 秒

大模型线上服务的可靠性问题,过去很容易被“多部署几个副本”掩盖。真正到了大规模推理集群,副本并不能消除故障成本:一个 worker 进程崩溃以后,剩余 worker 要立刻承接流量,首 Token 延迟升高,单用户生成速度下降;如果模型有数百 GB 权重,还要重新从存储加载、建立通信器、完成编译和 autotune、重新捕获 CUDA Graph,冷启动可能持续几分钟。对于面向 Coding A