权重装进了 24 GiB,四路 32K 上下文还装得下吗?
权重装进了 24 GiB,四路 32K 上下文还装得下吗? 模型权重已经加载,短问题也能回答,于是把服务目标改成四路长上下文。接下来遇到的却是缓存不足、请求等待,或者在某个峰值阶段显存不够。第一反应往往是:“权重才占一部分,剩下的显存为什么不够?” 加载成功只验证了当时那笔开销。生成中的历史信息也要留在 GPU 上,运行时还会需要临时空间。要判断四路长请求是否可行,需要回答的是:扣掉权重和非缓存峰值后,每张卡到底还有多少空间,能够同时保留多少 token 的 KV?

