这套排查思路很实用,尤其是把 load_duration 和生成耗时分开看,能避免一上来就换显卡。我的经验是,预热脚本最好同时记录模型版本、量化级别和上下文长度,否则升级后数据容易失去可比性。多模型环境下还可以按实际访问间隔设置不同的 keep_alive,并监控显存余量;如果频繁发生模型切换,宁可缩短低频模型驻留时间,也不要让显存长期处于临界状态。压测时加入并发请求和空闲重访,结果会更接近...