很实用的一点是把评测目标先拆开,否则很容易出现“榜单成绩不错,上线却问题不断”。实际落地时,我觉得可以先从几十到几百条高价值样本做起,特别是线上差评、人工纠正和历史事故案例,它们通常比盲目扩充题库更有价值。
工具方面也没必要一次铺得太全:提示词和模型版本回归可先用 Promptfoo;已有 pytest 体系的团队可考虑 DeepEval;RAG 则应把检索召回与回答忠实度分...