【每日一题】|题目:使用大语言模型做测试用例生成时,如何评估生成用例的质量?(附参考答案)

:point_right:参考答案/答题要点:

有效性:生成的用例是否真的能发现缺陷,可用变异测试(注入变异体,看用例能否杀死)量化。

覆盖度:对照需求做追溯,检查分支覆盖、边界值、异常流是否被覆盖到。

可执行性:步骤是否完整可复现、前置条件是否明确、预期结果是否可判定。

一致性与幻觉控制:是否使用了需求中不存在的信息、是否与已有用例大量重复。

效率收益:人工评审+修订的总成本是否低于纯手写。

加分项:提 Prompt 工程手段(给需求模板、few-shot 样例、要求输出结构化格式如 JSON),以及建立人工抽检+回归评估集的机制。