接了大模型生成测试用例后,我们统计了一周数据,发现人工还得改掉 40%
大模型生成 Playwright 测试用例的实际可用率约 60%,但算上审查和重写成本,净节省开发时间仅 29%。40% 的用例需重写,主要失败在 selector 失效、时序问题、断言质量差和逻辑错误。复杂业务场景下模型表现断崖式下跌,prompt 优化效果有限。团队转而采用分层策略,将模型定位为辅助工具,最终实现稳定且可预期的效率提升。
共 1 篇文章
大模型生成 Playwright 测试用例的实际可用率约 60%,但算上审查和重写成本,净节省开发时间仅 29%。40% 的用例需重写,主要失败在 selector 失效、时序问题、断言质量差和逻辑错误。复杂业务场景下模型表现断崖式下跌,prompt 优化效果有限。团队转而采用分层策略,将模型定位为辅助工具,最终实现稳定且可预期的效率提升。