AI 工具链

多轮解释不一致比没解释更危险:评估智能调试助手的输出稳定性

多轮调试助手对同一崩溃日志给出不同根因,源于概率采样、证据缺失与变量命名偏好。可通过根因类别熵、证据引用重叠率、可证伪强度三个指标量化不一致性。工程上采用固定推理骨架、多轮采样投票、追踪行动后果来降低漂移,同时利用区域共识与类型分歧信号辅助排查。