Learning AI Quality 返回 KuthorX Blog II

第 02 章

第 1 周:30 次全过,能说明什么?

用反证法理解 rule of three 与置信度。一段讲解视频,一个可以拖参数的互动演示。

测试 Agent 跑了 30 次,一次都没失败。它的失败率是 0 吗?不能这么说:失败率 1% 的 Agent,30 次全过的概率也有 74%。这一章用反证法回答"30 次全过到底能说明什么"。

讲解视频

互动演示

拖动失败率 p、每组次数 n 和置信度,看门禁什么时候会被骗过。页面底部有自动判分的练习。

互动演示:反证法与置信度 在新标签页打开

反证结构

  1. 假设它很烂:失败率 ≥ 10%。
  2. 那么连续 30 次全过的概率 ≤ 0.930 ≈ 4.2%,很罕见。
  3. 但我们真的看到了 30 次全过。
  4. 所以不再相信"它很烂":95% 置信度下,失败率 ≤ 10%。

rule of three

n 次全过时,95% 置信上界满足 (1 − p)n = 0.05。取对数后 n · p ≈ −ln 0.05 ≈ 3,所以上界 ≈ 3 / n。

全过次数 n95% 置信上界3 / n 近似
545.1%60%
309.5%10%
1002.95%3%
10000.30%0.3%

换成别的置信度,常数跟着变:90% 对应 2.3,95% 对应 3.0,99% 对应 4.6。

不同 n 下的全过概率曲线

n 每大 10 倍,曲线整体左移 10 倍:上界和 n 成反比。实际工作中方向是反过来的,先定目标失败率,再算要跑多少次。

常见错误说法

  • “有 95% 的概率失败率低于 10%”:真实失败率是固定值,不能挂概率。95% 描述的是这套方法的可靠性。
  • “要证明失败率 ≤ 1%,跑 100 次就够”:100 是 1/p,没有用到置信度。100 次全过在 99% 置信度下只能说明 ≤ 4.5%。
  • 只适用于零失败:出现失败以后要换 Wilson 区间,这是下一个概念。