Skip to main content
统计学假设检验计算器

假设检验计算器:如何手算 Z 检验和 T 检验

·14 min read·Solvify Team

假设检验计算器用来判断样本数据是否提供了足够强的证据来拒绝关于总体的某个论断,它把原假设和备择假设转化为一个检验统计量和一个 p 值,让你可以拿它与显著性水平作比较。当作业题问一家工厂的平均灌装重量是否发生了偏移、一种新教学方法是否真的提高了考试成绩、或者网站改版是否确实提升了转化率时,学生往往会求助于假设检验计算器。本指南从零开始建立假设检验的 z 检验和 t 检验版本,完整演示单样本 z 检验和 t 检验的例题,并解释单尾检验与双尾检验、临界值、p 值以及第一类和第二类错误,让你在信任假设检验计算器的输出之前,先彻底弄清它到底算了什么。

什么是假设检验计算器?

假设检验计算器接收样本数据、一个被声称的总体数值和一个显著性水平,然后返回检验统计量、p 值以及是否拒绝该论断的结论。每一个假设检验都从两个相互竞争的陈述开始:原假设(H0)代表既有论断或现状,备择假设(Ha)代表你怀疑可能才是真实情况的内容。假设检验计算器永远无法证明 H0 为真——它只衡量样本证据是否足够强,从而拒绝 H0、支持 Ha,还是太弱以至于无法得出这一结论。

假设检验永远不能证明原假设为真,它只判断样本证据是否强到足以拒绝它。

假设检验计算器如何在 Z 检验和 T 检验之间做选择?

每个假设检验计算器需要的核心输入都一样——一个被声称的总体数值、一个样本统计量、一个离散程度的度量以及样本量——但它使用哪个公式取决于一个关键事实:总体标准差是否已知。

1. 当总体标准差(σ)已知时使用 z 检验

这种情况出现在论断本身附带了一个历史的或理论上的 σ 时,通常来自一个庞大的已有数据集——例如某制造商拥有某产品重量多年的质量控制记录。检验统计量:z = (x̄ − μ0) ÷ (σ ÷ √n),其中 x̄ 是样本均值,μ0 是被声称的总体均值,n 是样本量。

2. 当只知道样本标准差(s)时使用 t 检验

这是现实中常见得多的情形,因为总体标准差很少能事先知道。检验统计量:t = (x̄ − μ0) ÷ (s ÷ √n),自由度 df = n − 1。对小样本而言,t 分布比正态分布更宽更扁平,这使得达到显著更困难——这是对用样本本身估计 σ 所带来的额外不确定性的一种内建惩罚。

3. 为什么你仍然应该学会手算方法

作业和考试几乎总是要求完整的步骤——写出 H0 和 Ha、逐项计算检验统计量、并把它与临界值或 p 值作比较——而不只是一个最终的小数。用假设检验计算器核对答案最快,但下面的手算步骤才是真正能拿分的部分,也能培养后续学习置信区间和方差分析所需的直觉。

如何一步步计算单样本 Z 检验?

下面是一个完整的例题,其中的论断可以对照已知的总体标准差来检验。

1. 写出假设并收集数据

某麦片公司声称其每盒平均装有 500 g,历史质量控制数据显示总体标准差为 σ = 12 g。一名质检员抽取 n = 36 盒,得到样本均值 x̄ = 495 g。H0:μ = 500(平均灌装重量与论断一致)。Ha:μ ≠ 500(平均灌装重量与论断不同)。由于关注的是任何方向的偏差,而不只是装少了,所以这是一个双尾检验。在 α = 0.05 下进行检验。

2. 计算 z 检验统计量

z = (x̄ − μ0) ÷ (σ ÷ √n) = (495 − 500) ÷ (12 ÷ √36) = −5 ÷ (12 ÷ 6) = −5 ÷ 2 = −2.5。

3. 求临界值和 p 值

对于 α = 0.05 的双尾检验,临界 z 值为 ±1.96。p 值为 2 × P(Z ≤ −2.5) = 2 × 0.0062 ≈ 0.0124。

4. 作出判断并解释结论

由于 |z| = 2.5 超过了 1.96(等价地,p ≈ 0.0124 小于 α = 0.05),拒绝 H0。样本提供了具有统计显著性的证据,表明平均灌装重量与所声称的 500 g 不同。假设检验计算器会瞬间返回同样的 z = −2.5 和 p ≈ 0.0124,但现在你可以自己验证每一个中间数字。

z = (x̄ − μ0) ÷ (σ ÷ √n)。当 x̄ = 495、μ0 = 500、σ = 12、n = 36 时,z = −2.5,其绝对值超过临界值 1.96——拒绝 H0。

如何一步步计算单样本 T 检验?

当总体标准差未知时,流程几乎完全相同,只是改用样本标准差和 t 分布,而不是正态分布。

1. 写出假设并收集数据

某辅导机构声称其课程平均能把考试成绩提高 8 分以上。一个 n = 15 名学生的样本显示平均提高 x̄ = 8.9 分,样本标准差为 s = 2.1 分。H0:μ = 8(真实的平均提分为 8 分)。Ha:μ > 8(真实的平均提分大于 8 分)。由于该机构只声称提高超过 8 分,所以这是一个单尾(右尾)检验。在 α = 0.05 下进行检验。

2. 计算 t 检验统计量

t = (x̄ − μ0) ÷ (s ÷ √n) = (8.9 − 8) ÷ (2.1 ÷ √15) = 0.9 ÷ (2.1 ÷ 3.873) = 0.9 ÷ 0.5422 ≈ 1.660。

3. 求临界值和 p 值

自由度:df = n − 1 = 15 − 1 = 14。对于 df = 14、α = 0.05 的单尾检验,临界 t 值约为 1.761。查 df = 14 下的 t ≈ 1.660,得到单尾 p 值约为 0.059。

4. 作出判断并解释结论

由于 t ≈ 1.660 没有超过临界值 1.761(等价地,p ≈ 0.059 大于 α = 0.05),未能拒绝 H0。这个 15 名学生的样本在 5% 显著性水平下没有提供足够强的证据表明真实的平均提分超过 8 分——尽管 8.9 的样本均值单看起来很有希望。

t = (x̄ − μ0) ÷ (s ÷ √n)。当 x̄ = 8.9、μ0 = 8、s = 2.1、n = 15 时,t ≈ 1.660,df = 14——低于临界值 1.761,因此我们未能拒绝 H0。

单尾检验和双尾检验有什么区别?

选择单尾还是双尾检验完全取决于备择假设是怎么表述的,选错会同时改变临界值和结论。

1. 双尾检验关注任何方向的差异

Ha:μ ≠ μ0 把拒绝域分到分布的两个尾部,因此任一方向(偏高或偏低)的证据都可能导致拒绝 H0。上面的麦片盒例题是双尾的,因为对质检员来说,任一方向的偏差——装多了或装少了——都很重要。

2. 单尾检验只关注某一特定方向的差异

Ha:μ > μ0 或 Ha:μ < μ0 把整个拒绝域放在单侧尾部,这让该方向上更容易达到显著,但也意味着相反方向的证据无论多么极端,都永远不会导致拒绝 H0。

3. 一个例题:左尾 z 检验

某制造商声称其灯泡平均至少能使用 1000 小时,已知 σ = 50 小时。一个 n = 40 只灯泡的样本平均寿命为 x̄ = 985 小时。H0:μ = 1000。Ha:μ < 1000(左尾,因为关注的是灯泡寿命低于所声称的值)。z = (985 − 1000) ÷ (50 ÷ √40) = −15 ÷ 7.906 ≈ −1.897。α = 0.05 下的左尾临界值为 −1.645。由于 z ≈ −1.897 比 −1.645 更极端(p ≈ 0.0289 < 0.05),拒绝 H0——样本表明灯泡的平均寿命低于所声称的 1000 小时。

双尾检验把 α 分摊到两个尾部(α = 0.05 时为 ±1.96);单尾检验把全部 α 放在一个尾部(α = 0.05 时为 ±1.645),因而只在预设方向上更容易检测出效应。

什么是第一类错误和第二类错误,它们为什么重要?

没有哪个假设检验是完全确定的,理解它可能出错的两种方式,与正确计算检验统计量同样重要。

1. 第一类错误:拒绝了为真的 H0

当检验拒绝了实际上为真的 H0 时,就发生了第一类错误——即假阳性。以麦片盒为例,第一类错误意味着在平均灌装重量其实并未偏离 500 g 时,却得出它已经偏移的结论。第一类错误的概率等于显著性水平 α,这也是为什么选择 α = 0.05 意味着接受最高 5% 的这类误报风险。

2. 第二类错误:未能拒绝为假的 H0

当检验未能拒绝实际上为假的 H0 时,就发生了第二类错误——即漏检。在辅导课程的例题中,第二类错误意味着在该课程确实能把成绩提高 8 分以上时,却得出它做不到的结论,也许是因为 15 的样本量太小,不足以检测出一个真实但幅度不大的效应。第二类错误的概率记作 β,而 1 − β 称为检验的功效。

3. 两类错误之间的权衡

降低 α 以减少第一类错误的可能性(比如从 0.05 降到 0.01)会让检验更保守,反而提高了第二类错误的概率。增大样本量通常是同时降低两类错误率的最佳办法,因为更大的 n 会缩小标准误,让真实效应更容易被检测出来,而不必放宽 α。

第一类错误:拒绝了为真的 H0(误报),概率为 α。第二类错误:未能拒绝为假的 H0(漏检),概率为 β。

使用假设检验计算器时应避免哪些错误?

无论是手算还是事后用假设检验计算器核对,这些错误在评分的统计学作业中都会不断出现。

1. σ 未知时却用了 z 检验

如果题目没有直接给出总体标准差(也无法从庞大的历史数据集中假定),就改用样本标准差做 t 检验。把样本标准差代入 z 公式会低估真实的不确定性,对小样本尤其如此。

2. 选错了尾部方向

让 Ha 与论断的实际措辞相匹配很重要:“大于”或“超过”意味着右尾检验,“小于”意味着左尾检验,“不同于”或“不等于”意味着双尾检验。对单尾论断使用双尾临界值(或反过来)会同时改变临界值和结论。

3. 把 p 值误读为 H0 为真的概率

较小的 p 值意味着:如果 H0 为真,观察到这样的数据是不太可能的——它并不直接说明 H0 本身为真或为假的概率。写结论时要记住这个条件表述(“在 H0 成立的前提下出现这组数据的概率”)。

4. 把“未能拒绝”当成“已被证明为真”

未能拒绝 H0 只表示样本没有提供足够的反对证据——它从来不能证明 H0 为真。对同一个总体,更大的样本或另一个样本仍可能导致拒绝 H0。

假设检验练习题与解答

按由易到难的顺序做完这三道题。每题先自己尝试再看解答,然后把你的解题设置与所展示的步骤对照检查。

1. 第 1 题(入门):双尾 z 检验

某果汁公司声称其瓶装容量平均为 16 oz,已知总体标准差 σ = 0.5 oz。一个 n = 25 瓶的样本均值为 15.8 oz。在 α = 0.05 下检验真实均值是否不同于 16 oz。解答:z = (15.8 − 16) ÷ (0.5 ÷ √25) = −0.2 ÷ 0.1 = −2.0。α = 0.05(双尾)下的临界值为 ±1.96。由于 |z| = 2.0 > 1.96,拒绝 H0——p ≈ 2 × (1 − 0.9772) = 0.0456,小于 0.05,印证了同样的结论。

2. 第 2 题(进阶):单尾 t 检验

某健身 App 声称用户每次锻炼平均消耗超过 300 卡路里。一个 n = 20 次锻炼的样本有 x̄ = 310 卡路里、s = 25 卡路里。在 α = 0.05 下做右尾检验。解答:t = (310 − 300) ÷ (25 ÷ √20) = 10 ÷ 5.590 ≈ 1.789。df = 19,α = 0.05(单尾)下的临界 t 值约为 1.729。由于 t ≈ 1.789 > 1.729,拒绝 H0——样本支持平均消耗卡路里超过 300 的论断,p ≈ 0.045。

3. 第 3 题(高阶):更严格 α 下的双尾 t 检验

某咖啡店声称其平均等待时间为 4 分钟。一个 n = 10 名顾客的样本有 x̄ = 4.6 分钟、s = 0.9 分钟。在 α = 0.01 下检验真实平均等待时间是否不同于 4 分钟。解答:t = (4.6 − 4) ÷ (0.9 ÷ √10) = 0.6 ÷ 0.2846 ≈ 2.108。df = 9,α = 0.01(双尾)下的临界 t 值约为 ±3.250。由于 |t| ≈ 2.108 小于 3.250(p ≈ 0.064,远高于 0.01),未能拒绝 H0——在 1% 的水平下,这个样本没有提供足够强的证据表明真实平均等待时间不同于 4 分钟。

关于假设检验计算器,学生还常问什么?

这些是在做假设检验作业和复习考试时最常出现的问题。

1. 在假设检验计算器中,z 检验和 t 检验有什么区别?

z 检验要求总体标准差已知并使用正态分布;t 检验改用样本标准差,依赖 t 分布,后者在小样本下更宽,以体现估计 σ 带来的额外不确定性。当样本量变大时(大致 n ≥ 30),t 分布趋近于正态分布,两种检验给出的结果几乎相同。

2. 假设检验计算器能处理比例而不是均值吗?

可以——单比例 z 检验遵循同样的逻辑,但使用 z = (p̂ − p0) ÷ √[p0(1 − p0) ÷ n],即把样本比例 p̂ 与所声称的总体比例 p0 作比较,而不是比较样本均值与总体均值。

3. “未能拒绝 H0”和“接受 H0”是一回事吗?

不是。未能拒绝 H0 表示样本没有提供足够的证据来拒绝该论断——它从来不能证明该论断为真。正因如此,统计学家刻意避免使用“接受 H0”这种说法,而坚持用“未能拒绝”。

4. 假设检验的显著性水平(α)该怎么选?

α = 0.05 是大多数课程中的标准默认值,它在第一类错误率和第二类错误率之间取得平衡。在假阳性代价特别高的领域,例如临床药物试验,常使用更严格的 α = 0.01;而一些探索性研究会使用更宽松的 α = 0.10。

获取更多假设检验作业帮助

一旦你能熟练写出 H0 和 Ha、在 z 检验和 t 检验之间做出选择、并把检验统计量与临界值或 p 值作比较,假设检验题就会从神秘公式变成一件细心搭建框架的事。练习时要混合单尾和双尾的题目,因为考试常常要求你仅凭论断的措辞就判断出该用哪一种。如果你在某道题的设置上卡住了,或者想复核一遍手算结果,Solvify 的分步求解器可以按本指南展示的同一套公式走一遍——检验统计量、临界值或 p 值以及最终判断——让你清楚看到自己的设置在哪一步偏离了正确做法。

在动用假设检验计算器之前,先写下 H0、Ha 以及这是单尾还是双尾检验——这一个决定同时决定了你的临界值和你的结论。
标签:
统计学假设检验计算器

立即获取作业帮助

与数百万学生一起使用我们的 AI 数学解题系统。获取数学题目的即时解答、逐步讲解和全天候作业辅导。

支持 iOS 和安卓设备