Skip to main content
統計學假設檢定計算機

假設檢定計算機:如何手算z檢定與t檢定

·14 min read·Solvify Team

假設檢定計算機會檢查樣本資料是否提供了足夠強的證據來拒絕某個關於母體的宣稱,把虛無假設與對立假設轉換成單一個檢定統計量和一個p值,讓你能夠拿來與顯著水準比較。當作業題目問到某座工廠的平均裝填重量是否已經偏移、新的教學法是否真的提高了考試成績,或某次網站改版是否確實提升了轉換率時,學生就會用上假設檢定計算機。本指南從零開始建立假設檢定的z檢定與t檢定版本,完整演練單一樣本z檢定與t檢定的範例,並解釋單尾與雙尾檢定、臨界值、p值以及第一型與第二型錯誤,讓你在信任假設檢定計算機的輸出之前,先確切理解它到底在算什麼。

什麼是假設檢定計算機?

假設檢定計算機接收樣本資料、一個宣稱的母體值以及顯著水準,然後回傳檢定統計量、p值,以及是否要拒絕該宣稱的結論。每一個假設檢定都從兩個互相競爭的陳述開始:虛無假設(H0)代表既有的宣稱或現狀,對立假設(Ha)則代表你懷疑可能為真的情況。假設檢定計算機永遠不會證明H0為真——它只衡量樣本證據是否強到足以拒絕H0並支持Ha,或者太弱而無法支持這個結論。

假設檢定永遠無法證明虛無假設為真。它只判斷樣本證據是否強到足以拒絕虛無假設。

假設檢定計算機如何在z檢定與t檢定之間做選擇?

每一台假設檢定計算機都需要同樣的核心輸入——一個宣稱的母體值、一個樣本統計量、一個離散程度的度量,以及樣本數——但它採用哪一條公式,取決於一個關鍵事實:母體標準差是否已知。

1. 母體標準差(σ)已知時使用z檢定

當某個宣稱附帶了歷史或理論上的σ時就屬於這種情況,通常來自龐大的既有資料集——例如某家製造商累積多年、關於某項產品重量的品管紀錄。檢定統計量:z = (x̄ − μ0) ÷ (σ ÷ √n),其中x̄是樣本平均數,μ0是宣稱的母體平均數,n是樣本數。

2. 只知道樣本標準差(s)時使用t檢定

這是現實中常見得多的情況,因為母體標準差很少會事先已知。檢定統計量:t = (x̄ − μ0) ÷ (s ÷ √n),自由度為df = n − 1。在小樣本時,t分配比常態分配更寬也更扁平,使得達到顯著更加困難——這是對「必須用樣本本身去估計σ」所帶來的額外不確定性內建的懲罰。

3. 為什麼你仍然應該學會手算方法

作業與考試幾乎一定要求完整的流程——寫出H0與Ha、逐項計算檢定統計量,並把它與臨界值或p值比較——而不只是一個最終的小數。假設檢定計算機最適合用來核對答案,但下面這些手算步驟才是真正拿得到分數的部分,也能建立之後學習信賴區間與變異數分析(ANOVA)所需的直覺。

如何一步步計算單一樣本z檢定?

以下是一個完整的範例演練,使用的是可以拿已知母體標準差來檢核的宣稱。

1. 寫出假設並蒐集資料

某家麥片公司宣稱每盒平均裝有500 g,而歷史品管資料顯示母體標準差為σ = 12 g。一位品管人員抽樣n = 36盒,得到樣本平均數x̄ = 495 g。H0:μ = 500(平均裝填重量與宣稱相符)。Ha:μ ≠ 500(平均裝填重量與宣稱不同)。由於關心的是任何方向的偏差,而不只是裝得太少,因此這是雙尾檢定。以α = 0.05進行檢定。

2. 計算z檢定統計量

z = (x̄ − μ0) ÷ (σ ÷ √n) = (495 − 500) ÷ (12 ÷ √36) = −5 ÷ (12 ÷ 6) = −5 ÷ 2 = −2.5。

3. 找出臨界值與p值

在α = 0.05的雙尾檢定中,臨界z值為±1.96。p值為2 × P(Z ≤ −2.5) = 2 × 0.0062 ≈ 0.0124。

4. 做出決策並解讀

由於|z| = 2.5超過1.96(等價地說,p ≈ 0.0124小於α = 0.05),因此拒絕H0。這份樣本提供了統計上顯著的證據,顯示平均裝填重量與宣稱的500 g不同。假設檢定計算機會瞬間回傳同樣的z = −2.5與p ≈ 0.0124,但現在你可以自己驗證每一個中間數值。

z = (x̄ − μ0) ÷ (σ ÷ √n)。當x̄ = 495、μ0 = 500、σ = 12、n = 36時,z = −2.5,其絕對值超過臨界值1.96——拒絕H0。

如何一步步計算單一樣本t檢定?

當母體標準差未知時,流程幾乎完全相同,只是改用樣本標準差與t分配,而不是常態分配。

1. 寫出假設並蒐集資料

某家補習機構宣稱其課程平均能讓考試成績提高超過8分。一份n = 15名學生的樣本顯示平均進步x̄ = 8.9分,樣本標準差為s = 2.1分。H0:μ = 8(真實的平均進步為8分)。Ha:μ > 8(真實的平均進步大於8分)。由於該機構只宣稱進步超過8分,因此這是單尾(右尾)檢定。以α = 0.05進行檢定。

2. 計算t檢定統計量

t = (x̄ − μ0) ÷ (s ÷ √n) = (8.9 − 8) ÷ (2.1 ÷ √15) = 0.9 ÷ (2.1 ÷ 3.873) = 0.9 ÷ 0.5422 ≈ 1.660。

3. 找出臨界值與p值

自由度:df = n − 1 = 15 − 1 = 14。在df = 14、α = 0.05的單尾檢定中,臨界t值約為1.761。以df = 14查表得到t ≈ 1.660所對應的單尾p值大約是0.059。

4. 做出決策並解讀

由於t ≈ 1.660並未超過臨界值1.761(等價地說,p ≈ 0.059大於α = 0.05),因此無法拒絕H0。在5%的顯著水準下,這份15名學生的樣本並未提供足夠強的證據顯示真實的平均進步超過8分——即使樣本平均數8.9單看起來相當有希望。

t = (x̄ − μ0) ÷ (s ÷ √n)。當x̄ = 8.9、μ0 = 8、s = 2.1、n = 15時,t ≈ 1.660且df = 14——低於臨界值1.761,因此我們無法拒絕H0。

單尾檢定與雙尾檢定有什麼差別?

要選單尾還是雙尾檢定,完全取決於對立假設的敘述方式,而選錯會同時改變臨界值與結論。

1. 雙尾檢定檢查任何方向的差異

Ha:μ ≠ μ0會把拒絕域分散到分配的兩側尾端,因此任一方向的證據(過高或過低)都可能導致拒絕H0。上面的麥片盒範例屬於雙尾,因為任一方向的偏差——裝太多或裝太少——對品管人員來說都很重要。

2. 單尾檢定只檢查某一個特定方向的差異

Ha:μ > μ0或Ha:μ < μ0會把整個拒絕域放在單側尾端,這讓該方向更容易達到顯著,但也意味著相反方向的證據無論多麼極端,都永遠不會導致拒絕H0。

3. 範例演練:左尾z檢定

某家製造商宣稱其燈泡平均至少可使用1000小時,已知σ = 50小時。一份n = 40顆燈泡的樣本平均壽命為x̄ = 985小時。H0:μ = 1000。Ha:μ < 1000(左尾,因為關心的是燈泡壽命低於宣稱值)。z = (985 − 1000) ÷ (50 ÷ √40) = −15 ÷ 7.906 ≈ −1.897。在α = 0.05下,左尾臨界值為−1.645。由於z ≈ −1.897比−1.645更極端(p ≈ 0.0289 < 0.05),因此拒絕H0——樣本顯示燈泡的平均壽命低於宣稱的1000小時。

雙尾檢定把α分散到兩側尾端(α = 0.05時為±1.96);單尾檢定則把全部的α放在單側尾端(α = 0.05時為±1.645),使得只有在預測方向上的效果更容易被偵測到。

什麼是第一型與第二型錯誤?為什麼它們很重要?

沒有任何假設檢定是百分之百確定的,而理解它可能出錯的兩種方式,與正確計算檢定統計量同樣重要。

1. 第一型錯誤:拒絕了為真的H0

當H0其實為真、檢定卻拒絕了它時,就發生第一型錯誤——也就是偽陽性。以麥片盒的例子來說,第一型錯誤代表在平均裝填重量其實並未偏離500 g的情況下,卻做出它已經偏移的結論。第一型錯誤的機率等於顯著水準α,這也是為什麼選擇α = 0.05等於接受最高5%發生這類假警報的機會。

2. 第二型錯誤:未能拒絕為假的H0

當H0其實為假、檢定卻未能拒絕它時,就發生第二型錯誤——也就是漏掉了真實效果。在補習課程的例子中,第二型錯誤代表在課程確實能讓成績提高超過8分的情況下,卻做出它沒有的結論,原因可能是15人的樣本數太小,不足以偵測到真實但幅度不大的效果。第二型錯誤的機率記為β,而1 − β稱為檢定的檢定力。

3. 兩種錯誤之間的取捨

調低α以降低第一型錯誤的機率(例如從0.05降到0.01)會讓檢定更保守,反而提高了第二型錯誤發生的機會。增加樣本數通常是同時降低兩種錯誤率的最佳方式,因為較大的n會縮小標準誤,讓真實效果更容易被偵測到,而不需要放寬α。

第一型錯誤:拒絕了為真的H0(假警報),機率為α。第二型錯誤:未能拒絕為假的H0(漏掉效果),機率為β。

使用假設檢定計算機時該避免哪些錯誤?

無論是手算還是事後用假設檢定計算機核對,以下這些錯誤都會不斷出現在會計分的統計學作業中。

1. 在σ未知時卻使用z檢定

如果題目沒有直接給出母體標準差(而且也無法從龐大的歷史資料集中假定),就應該改用t檢定搭配樣本標準差。把樣本標準差代入z公式會低估真實的不確定性,在小樣本時尤其嚴重。

2. 選錯尾端方向

讓Ha符合宣稱的實際敘述很重要:「大於」或「超過」代表右尾檢定,「小於」代表左尾檢定,「不同於」或「不等於」則代表雙尾。對單尾的宣稱套用雙尾臨界值(或反過來)會同時改變臨界值與結論。

3. 把p值誤讀成H0為真的機率

p值很小代表如果H0為真,觀察到這份資料的可能性很低——它並不直接說明H0本身為真或為假的機率。撰寫結論時,請記得維持條件式的說法(「在H0成立的前提下,出現這份資料的機率」)。

4. 把「無法拒絕」當成「已證明為真」

無法拒絕H0只代表樣本沒有提供足夠的反面證據——它永遠無法證明H0為真。對同一個母體而言,更大的樣本或另一份樣本仍有可能導致拒絕H0。

假設檢定練習題與詳解

依照由易到難的順序做完以下三題。每一題都先自己試著解,再看詳解,然後對照所列步驟檢查你的設定。

1. 第1題(入門):雙尾z檢定

某家果汁公司宣稱其瓶裝容量平均為16 oz,已知母體標準差為σ = 0.5 oz。一份n = 25瓶的樣本平均為15.8 oz。以α = 0.05檢定真實平均是否與16 oz不同。詳解:z = (15.8 − 16) ÷ (0.5 ÷ √25) = −0.2 ÷ 0.1 = −2.0。α = 0.05(雙尾)的臨界值為±1.96。由於|z| = 2.0 > 1.96,拒絕H0——p ≈ 2 × (1 − 0.9772) = 0.0456,小於0.05,印證了相同的結論。

2. 第2題(進階):單尾t檢定

某款健身應用程式宣稱使用者每次運動平均消耗超過300大卡。一份n = 20次運動的樣本為x̄ = 310大卡、s = 25大卡。以α = 0.05進行右尾檢定。詳解:t = (310 − 300) ÷ (25 ÷ √20) = 10 ÷ 5.590 ≈ 1.789。df = 19,α = 0.05(單尾)的臨界t值約為1.729。由於t ≈ 1.789 > 1.729,拒絕H0——樣本支持平均消耗熱量超過300大卡的宣稱,p ≈ 0.045。

3. 第3題(挑戰):α更嚴格的雙尾t檢定

某家咖啡店宣稱平均等待時間為4分鐘。一份n = 10位顧客的樣本為x̄ = 4.6分鐘、s = 0.9分鐘。以α = 0.01檢定真實平均等待時間是否與4分鐘不同。詳解:t = (4.6 − 4) ÷ (0.9 ÷ √10) = 0.6 ÷ 0.2846 ≈ 2.108。df = 9,α = 0.01(雙尾)的臨界t值約為±3.250。由於|t| ≈ 2.108小於3.250(p ≈ 0.064,遠高於0.01),無法拒絕H0——在1%的水準下,這份樣本並未提供足夠強的證據顯示真實的平均等待時間與4分鐘不同。

關於假設檢定計算機,學生還常問什麼?

以下是在假設檢定作業與考前複習時最常一併出現的問題。

1. 在假設檢定計算機中,z檢定與t檢定有什麼差別?

z檢定需要已知的母體標準差並使用常態分配;t檢定則改用樣本標準差,並依賴t分配,而t分配在小樣本時較寬,用來反映估計σ所帶來的額外不確定性。當樣本數變大(大約n ≥ 30)時,t分配會逼近常態分配,兩種檢定給出的結果幾乎相同。

2. 假設檢定計算機可以處理比例而不是平均數嗎?

可以——單一比例z檢定遵循相同的邏輯,但使用z = (p̂ − p0) ÷ √[p0(1 − p0) ÷ n],把樣本比例p̂與宣稱的母體比例p0比較,而不是比較樣本與母體的平均數。

3. 「無法拒絕H0」和「接受H0」是同一件事嗎?

不是。無法拒絕H0代表樣本沒有提供足夠的證據去拒絕該宣稱——它永遠無法證明該宣稱為真。正因如此,統計學家刻意避免使用「接受H0」這種說法,而一律採用「無法拒絕」。

4. 我該如何為假設檢定選擇顯著水準(α)?

α = 0.05是大多數課程的標準預設值,能在第一型與第二型錯誤率之間取得平衡。在偽陽性代價特別高昂的領域(例如臨床藥物試驗),常會採用更嚴格的α = 0.01;而某些探索性研究則會使用較寬鬆的α = 0.10。

取得更多假設檢定作業協助

一旦你能熟練地寫出H0與Ha、在z檢定與t檢定之間做選擇,並把檢定統計量與臨界值或p值比較,假設檢定題目就會從神秘的公式變成一件講究細心設定的事。請混合練習單尾與雙尾的題目,因為考試常常期待你僅憑宣稱的敘述方式就能判斷該用哪一種。如果你卡在某一題的設定上,或想再次核對手算的結果,Solvify的逐步解題工具可以帶你走完本指南所示的同一套流程——檢定統計量、臨界值或p值,以及最終決策——讓你清楚看到自己的設定是在哪一步偏離了正確作法。

在動手使用假設檢定計算機之前,先寫下H0、Ha,以及這是單尾還是雙尾檢定——這一個決定同時決定了你的臨界值與結論。
標籤:
統計學假設檢定計算機

立即獲取作業協助

與數百萬學生一起使用我們的 AI 數學解題系統。獲取數學題目的即時解答、逐步講解和全天候作業輔導。

支援 iOS 和 Android 裝置