機率與統計
第九版 精華版
譯者 陳常侃
王妙伶
Probability & Statistics for
Engineers & Scientists 9th Edition
原著 Ronald E. Walpole Raymond H. Myers
Sharon L. Myers Keying Ye
CH1 統計學與資料分析導論
1.1 概述:統計推論、樣本、母體及機率的角色
1.2 抽樣程序;資料的收集
1.3 位置的測量:樣本平均值和中位數
1.4 變異性的測量
1.5 離散和連續的資料
1.6 統計建模、科學檢驗以及圖形式診斷
1.1 概述:統計推論、樣本、母體
及機率的角色
科學資料的使用
在食品、電腦軟體、能源、藥品的製造與開發
以及許多其他領域中,使用統計方法都需收集
資訊或科學資料(scientific data)。
在收集科學資料與推論統計(inferential
statistics)之間存在著一種極大的區別。在最近
幾十年內,後者已經得到應有的關注。
這些統計方法被設計來幫助人們在面對不確定
性(uncertainty)和變異(variation)的情況下
做出科學的判斷。
P.1
CH 1 統計學與資料分析導論
1.1 概述:統計推論、樣本、母體
及機率的角色
科學資料的使用
統計方法可被用來分析來自此類製程的資料,
以分析出在製程中哪裡可做改變以改進製程的
品質(quality)。
P.1
CH 1 統計學與資料分析導論
1.1 概述:統計推論、樣本、母體
及機率的角色
在科學資料中的變異性
統計學家利用機率和統計推論的基本定律來得
出與科學系統有關的結論,資訊以樣本
(sample)或觀察值(observation)集合的形式
被收集。
樣本是從母體(population)中收集到的,而這
些母體是一特定類型之所有個體或個別品項的
集合。
P.2
CH 1 統計學與資料分析導論
1.1 概述:統計推論、樣本、母體
及機率的角色
在科學資料中的變異性
工程師可能需要研究製程的條件、溫度、濕度、
特定成分的量等等的影響。他或她可把這些因
子(factor)系統性地移動到根據處方或實驗設
計(experimental design)所建議的位準上。
觀察性的研究(observational study),其中需
要實地的資料收集,但因子位準(factor level)
不能被預先選擇。
P.3
CH 1 統計學與資料分析導論
1.1 概述:統計推論、樣本、母體
及機率的角色
在科學資料中的變異性
現代的統計套裝軟體可計算出平均值(mean)、
中位數(median)、標準差(standard deviation)
及其他單一數字統計值,以及產生出可展示該
樣本「足跡」的圖形。
P.3
CH 1 統計學與資料分析導論
範例 1.1
假設一工程師得到來自一製程的資料,其中抽樣100 個品項,
而其中10 個被發現是瑕疵品。偶爾會有瑕疵品是預料中的事,
顯然這100 個品項代表了樣本。然而,從長久的角度來看,
公司製程只能容忍5%的瑕疵。現在,機率讓工程師可判定對
該製程來說,此份樣本資訊具有多少的決定性。在這案例中,
母體在概念上代表來自該製程之所有可能的品項。假設我們
知道,如果該製程是可接受的,也就是說,如果它產生的品
項不會超過5%的瑕疵品,那麼該製程之100 個隨機品項中,
可能有10 個或更多瑕疵品的機率是0.0282。這個很小的機率
指出,該製程長久下來確實會產生超過5%的瑕疵品。換句話
說,若該製程是可接受的,則幾乎不會獲得該份樣本資訊。
然而,它確實發生了!顯然地,若製程瑕疵率遠超過5%,獲
得該份樣本資訊的機率就會變高了。
P.4
CH 1 統計學與資料分析導論
範例 1.2
通常,科學研究的本質將決定機率和演繹推論在統計推論中
的角色。維吉尼亞理工學院研究了在樹根與真菌作用之間的
關係發展。礦物質從真菌轉移到樹,而糖分從樹轉移到真菌。
在一溫室中種植兩份紅橡樹苗樣本,每一樣本各有10 株,一
份樣本有用氮處理,另一份樣本則沒有用氮處理。所有其他
的環境條件保持不變。所有的樹苗都含有石斛真菌。在140
天之後,記錄以公克為單位的莖重,資料如表1.1中所示。
在此範例中,有兩份來自不同母體(separate population)的
樣本。實驗的目的是判定氮的使用是否對根的生長有影響。
該研究是比較性的研究(也就是說,我們試圖針對一特定重
要的特徵來比較兩個母體)。把資料繪製成如圖1.1 所示的點
狀圖是有用的。o 值表示「有氮」的資料,而× 值表示「無氮」
的資料。
P.4
CH 1 統計學與資料分析導論
範例 1.2 (續)
請注意,此資料看起來可能向讀者指出:平均來說,氮的使
用增加了莖重。四個有氮的觀測值比任何無氮的觀測值都要
大得多。大多數的無氮觀測值似乎都低於資料的中心點。此
資料集貌似表明氮是有效的。但是如何量化呢?如何把所有
明顯的視覺證據做某種意義上的總結?如之前的範例,我們
可以使用機率的基本原理。結論可總結為機率陳述或P 值。
我們不會在這裡展示如何產生該總結機率,與範例1.1 一樣,
這些方法將在第 9 章中討論,其論點主要圍繞在已知氮沒有
效果的情況下「可觀察到像這份資料的機率」。換句話說,
已知兩份樣本都來自相同母體的情況下,可觀察到像這份資
料的機率。假設這個機率很小,比方說 0.03。這當然是有力
的證據,表明使用氮確實會影響紅橡樹苗的平均莖重(因有
明顯地增加)。
P.5
CH 1 統計學與資料分析導論
表1.1
P.5
範例1.2 的資料集
CH 1 統計學與資料分析導論
圖1.1
莖重資料的點狀圖
圖1.2 在機率與推論統計之間的基本關係
P.5-6
CH 1 統計學與資料分析導論
1.2 抽樣程序;資料的收集
簡易隨機抽樣
簡易隨機抽樣(simple random sample)意味著,
具指定樣本大小之任何特定的樣本與具相同大
小之任何其他的樣本,有相同的機會在母體中
被選擇到。樣本大小(sample size)意味著樣
本中元素的數目。
P.7
CH 1 統計學與資料分析導論
1.2 抽樣程序;資料的收集
實驗設計
隨機性或隨機指派的概念在實驗設計
(experimental design)的領域中扮演重大的角
色。
一組所謂處理法(treatment)或組合處理法
(treatment combination)的集合,變成在某種
意義上是要做研究或做比較的母體。
P.7
CH 1 統計學與資料分析導論
範例 1.3
進行一項腐蝕研究以判定用一種腐蝕延緩塗料來塗覆鋁金屬
是否可減少腐蝕量。該塗料是一種保護劑,旨在最小化這類
材料的疲乏損害。我們亦想得知濕度對腐蝕量的影響。腐蝕
測量可以用失效前的千次週期數來表示。使用兩種層級的塗
料,即沒有塗料及塗有化學防腐蝕塗料。此外,使用兩種相
對濕度層級,即 20% 的相對濕度與 80%的相對濕度。
本實驗涉及如下表中所列出的四種組合處理法。使用八個準
備好的鋁片作為實驗單元,每兩個實驗單元被隨機指派給四
種組合處理法中的一種。資料如表 1.2 中所示。
得到的腐蝕資料是兩個鋁片的平均值。平均值圖如圖 1.3 所
示。失效前的週期數值較大時,代表有較少量的腐蝕。正如
我們所預期的,濕度的增加似乎會使腐蝕增加。使用化學防
腐蝕塗料似乎可減少腐蝕。
P.9
CH 1 統計學與資料分析導論
表 1.2 範例 1.3 的資料
P.9
CH 1 統計學與資料分析導論
圖 1.3 範例 1.3 的腐蝕結果
P.9
CH 1 統計學與資料分析導論
1.3 位置的測量:樣本平均值和中
位數
位置的測量為分析者提供資料中心點或某
個其他位置所在的某些測量值。
一個明顯且非常有用的測量是樣本平均值
(sample mean)。平均值是一種簡單的數
值平均。
另一個重要的測量是樣本中位數(sample
median)。樣本中位數的目的是以一種不受
極端值或離群值影響的方式來反映樣本的
集中趨勢。
P.10
CH 1 統計學與資料分析導論
P.10
CH 1 統計學與資料分析導論
1.3 位置的測量:樣本平均值和中
位數
樣本平均值就是在樣本中資料的質量中心
(centroid of the data)。
計算 是母體平均值(population mean)
的估計(estimate)的基礎。
圖 1.4 樣本平均值是有氮莖重量的質量中心
P.11
CH 1 統計學與資料分析導論
1.4 變異性的測量
樣本全距和樣本標準差
有關幅度最簡單的樣本測量值也許是樣本全距
(sample range)Xmax – Xmin,而最常使用的則
是樣本標準差(sample standard deviation)。
數量 n – 1 通常被稱為與變異數估計有關的自
由度(degree of freedom)。自由度描述在計算
變異性時可用的獨立資訊個體數。
樣本變異數的計算不會有 n 個針對平均值的獨
立平方差(independent squared deviation)。
P.14
CH 1 統計學與資料分析導論
P.14
CH 1 統計學與資料分析導論
範例 1.4
P.14-15
CH 1 統計學與資料分析導論
1.4 變異性的測量
哪一個變異性測量比較重要?
統計推論的工作大部分都要得出母體特徵的結
論。在這些特徵中有稱為母體參數(population
parameter)的常數。兩個重要的參數是母體平
均值(population mean)和母體變異數
(population variance)。
P.15
CH 1 統計學與資料分析導論
1.5 離散和連續的資料
收集的資料可以是離散的(discrete)或連
續的(continuous),取決於該應用領域。
P.16
CH 1 統計學與資料分析導論
1.6 統計建模、科學檢驗以及圖形
式診斷
統計分析的最終結果是對假設模型
(postulated model)之參數的估計。
做分析時可能需要一種特定的模型資料,
例如,兩份樣本是來自常態分佈(normal
distribution)或高斯分佈(Gaussian
distribution)。
P.17
CH 1 統計學與資料分析導論
表1.3
P.17
拉伸強度
CH 1 統計學與資料分析導論
圖 1.5
P.18
拉伸強度與棉花百分比的散佈圖
CH 1 統計學與資料分析導論
1.6 統計建模、科學檢驗以及圖形
式診斷
模型的選擇代表一個基本假設
(fundamental assumption),基於該假設才
可以產生統計推論的結果。
圖表或勘查式資料分析(exploratory data
analysis)可以教導分析者一些無法從正式
分析中所檢索到的東西。
圖形把可能會被忽視掉的違反假設
(violation of assumption)突顯出來。
P.19
CH 1 統計學與資料分析導論
表 1.4
汽車電池壽命
表 1.5 電池壽命的莖葉圖
P.19
CH 1 統計學與資料分析導論
表 1.6
P.19
電瓶壽命的雙莖葉圖
CH 1 統計學與資料分析導論
1.6 統計建模、科學檢驗以及圖形
式診斷
莖葉圖
若大量產生的統計資料能以表格和圖形結合的
形式來呈現,則對研究分佈的行為非常有用,
這種形式稱為莖葉圖(stem-and-leaf plot)。
莖葉圖是總結資料的一種有效方法。另一種方
法則是透過使用頻率分佈圖(frequency
distribution),其中被分組在不同類別或間隔
中的資料可透過對每一個莖的葉做計數來構建,
並把每一個莖定義為一類別區間。
P.19-20
CH 1 統計學與資料分析導論
1.6 統計建模、科學檢驗以及圖形
式診斷
直方圖
列出相對次數的表稱為相對次數分佈(relative
frequency distribution)。
使用每一個區間的中點和相應的相對次數,我
們可建構出相對次數直方圖(relative frequency
histogram)(圖 1.6)。
如果分佈可沿著垂直軸對折使得兩邊重合,則
稱該分佈是對稱的(symmetric)。相對於垂直
軸不對稱的分佈稱為歪斜(skewed)。
P.20-21
CH 1 統計學與資料分析導論
表 1.7
P.21
電瓶壽命的相對次數分佈
CH 1 統計學與資料分析導論
圖 1.6 相對次數直方圖
P.21
CH 1 統計學與資料分析導論
1.6 統計建模、科學檢驗以及圖形
式診斷
盒鬚圖或箱型圖
另一個有助於反映樣本性質的圖形是盒鬚圖
(box-and-whisker plot)。
一種稱為箱型圖(box plot)的變化圖形可為觀
看者提供哪些觀察值可能是離群值(outlier)
的資訊。
常見的程序是使用四分全距的倍數(multiple
of the interquartile range)。
P.22
CH 1 統計學與資料分析導論
圖 1.7 估計的頻率分佈
P.22
CH 1 統計學與資料分析導論
圖 1.8 資料的歪斜性
P.22
CH 1 統計學與資料分析導論
範例 1.5
在一份有 40 支香煙的隨機樣本中測量尼古丁含量,資料
顯示在表 1.8 中。
圖 1.9 顯示了此資料的盒鬚圖,觀察值 0.72 和0.85 為在
下尾部之輕微離群值,而觀察值 2.55 是在上尾部之輕微
離群值。在這範例中,四分全距為 0.365,四分全距的
1.5 倍為 0.5475。在另一方面,圖 1.10 提供了它的莖葉圖。
P.23
CH 1 統計學與資料分析導論
表 1.8
P.23
範例 1.5 的尼古丁含量資料
CH 1 統計學與資料分析導論
圖 1.9
P.23
範例 1.5 的盒鬚圖
CH 1 統計學與資料分析導論
圖 1.10
P.23
尼古丁資料的莖葉圖
CH 1 統計學與資料分析導論
範例 1.6
考慮表 1.9 中的資料,其包含 30 份厚度的測量樣本。圖
1.11 描繪了這不對稱資料集的盒鬚圖。注意,左邊的方
塊比右邊的方塊大得多。中位數為 35、下四分位數為 31,
而上四分位數為 36。也請注意右邊的極端觀察值比左邊
的極端觀察值更遠離該盒子。此資料集沒有離群值。
P.24
CH 1 統計學與資料分析導論
表 1.9
P.24
範例 1.6 的資料
CH 1 統計學與資料分析導論
圖 1.11
P.24
厚度的盒鬚圖
CH 1 統計學與資料分析導論