假設我們有一個「題目」,請繪製下列數據之盒鬚圖。
應該不用解釋了吧。
那接著問說,哪一個比較好呢?
千萬別急著回答。要先回答,你的「問題」是什麼。
是的!!
「問題」不等於「題目」。
學校老師不斷地出題目給你解,卻沒有告訴你,當你遇到問題時,該用哪一種題目型態來解。
你先想想,你學到的「題目」,就當做是你學會了一個工具,就像是身上背了一把劍。
當你遇到敵人(問題)時,就拿出最適合的那把劍來砍敵人。
學校老師,努力的跟你講世界上有很多種劍,卻從來沒有告訴你當遇到什麼敵人時,該拿哪一把劍。
唉~把你搞混了。
如果你身上只有一把劍,遇到問題怎麼辦,不砍了嗎?視而不見了嗎?當然不是。
就算只有一把劍,遇到敵人,也要拿出來砍呀。只是砍的順不順手,能不能一刀斃命而已。
如果這把劍,你運用的非常順手,就算是難纏的敵人,頂多是多費點功夫而已。
懂了嗎?
如果你真的只會盒鬚圖,先不要理他。
先把你的問題搞清楚,到底要問什麼、要解決什麼問題。然後想辦法把你問題一直轉化成盒鬚圖能解的問題。
等等,千萬別跟我說「好吧!我只要學會盒鬚圖就好。」
別這麼沒志氣呀,更何況這個還不是真正的劍唷。
繞了一圈。
還是沒辦法告訴你,哪個比較好。
他有可能四個人(機器)做同一件事情,然後隨機抽樣7次的結果。
也有可能是一個人(機器),分四次隨機抽樣,每次抽樣7個數據。
(不過,抽象一點回答,這是解決單因子問題。)
這個就要看你的問題。
有些問題是了解現況,有些問題是預測未來。
無論何種,都是希望透過樣本資料(Data)來一窺全貌。
2013年6月26日 星期三
2013年6月23日 星期日
繪製Box-and-Whisker圖
無論是MS Excel與Mac Number都沒有支援Box-and-Whisker(盒鬚)圖。
但是,只要透過堆疊圖再加上誤差線,動些手腳就可以實作出來。
首先我們先來看看什麼是堆疊圖。
他是從0開始,逐一將數據累加上去。
選擇a的誤差線,就是會從10為開始,有正數與負數(方向)繪製一條細線,其長度可以設定。
有了這兩個基礎之後,我們再回顧一下,Box-and-Whisker是怎麼定義的。
所以,先看堆疊圖,應該要有三個box。
最底下的box是不是從0到第1個四分位數的高度(長度)。
接著是,第1個四分位數到中位數的長度。
再來,中位數到第3四分位數之長度。
接著是畫出那兩根突出的鬚。
下方的鬚,就是第一個box,往負數方向,取第1四分位數與最小值之差。
上方的鬚,就是第三個box,往正數方向,取最大值與第3四分位數之差。
等等!!
推疊圖有三個box,但是Box-and-Whisker只有兩個box。
喔~就是把最下方那個box不填滿就可以了。
再拿之前的數據資料做一遍。
但是,只要透過堆疊圖再加上誤差線,動些手腳就可以實作出來。
首先我們先來看看什麼是堆疊圖。
他是從0開始,逐一將數據累加上去。
選擇a的誤差線,就是會從10為開始,有正數與負數(方向)繪製一條細線,其長度可以設定。
有了這兩個基礎之後,我們再回顧一下,Box-and-Whisker是怎麼定義的。
所以,先看堆疊圖,應該要有三個box。
最底下的box是不是從0到第1個四分位數的高度(長度)。
接著是,第1個四分位數到中位數的長度。
再來,中位數到第3四分位數之長度。
接著是畫出那兩根突出的鬚。
下方的鬚,就是第一個box,往負數方向,取第1四分位數與最小值之差。
上方的鬚,就是第三個box,往正數方向,取最大值與第3四分位數之差。
等等!!
推疊圖有三個box,但是Box-and-Whisker只有兩個box。
喔~就是把最下方那個box不填滿就可以了。
再拿之前的數據資料做一遍。
2013年6月22日 星期六
實驗設計-7
寫到這邊,開始搞混了嗎?開始有點不知所措的嗎?
如果跟你說,再寫下去就是博士班資格考的內容時,你會不會打消學習意願了呢?
對我來說,知識比學歷重要。只可惜,台灣是一個重視學歷不重視知識的地方。
(往後會有更多數學,所以先補上這篇)
寫到這裡,只是統計的基本概念。往進階統計的方向寫下去,也有好多好多東西可以寫,機率就是一個很有趣的事情。再下去,數理統計、工程統計更是讓人一個頭兩個大。還可以朝品管的方向寫下去。還可以...。是的都可以。
而我,是因為看到最近又有什麼Big Data這個撈錢的術語。Data就是Data,沒有大小之分。若搞不清楚你收集資料的目的與意義,那也只是大垃圾與小垃圾之差別而已。
其實,真的沒有這麼難,而是你要知道你學這個要幹嘛?有很多在學校的老師都說數學不重要,不要學。我卻認為數學很重要,只可惜老師不會教。
而我,是學不是教。是從我自己學習的角度,來看這些「艱難」的學問。
還是回到原點,我們為什麼要學這些。
一切都是為了管理。
管理的目的是在控制異常。
所以,你才要去收集資料,看看他的誤差,然後「控制」這個誤差在你的理想範圍內。
所以,到目前為止,我們只有樣本數、樣本平均數、變異數、標準差、有中位數、四分位數等,這個期望用幾個數字,就能夠看出全貌。
說穿了,就是為了控制誤差。
因著誤差來源的因素不同,以及誤差所呈現的特殊樣式,所以後面才會搞出一堆有的沒有的數學模式。
之前提到過,為了讓「誤差減少誤差」所以,我們會「多抽樣幾個,並重複做幾次」。原則上每一次的抽樣都是獨立的行為。
這個模式就是單因子。我們只針對一個問題去抽取我們要的數據資料,利用「幾個」與「幾次」所得到的數據資料來推估母體,或者找出問題。
還有一種情境是「當這個配上那個會怎麼樣」這就是雙因子的問題。原則上每一次的抽樣,就得知道是在這個配上那個下所進行。這樣子的誤差就有可能會發生干擾。為了找出這個干擾,又有一堆的式子等著我們去學習,這類的應用甚至最後可以推估說,「這個配上那個根本沒有意義」,他們根本是獨立事件。
你想知道問題在哪裡嗎?你想透過資料找出問題在哪裡嗎?也許,你可以繼續看下去。
而我的目標,是希望這一段走完後,能慢慢走到機率論,再走到人工智慧的應用去。
如果跟你說,再寫下去就是博士班資格考的內容時,你會不會打消學習意願了呢?
對我來說,知識比學歷重要。只可惜,台灣是一個重視學歷不重視知識的地方。
(往後會有更多數學,所以先補上這篇)
寫到這裡,只是統計的基本概念。往進階統計的方向寫下去,也有好多好多東西可以寫,機率就是一個很有趣的事情。再下去,數理統計、工程統計更是讓人一個頭兩個大。還可以朝品管的方向寫下去。還可以...。是的都可以。
而我,是因為看到最近又有什麼Big Data這個撈錢的術語。Data就是Data,沒有大小之分。若搞不清楚你收集資料的目的與意義,那也只是大垃圾與小垃圾之差別而已。
其實,真的沒有這麼難,而是你要知道你學這個要幹嘛?有很多在學校的老師都說數學不重要,不要學。我卻認為數學很重要,只可惜老師不會教。
而我,是學不是教。是從我自己學習的角度,來看這些「艱難」的學問。
還是回到原點,我們為什麼要學這些。
一切都是為了管理。
管理的目的是在控制異常。
所以,你才要去收集資料,看看他的誤差,然後「控制」這個誤差在你的理想範圍內。
所以,到目前為止,我們只有樣本數、樣本平均數、變異數、標準差、有中位數、四分位數等,這個期望用幾個數字,就能夠看出全貌。
說穿了,就是為了控制誤差。
因著誤差來源的因素不同,以及誤差所呈現的特殊樣式,所以後面才會搞出一堆有的沒有的數學模式。
之前提到過,為了讓「誤差減少誤差」所以,我們會「多抽樣幾個,並重複做幾次」。原則上每一次的抽樣都是獨立的行為。
這個模式就是單因子。我們只針對一個問題去抽取我們要的數據資料,利用「幾個」與「幾次」所得到的數據資料來推估母體,或者找出問題。
還有一種情境是「當這個配上那個會怎麼樣」這就是雙因子的問題。原則上每一次的抽樣,就得知道是在這個配上那個下所進行。這樣子的誤差就有可能會發生干擾。為了找出這個干擾,又有一堆的式子等著我們去學習,這類的應用甚至最後可以推估說,「這個配上那個根本沒有意義」,他們根本是獨立事件。
你想知道問題在哪裡嗎?你想透過資料找出問題在哪裡嗎?也許,你可以繼續看下去。
而我的目標,是希望這一段走完後,能慢慢走到機率論,再走到人工智慧的應用去。
實驗設計-6
相對於平均數有個中位數。這個都是看集中性。
變異數其實是看誤差,有點是在看離平均數有多遠。那應該還有個東西可以用來看散佈性,那就是四分位數。
中位數是把抽樣取得之樣本資料排序,然後取中間那個數據資料。四分位數,就是取得四分之一位置的數據資料。
又回到圖勝於文的問題了。
應該用什麼圖來呈現,這次抽樣所得資料的散佈情形呢?
我們會用Box-and-Whisker Plots。有人翻成盒鬚圖。
這個圖要用到5個資料分別為
依序說明:
最小值,第一四分位數,中位數,第三四分位數,最大值
再用之前的數據計算如下:
但是,Pages或EXCEL都沒有支援這個圖表,得用堆疊圖加誤差線的方式來呈現。有點麻煩,留著以後說明。
網路上倒有不少線上服務可以用。
http://easycalculation.com/statistics/box-plot-grapher.php
這張圖很清楚地描述各數字間的關係。
或者http://www.mathwarehouse.com/charts/box-and-whisker-plot-maker.php#boxwhiskergraph
另外,計算所得上述資料後,還有兩個東西順便知道一下。
變異數其實是看誤差,有點是在看離平均數有多遠。那應該還有個東西可以用來看散佈性,那就是四分位數。
中位數是把抽樣取得之樣本資料排序,然後取中間那個數據資料。四分位數,就是取得四分之一位置的數據資料。
又回到圖勝於文的問題了。
應該用什麼圖來呈現,這次抽樣所得資料的散佈情形呢?
我們會用Box-and-Whisker Plots。有人翻成盒鬚圖。
這個圖要用到5個資料分別為
依序說明:
最小值,第一四分位數,中位數,第三四分位數,最大值
再用之前的數據計算如下:
但是,Pages或EXCEL都沒有支援這個圖表,得用堆疊圖加誤差線的方式來呈現。有點麻煩,留著以後說明。
網路上倒有不少線上服務可以用。
http://easycalculation.com/statistics/box-plot-grapher.php
這張圖很清楚地描述各數字間的關係。
或者http://www.mathwarehouse.com/charts/box-and-whisker-plot-maker.php#boxwhiskergraph
另外,計算所得上述資料後,還有兩個東西順便知道一下。
- 全距(Sample Range):最大值減去最小值
- 四分位距(Interquartile Range) :第3四分位數減去第1四分位數
2013年6月21日 星期五
實驗設計-5
之前提到平均數是看集中性,又說他是重心。其實這樣子講是危險的。
這個公式應該不難理解,就是先計算平均數,然後個別數據資料減去平均數後再平方。每一個都這樣子做完之後,加總起來。之後,再除以n-1。
回想一下,平均數是除以n是吧。這兒為什麼要除以n-1呢?
我想,開始學統計的人,這是最無法理解之事。(喔~起碼我是)
這個n叫做自由度。
同一個數字,除以n 與除以n-1,所得結果何者為大,當然是n-1。
好,這個是來看散佈性,越小就是越集中,越大就是越分散。(有那種味道)
可是,我們只取得樣本資料不是嗎?這個數值越小,猜錯的機率不是越大嗎?
之前平均數,我們取了n個數字,這些數字真的是我們取得的。所以,除以n沒問題,有信心。
可是,樣本變異數,好像要減一個平均數,這可不是我們抽樣取得,他是計算結果,不是嗎?而且,他也只有樣本呀,並不能代表母數?你的信心度是不是應該要下降一點。也就是說,你的自由度(不是你操作的)不就應該少一個嗎?(這個就是平均數)所以,加總後所得除以n-1。後續,會看到n-2的,你應該可以聯想到,是在公式中會有兩個數字是經過計算所得,而不是原始的樣本資料。
其實,比較常用的是標準差,他的公式:
用試算表軟體,都有公式可以輕鬆算出來。
下圖C欄下方是用內建公式算的。至於D欄則是依據統計公式算的。
想想打靶吧。
有一個人,「集中性」很差,一張靶紙上到處都有彈孔,可是,就是有幾個剛好射中靶心。成績很高。
另一個人,「集中性」很高,彈孔都集中在某一個區塊,可是,一堆彈孔就是離靶心很遠。
這兩個人到底誰厲害呢?
若光看平均數,你選了第一個人,那要殺敵還得碰運氣。
若是第二人,也許該告訴他,若想打A這個地方,應該要瞄在B的位置。或者應該說,其實是準心歪了,或者槍根本沒經過校正。
問題很多,但是,打靶的目的,就是要我們發現問題,解決問題。
是的,取樣的過程,就是要去發現問題,解決問題。
射手就是所謂的製程。
射出彈孔就是取樣的過程。
彈孔的所在位置,就是收集的樣本資料。
靶心是理想平均數,實際上應該稱之為期望值。
計算彈孔的平均數(因為是平面,所以會有X與Y)
但是~~散佈情形呢?
其實,散佈的反義好像是集中。其實,這個是相對的意義。
也就是說,應該要有個方法來計算散佈情形,然後得到一個值,可以相互比較。
分散性
只要有取樣得到一系列數字,就可以算樣本平均數。
如果去計算每個數字與平均數之差,感覺上好像可透過距離來呈現他的散佈性。
可惜,樣本資料有些比平均數大,有些比平均數小,這樣子來回抵消掉,也看不出什麼特性。
當然可以取絕對值,不過,如果用平方的話,是不錯的選擇。
樣本值與平均數之差,不就是「誤差」嗎?把所有的誤差先平方,避免抵消效果。然後再全部加起來,似乎可用來代表這組樣本資料的散佈情況。計算所得之值如果越大,就表示他的散佈情況就很嚴重。越小,就表示越集中。
專業一點的說法,這個計算之值稱之為樣本變異數。
他的公式如下:
這個公式應該不難理解,就是先計算平均數,然後個別數據資料減去平均數後再平方。每一個都這樣子做完之後,加總起來。之後,再除以n-1。
回想一下,平均數是除以n是吧。這兒為什麼要除以n-1呢?
我想,開始學統計的人,這是最無法理解之事。(喔~起碼我是)
這個n叫做自由度。
同一個數字,除以n 與除以n-1,所得結果何者為大,當然是n-1。
好,這個是來看散佈性,越小就是越集中,越大就是越分散。(有那種味道)
可是,我們只取得樣本資料不是嗎?這個數值越小,猜錯的機率不是越大嗎?
之前平均數,我們取了n個數字,這些數字真的是我們取得的。所以,除以n沒問題,有信心。
可是,樣本變異數,好像要減一個平均數,這可不是我們抽樣取得,他是計算結果,不是嗎?而且,他也只有樣本呀,並不能代表母數?你的信心度是不是應該要下降一點。也就是說,你的自由度(不是你操作的)不就應該少一個嗎?(這個就是平均數)所以,加總後所得除以n-1。後續,會看到n-2的,你應該可以聯想到,是在公式中會有兩個數字是經過計算所得,而不是原始的樣本資料。
其實,比較常用的是標準差,他的公式:
用試算表軟體,都有公式可以輕鬆算出來。
下圖C欄下方是用內建公式算的。至於D欄則是依據統計公式算的。
實驗設計-4
之前我們試著用直方圖來看我們資料的特性。一般是期望看出資料是左偏還是右偏,也就是最高點聚集區塊的位置。其實這樣不太科學的樣子。應該要有數字化來支持。
透過數字化的方式,其實也是從直方圖的感覺所衍生的。也就是要看出圖中的兩個重點:
1. 集中性
2. 分散性
哈~這兩個好像是矛盾右互斥的東西。
但是,對一堆我們想要研究的資料,在我們還沒有理解他之前,當然要看看他的集中與分散個別有什麼意思。
集中性
最常用的就是平均數(Mean),這裡所提到的是指樣本平均數。假設收集了n個數據,分別是
這個數字具有「重心」的意義,也就是集中趨勢。
如果不考慮量測誤差,或者異常值,那應該每次取得的樣本值應該都是這個值。而且,我們也可以相信母體也應該是這個值。
但是,實際的情形可能不是我們所想像,有可能大部分的值其實都比理論平均值大一點,偏偏有一個值,就是筆理論平均值小很多,那平均下來,當然就會有偏差。
所以,有時候會想要去看看,如果我取樣n個並排序後,最中間那個值到底是什麼。如果他跟平均值一樣的話,那我們可以想像他的直方圖應該像是一個鐘形,中間高,兩邊低。
這個數字就叫做中位數。
可是我們抽樣的n,有可能是奇數,也有可能是偶數,最中間那個數就會不一樣了。
假設我們收集到下列11個數據:3,3,8,6,3,4,4,7,7,11,12
平均數的作法:
那中位數呢?
11個,所以是奇數,取最中間那個值就好,也就是第(11+1)/2=6個
先把原本的11個數據排序一下:
3,3,3,4,4,6,7,7,8,11,12
所以,第6個就是6。
跟平均數不一樣耶!!
是的,人生沒有樣樣都是完美的。
2013年6月20日 星期四
實驗設計-3
之前提到圖勝於文。最常用到的圖叫直方圖,他是用來看「頻率」的。
頻率的意思就有次數的概念。之前也提到所收集的數據往往是量測之結果,都會有誤差,就會有估計值。所以,重複做所得的數據也不一定都一樣。
所以,要有次數,每次數據都不一樣,這兩個合起來的意思就是要將資料數據進行「分組」。
緊接著的問題就是:
1. 要分幾組?
2. 每組的組距(每組數據的寬度)是多少?
分太細或分太粗都無法呈現數據的特性。
有時候,都需要經過幾次試驗後,看看圖形有無呈現出特殊的感覺。
2. 最大減最小再除以期望組數。
3. 前項所得之數,再取一個方便處理的數字。
4. 依據這個方便處理的數字,從最小值加上此數字,定義出組距上、下界。
用前一個樣本資料為例,總共有32個數據。排序後
最大104.6;最小96.9 相差7.7。
期望分成10組,所以7.7/10= 0.77,方便處理取0.8。
這個有幾點要注意:
1. 原始資料排序是使用「重新整理」。
2. 方便處理的數字是用公式:=ROUNDUP(E3/E4,1)
3. 次數的公式:(原始文字會造成Blogger出錯)
4. 其實Number並沒有直方圖。他只有長條圖。這邊是動了手腳。
4.1 設長條間距為0。這樣子各條又混再一塊了。
4.2 設陰影為個別。這樣子就會弄出各條的邊界。
4.3 其實X軸的數字位置是錯的。應該是在上下邊界處,而不是再中間。
5. 並不是所有的數據資料都得畫直方圖,也有可能是散佈圖。
6. 目前還沒有進化到,改變組數後仍可自動化。
頻率的意思就有次數的概念。之前也提到所收集的數據往往是量測之結果,都會有誤差,就會有估計值。所以,重複做所得的數據也不一定都一樣。
所以,要有次數,每次數據都不一樣,這兩個合起來的意思就是要將資料數據進行「分組」。
緊接著的問題就是:
1. 要分幾組?
2. 每組的組距(每組數據的寬度)是多少?
分太細或分太粗都無法呈現數據的特性。
有時候,都需要經過幾次試驗後,看看圖形有無呈現出特殊的感覺。
設計組距
1. 找出樣本資料中最大值與最小值。2. 最大減最小再除以期望組數。
3. 前項所得之數,再取一個方便處理的數字。
4. 依據這個方便處理的數字,從最小值加上此數字,定義出組距上、下界。
用前一個樣本資料為例,總共有32個數據。排序後
最大104.6;最小96.9 相差7.7。
期望分成10組,所以7.7/10= 0.77,方便處理取0.8。
繪製直方圖
我用Mac的Numbers做出之結果,如下圖。這個有幾點要注意:
1. 原始資料排序是使用「重新整理」。
2. 方便處理的數字是用公式:=ROUNDUP(E3/E4,1)
3. 次數的公式:(原始文字會造成Blogger出錯)
4. 其實Number並沒有直方圖。他只有長條圖。這邊是動了手腳。
4.1 設長條間距為0。這樣子各條又混再一塊了。
4.2 設陰影為個別。這樣子就會弄出各條的邊界。
4.3 其實X軸的數字位置是錯的。應該是在上下邊界處,而不是再中間。
5. 並不是所有的數據資料都得畫直方圖,也有可能是散佈圖。
6. 目前還沒有進化到,改變組數後仍可自動化。









