2013年6月19日 星期三

實驗設計-2

2. 資料摘要

話說,我們對於所關心的問題,透過資料處理來獲得解答。

在開始資料處理之前,我們得先了解我們可以有什麼樣的方法與角度來看資料。
之前,有提到母體與樣本是不一樣的。我們一般是用樣本去推估母體。因為是推估,就會有誤差。其實,玩到最後,根本就是在處理誤差。

好,要得誤差之前,還是得先學會到底資料長什麼樣子,再來說如何整理資料。

假設你是一家生產矽力康的公司。在出品前,不是應該要告訴人家說一瓶到底能夠塗滿多少面積。理論上,若不考慮塗佈者的技術問題,相同的容量當然可以塗佈相同的面積。問題是在裝填的過程中,往往就會出現差異了。
好,先不管到底出現差異的來源是什麼,假設我們拿了32瓶包裝好的產品去做實驗,結果我們就會得到32組數據。
補充說明:就物理而言,單位很重要。就數學而言,就不是那麼重要。

資料來源:Introductory Statistics for Engineering Experimentation, Elsevier.

  101.8   100.5   100.8   102.8   103.8   102.5   102.3    96.9
  100.0     99.2   100.0   101.5     98.5   101.5   100.0    98.5
  100.0     96.9   100.7   101.6   101.3     98.7   101.0   101.2
  102.3   103.1   100.5   101.2   101.7   103.1   101.5   104.6

取得這個32瓶產品,就是一個取樣的過程。想要驗證你的製程能力,或者去看作業員的工作品質,都會影響你取樣方式。但是,「隨機取樣」的概念一定跑不掉的。

面對這些經由實驗後所得到的數據就是這樣子。因為是量測資料,所以,最後一位是估計值。(但在這邊不是重點)
接著我麼要想,怎麼來看待這些資料。
找平均值?也許吧。
每一瓶的塗佈能力的理論值,應該就是平均值吧。可是,我想看看目前生產機器是否有問題,生產出來的是偏低還是偏高呢?
或者,你根本沒有理論值,反而是要去看看他最容易生產出什麼數據。
可以有好多好多種應用需求,是吧!

可是,我們都知道,圖勝於文吧,更何況是一堆長了差不多的數字。所以,把資料畫個圖來呈現應該是不錯的想法。
那~應該要畫什麼圖呢?又是一個大問題了。
一般我們畫圖,就得定義出橫軸 (X) 與縱軸(Y)代表什麼意思。一般橫軸最常用的就是時間。
但是,就本案例來說,當初並沒有收集到時間,那個數字的順序並不能代表時間。況且,我們想知道的是到底製程是否正常。他發生異常應該也是隨機的。如果跟時間有關?哇~那就得看看,是不是作業員的關係。這也是我們在研究問題時,常常搞錯對象。

那該怎麼處理呢?
我想知道的應該是出現這個資料的頻率吧。頻率的意思是說某某東西出現幾次。回到原始數據,好像一樣的不多,把每個原始數據都當做一個分組的話,那就沒有意義了。所以,我們就得試著為這些資料好好地來「分組」。原始數據落在哪一分組,那該組次數就加1了。
接著再根據整理後的資料,X軸是你分組的組距,Y軸是該組距下的次數。那~這樣的圖叫做「直方圖」。
(留著下回,每次以不超過一頁面為原則)

在Blogger中寫方程式

最近想要來把學習實驗設計的過程記錄下來。馬上就面臨一個問題「如何在Blogger中寫方程式」
雖然許多文書處理軟體有支援方程式編輯器,如MS Word。但只能以圖檔方式處理感到不滿。尤其自己常常會打錯字需要事後修改,那就會很不方便。
Google的Doc也可以,但是,他是支援Latex。 以前可以取得LateX的式子,現在好像不行了。

LateX好像是不錯的選擇,只是要學習他的語法,而且要讓網頁懂得轉換。


首先我找到個網站:http://www.codecogs.com/latex/integration/blogger/install.php
線上編輯器:http://www.codecogs.com/latex/eqneditor.php

他教我們如何使用的Blogger看得懂LateX。照著他的步驟做應該沒有太大的困難。
但問題是LateX的語法有點困難。應該得像MS Word或Google Doc這樣的編輯器畫面比較好。
嗯,應該要找方便的編輯器,又能匯出LateX語法者。
網路上也有幫Word轉換的工具http://www.wordtolatex.com/
而我是用Mac,還是得想想別的辦法。
目前找到的是這個:http://pierre.chachatelier.fr/latexit/latexit-home.php?lang=en
不過,安裝這個之前得先裝這個:http://www.tug.org/mactex/ 但這個檔案很大2.3G,似乎又不是好方法。

不過暫時先用著吧。

實驗設計 - 1

1. 簡介

資料(Data)充斥在我們生活周遭,但能善加利用者希矣。因為資料得經過處理(Process)後,才有可能轉變成資訊(Information)。迨蒐集完充分資訊後,才有助於完成一個決策(Decision)。

資料要如何收集,哪些需要收集,什麼才是有用的資料。這部份得從專業知識與經驗、要解決問題與未來需求等角度切入後,才能得到答案。這部份又是一個有趣的議題。

但這系列我想學習的是,資料的處理與應用。

在開始之前,有些專有名詞得先定義清楚。

population: 母體。也就是你所關心的問題與或你要解決問題對象中所有可能的資料對象。他可能是有限的,也有可能是無限的。他有可能可以逐一訪視,但也有可能耗盡一生也無法訪視全部。

sample: 樣本。由於,時間與成本的因素,你可能無法完整收集母體資料。所以,只能從母體中取得部份的資料,這些資料叫做樣本。

random sampling:隨機抽樣。為了要保證取得部份資料即可代表母體,那這個收集樣本資料的過程就變得很重要。透過隨機抽樣的過程,可讓樣本資料能充分代表母體。如果抽樣過程有偏差,那從樣本資料要來描述母體的特性時,就會出現問題。

variability:變數。這是用來代表我們所關心母體,用來衡量母體某個特性的代表。他是一個量測值,因為,可能是從許多的抽樣出來的樣本資料所衡量之結果。因此,他就有可能帶有誤差。畢竟他不是真的母體。

experimental design:實驗設計。為了讓樣本資料衡量後的結果能夠非常接近母體,也就是誤差得要最小。那整個收集樣本資料的過程與計算方式就得審慎規劃。這個過程就叫實驗設計。

replication:重現。因為是用樣本資料來推估母體特性,那就會產生誤差。然而,誤差來源或造成錯誤因素有很多。為了讓非樣本資料誤差的因素降到最低,最好的方法就是同樣的實驗方式(收集資料的方式)多做幾次。反過來說,如果每次重現的結果都非常一致時,那就表示這個所設計的實驗方法非常的精確。

2013年6月17日 星期一

安裝Xcode Command Line Tools

最近需要安裝cocoapods,指令很簡單:
$ sudo gem install cocoapods

但卻不成功。原來是沒裝Xcode Command Line Tools。
安裝這個要從Xcode下。

點選[Xcode/Preference]會開啟新視窗。
點選[Downloads]/[Components]索引頁,就可以看到下載的選項了。

這個安裝完成後,再來打安裝指令就順利完成。

2013年6月16日 星期日

Sudoku - 案例

講了一些Sudoku的目視法,尤其是所謂的二階、三階的應用。說實在,有時真的是可遇不可求。
剛好有範例,就展示一下。
上圖中,中中大方格,他交錯限制來源中,6只有兩個,而他的覆蓋點只有一個。所以,並不能取得唯一解。此時,千萬別放棄。他就是一個三階的應用。

1與2,就是一般限制式。可是,很幸運的是,交錯來源的交錯來源,可以讓已知變成第2層級。也就是3可以變成4。
但是這個結果,對於中中大方格並沒有幫助。可是,經由他在加上另一個左下大方格的交錯來源,使得已知層級又到第二,也就是5的地方。如此在加上原本的1與2就可以得到中中大方格的右上小方格就是6了。

同一個題目,右中大方格的右上小方格應該是什麼呢?

看下圖吧。

解了這個,其他的9就全解了。

2013年6月15日 星期六

Sudoku - 4

上一回有點算是補充加強說明。今天得把「目視法」做個了結。

其實,我們想盡辦法就是要讓限制條件達到兩橫兩縱,這樣子就可以取得唯一解。只可惜,天不從人願。往往交錯條件來源,也是個未知數。

但是,「未知」也有兩個層級。
1. 我知道她在哪個小方格。
2. 我知道她應該在哪一橫(縱)。

第1個層級當然是我們最終目標;第二層級卻可以讓我變成別人的限制條件。
現在的問題時,交錯來源就是不知道呀,所以才無法進階到第1層級呀。
別忘了,每個交錯來源也有交錯來源。而他的交錯來源,可以不需要讓他實踐第1層級,只要能實踐到第2層級,就可以讓他變成一個限制式,那覆蓋點的要求就可以降低了。也就是說,由交錯來源的交錯來源取得唯一解,這個就是轉折,就是我說的「階」。
下圖不屬於二階,但需用他來說明。對中間這個大方格而言,上中、下中、左中、右中就是他的交錯來源。其中右中同數字(此範例為5)尚不知,不過,根據基本條件,他一定會是在下橫,這樣子自然是一個限制式。因為是基本條件,還算是一階的部份。而且,實際情況,常常不是這麼剛好的啦。

現在,右中大方格的交錯來源變成了,右上、右下、左中、中中。注意,中中才是我們要去解決的問題,中間的紅5是答案,不是已知。
我們再來看下圖。注意,他與上圖示不同。
原本光看右中,若他的負責範圍並沒有覆蓋,而且也不知道同數字應該在哪裡,但是,經由他的交錯來源,可以限制他,雖然無法達到第1層級的正確答案,但是我知道,同數字應該一定會在下橫中。進而形成了限制式,也決定了中中這個大方格中的中中小方格的數字,在本例中為5。
這種特性者,稱之為二階限制式。
其實,這樣子的變形相當多。因為,每一個大方格都會有四個交錯來源。所以,二階也會有四個交錯來源。
哈~不想多寫了,如果有跟上,應該就知道什麼是三階了吧。
同一個情境,但是左中的5並不清楚,但是藉由他的交錯來源,可以定義出他不需是上橫,進而決定右中必須在下橫,那中中的大方格中的中中小方格就必須是多少了。

 留一個伏筆。原則上,大部分的入門、普通困難的用這個方法「眼睛」瞄一瞄應該就會有解。很快的補完後,接著就會用基本限制式把缺的補起來(因為,當已知數字很多時,用這方法不容易抓出縱橫的關係)

 也許我們就來試一下吧。仍然採用第一次抓取的題目。




中中大方格 看到他交錯來源1的話有四個,那他的右上那個就是1了。這個沒什麼技巧,眼睛掃描一下即可。
左下大方格中,其實也是交錯來源都有1。只是說,他已經有兩個很好的覆蓋點,兩縱也決定右下小方格為1。

來看2吧。



右中大方格很幸運一橫一縱,再加上三個覆蓋點,當可以確定小格子中右中一定是2。
左下大方格也是可以一眼看穿。
至於中中大方格,只有右中與左中,需要兩個覆蓋點,可惜,目前只知道一個右上那個1的已知點。看起來無法找出無一解。
但是,注意,他的上中交錯來源,卻因為他的右上大方格的關係,讓我確信上中的大方格,其2一定是在中縱,進而對中中這個大方格多了一個限制式,那就可以篤定的說,左上那個小格就會是2了。
再補一個例子。注意看左下這個大方格,是不是只剩一個未知呢?不是可以大方的填入3。

接著他又可以造成左上大方格中的右下小方格,取得唯一解3。然後,又可以造成右上大方格中的右上小方格為一解為3。接著又可以決定右下大方格中的左上小方格又是唯一解3。

就是這樣子,瞄過來,瞄過去,再配合原始限制條件,很快地就可以把數字一一填上去。
 順序:綠色─〉藍色─〉黃色─〉橘色。這樣3又完成了。

4的部份則有兩個仍無法確定。顏色順序同前。
6的部份,顏色順序同前。
這個完成後,右中與下中的大方格中,右回到基本限制式。


然後,引發後續幾個回到基本限制式。
接著7也可以處理完。
有回到基本限制式。
如此循環,很快地就可以把所有數字填入。
後續就省略了吧。

當然,對於進階、專家級的題目光靠這個有時可能不足。但,大原則是不變的。




2013年6月8日 星期六

Sudoku - 3

有了一階限制式的基礎之後,我們再來更進階的應用。
上回有提到邊際效益的問題今天再來把這多說明一點。

所謂的邊際效益,就是限制式與覆蓋點的關係。
就是說一個限制條件(某數字已知在某橫軸或縱軸上,就是一個限制條件)到底能夠為另一個大方格覆蓋多少小方格。
回想之前,要決定每一個大方格中的小方格,如果有四個限制式的話(橫軸,縱軸各二),那一定可以確認其唯一值。
回到最基本的遊戲規則,要決定大方格中的某一小方格,那就表示其他的8個方格必須已知(覆蓋,對這個方法而言,我不需要知道他是什麼,只需要知道他有沒有被覆蓋)。反過來說,要決定一個大方格中的小方格,就會有8個未知。如果這8個未知都有人覆蓋,那又回到基本條件。有點繞口令。只是想表達,限制式與覆蓋能夠搭配好,就能得到唯一值。

 下圖中,少了一個限制式,但是剛好他「負責範圍」有人幫忙覆蓋的話,那表示這個限制式的意義還是有的。
 這個「負責範圍」,會有邊際效益的問題。看圖可以知道,大方格中的四個角落的小方格,基本上可以被橫或縱給限制住。同時有縱與橫,那就太浪費了。
所以,同時是兩個橫,或同時是兩個縱那是最理想的事情了。
同為縱
一橫一縱
所以,當我們用「眼力」來找的時候,他的順序性應該是
1. 最理想狀態,當然是兩橫兩縱。0個負責範圍覆蓋點。
2. 兩橫(縱)一縱(橫),外加1個負責範圍覆蓋點。
3. 兩橫(縱),外加兩個負責範圍覆蓋點。
4. 一橫一縱,外加三個負責範圍覆蓋點。
5. 一橫(縱),外加五個負責範圍覆蓋點。
6. 縱橫都沒有,外加八個負責範圍覆蓋點。

等等,要求的覆蓋點增加太快了吧,是的,這就是他的數學特性。
(其實,誰說Sudoku一定得9X9呢)

反過來說,接著要努力的就是如何降低覆蓋點的要求。
如何能夠增加限制式(多知一個橫,或多知一個縱),既使我不知道他正確的答案是什麼。