問卷收回來那一刻,檔案裡混著測試填答、重複送出與亂填的列。跳過清理直接算平均,數字會好看,結論會錯。這份清單照實際操作順序排列,一項一項打勾就能做完。
問卷資料清理依序檢查四類共十四項:先備份與建立紀錄,再排除無效填答,接著統一格式與編碼,最後處理缺漏值與離群值。順序不能倒,因為先改格式再刪列,會讓你無法回頭核對是刪了哪一筆。整套流程用免費試算表的篩選、排序與條件式格式就能完成。
資料清理,是在分析之前,找出並處理資料中錯誤、重複、不一致或不可用的部分。它不包含修改受訪者的答案讓結果更好看。這條界線要先講清楚。
第三項最常被省略。省略的代價會在簡報那天出現。聽的人問為什麼回收了三百多份,分析只用了兩百多份,沒有紀錄表就只能憑印象回答。
無效填答,指的是不代表真實受訪者意見的列。排除要有明文規則,而且規則要在看到結果之前就寫好。
第七與第八項只做標記。我們的做法是,兩個訊號同時出現才排除。只有一個訊號的列,另外看開放題。開放題寫得認真的人,量表題全選同意也可能是真心的。
編碼,是把文字答案轉成固定代號,方便計算。例如把非常同意到非常不同意轉成五到一。
第十一項的重點是不覆蓋原欄。受訪者在年資欄寫了十年以上,你要決定記成十還是另立一類。這是判斷,不是修正。判斷要留痕跡,原文要留著。
缺漏值,是受訪者沒有回答的題目。離群值,是明顯偏離其他人的數值。兩者都不該直接刪掉。
不要用平均值去填補缺漏。那樣做會讓資料看起來比實際整齊,變異被壓低,後面的比較都會失準。件數少的問卷尤其不該這樣補。
一份合格的清理紀錄,讀的人不用問任何人,就能從原始份數一路算到最後的有效份數。每一列寫一條規則與它影響的列數。排除的列數加總,加上保留的列數,要等於原始列數。
我們交付時會把這張表放在報告附錄的第一頁。有經驗的讀者會先翻這一頁。它說明了分析者有沒有在看到結果之後才決定刪誰。
第一個是在排序後忘了整列一起移動。只排一欄,其他欄不動,整份資料就錯位了。排序前要選取整個資料範圍,並靠列編號核對。
第二個是邊清理邊看結果。看到某一組的分數偏低,就回頭對那一組的填答特別嚴格。這會讓清理變成挑選。規則要先寫好,再一次套用到全部的列。
第三個是把清理與分析寫在同一個工作表。公式引用了會被刪除的列,刪完之後公式出錯卻沒有人發現。清理完成後,把結果另存成只有數值的新表,再開始分析。
這份清單適合幾十份到幾百份、以量表題與選擇題為主的問卷,由一兩個人用試算表處理。它不涵蓋抽樣是否有代表性的問題。清理做得再乾淨,如果發放對象本身就有偏差,結論還是只適用於那一群人。
問卷若蒐集了可辨識個人的資料,清理檔與原始檔的保存方式與期限,要依當地法規處理,並交由當地持牌專業人士確認。
一個做客戶滿意度調查的團隊,回收之後先做了編碼。把所有量表題轉成數字,把選項文字統一。然後才回頭刪重複填答。
問題出在重複填答的判斷。同一個人填了兩次,兩次的答案不完全相同。要保留哪一份,需要看哪一份填得完整。但編碼時,有人已經把空白的格子填成了零,方便計算。空白與零分不出來,完整度無從判斷。
最後只能回到原始檔重來。幸好原始檔有留。這個例子說明兩件事。清單上的順序是有理由的,無效填答要在改動任何內容之前處理。以及,空白永遠不要用零代替,要用一個不可能出現在答案裡的代碼,或是直接留空。
清單第十二項只處理了開放題裡的無效回答。有內容的開放題,還需要一輪整理,才能跟量表題放在一起看。
做法是在開放題右邊加一欄主題。先讀過全部回答,歸納出五到八個主題,再回頭逐列標記。一則回答談到兩件事,就複製成兩列,或是加第二個主題欄。主題的名稱與定義寫在紀錄表。
這一步最容易被跳過,因為它慢,而且無法用公式做。但會議上最常被引用的,往往是開放題裡的一句原話。量表分數告訴你哪裡低,開放題告訴你為什麼。只清理不整理,等於把最有用的那一欄放著不用。
第二項最花時間,也最有價值。它檢查的是規則寫得夠不夠清楚。如果同事重做的結果差了幾筆,通常是某一條規則有兩種讀法。把那一條改寫,再重做一次。
樣本原本就很少的時候,例如只回收了二十幾份,每排除一份都影響很大。這時寧可全部保留,改用逐份閱讀的方式分析,並在報告中說明這是質性的整理,不做百分比推論。
另一種情況是研究目的本身就是觀察不認真填答的比例,例如測試問卷長度是否太長。這時直線作答與過短時間都是要保留的資料,不能當雜訊清掉。清理規則永遠跟著研究問題走,沒有一套通用的刪除標準。