數據與工具

問卷回收後先別急著算平均:十四項問卷資料清理檢查清單

問卷收回來那一刻,檔案裡混著測試填答、重複送出與亂填的列。跳過清理直接算平均,數字會好看,結論會錯。這份清單照實際操作順序排列,一項一項打勾就能做完。

問卷資料清理應該檢查哪些項目,順序是什麼?

問卷資料清理依序檢查四類共十四項:先備份與建立紀錄,再排除無效填答,接著統一格式與編碼,最後處理缺漏值與離群值。順序不能倒,因為先改格式再刪列,會讓你無法回頭核對是刪了哪一筆。整套流程用免費試算表的篩選、排序與條件式格式就能完成。

資料清理,是在分析之前,找出並處理資料中錯誤、重複、不一致或不可用的部分。它不包含修改受訪者的答案讓結果更好看。這條界線要先講清楚。

第一類:動手之前先做的三項準備

  • 第一項,把平台匯出的原始檔另存,檔名加上原始與匯出日期,設成唯讀。之後不再打開它修改
  • 第二項,在工作檔最左邊加一欄列編號,從一開始往下編。排序之後仍能回到原本順序,也能在紀錄表裡指明是哪一列
  • 第三項,新開一個工作表叫清理紀錄,欄位有日期、檢查項目、規則、影響列數、處理方式、處理人

第三項最常被省略。省略的代價會在簡報那天出現。聽的人問為什麼回收了三百多份,分析只用了兩百多份,沒有紀錄表就只能憑印象回答。

第二類:排除無效填答的五項檢查

無效填答,指的是不代表真實受訪者意見的列。排除要有明文規則,而且規則要在看到結果之前就寫好。

  • 第四項,測試填答。上線前團隊自己填的列,依送出時間早於正式發放時間來辨認,全部排除
  • 第五項,重複送出。依信箱、電話或其他識別欄位排序後比對。同一人多份時,保留填答最完整的一份,若完整度相同就保留最早的一份
  • 第六項,資格不符。問卷開頭的篩選題若顯示不屬於目標對象,排除
  • 第七項,填答時間過短。先用幾位同事實際計時,取得認真填完的合理最短時間,低於這個門檻的列先標記,不立刻刪
  • 第八項,直線作答。量表題整排選同一個選項。用一欄計算該列量表題的最大值與最小值是否相等,相等就標記

第七與第八項只做標記。我們的做法是,兩個訊號同時出現才排除。只有一個訊號的列,另外看開放題。開放題寫得認真的人,量表題全選同意也可能是真心的。

第三類:統一格式與編碼的四項檢查

編碼,是把文字答案轉成固定代號,方便計算。例如把非常同意到非常不同意轉成五到一。

  • 第九項,選項文字一致。同一個選項在不同題目或不同語言版本裡寫法不同,要統一。用篩選功能看每一欄有哪些不重複的值,多出來的就是不一致
  • 第十項,量表方向。反向題要轉回同一個方向。哪幾題是反向題,要在紀錄表寫明,避免之後有人再轉一次
  • 第十一項,數字欄的格式。年資、人數、金額這類欄位,常混入單位文字或全形數字。先另開一欄做清理後的值,保留原欄不動
  • 第十二項,開放題的雜訊。把無、沒有、不知道、單一符號這類回答統一成一個代碼,與真正空白區分開

第十一項的重點是不覆蓋原欄。受訪者在年資欄寫了十年以上,你要決定記成十還是另立一類。這是判斷,不是修正。判斷要留痕跡,原文要留著。

第四類:處理缺漏值與離群值的兩項檢查

缺漏值,是受訪者沒有回答的題目。離群值,是明顯偏離其他人的數值。兩者都不該直接刪掉。

  • 第十三項,缺漏值。先定義哪幾題是關鍵題。關鍵題缺漏才排除整份。其他題缺漏就保留,並在每一題的分析結果旁邊寫明有效樣本數
  • 第十四項,離群值。對數字欄排序,看最大與最小的幾筆。先判斷是輸入錯誤還是真實情況。輸入錯誤,例如年資填了一個不可能的數字,標記為無效。真實情況就保留,並考慮用中位數來描述

不要用平均值去填補缺漏。那樣做會讓資料看起來比實際整齊,變異被壓低,後面的比較都會失準。件數少的問卷尤其不該這樣補。

清理紀錄表填完之後應該長什麼樣子

一份合格的清理紀錄,讀的人不用問任何人,就能從原始份數一路算到最後的有效份數。每一列寫一條規則與它影響的列數。排除的列數加總,加上保留的列數,要等於原始列數。

我們交付時會把這張表放在報告附錄的第一頁。有經驗的讀者會先翻這一頁。它說明了分析者有沒有在看到結果之後才決定刪誰。

最容易出錯的三個地方

第一個是在排序後忘了整列一起移動。只排一欄,其他欄不動,整份資料就錯位了。排序前要選取整個資料範圍,並靠列編號核對。

第二個是邊清理邊看結果。看到某一組的分數偏低,就回頭對那一組的填答特別嚴格。這會讓清理變成挑選。規則要先寫好,再一次套用到全部的列。

第三個是把清理與分析寫在同一個工作表。公式引用了會被刪除的列,刪完之後公式出錯卻沒有人發現。清理完成後,把結果另存成只有數值的新表,再開始分析。

這份問卷清理清單的適用範圍與限制

這份清單適合幾十份到幾百份、以量表題與選擇題為主的問卷,由一兩個人用試算表處理。它不涵蓋抽樣是否有代表性的問題。清理做得再乾淨,如果發放對象本身就有偏差,結論還是只適用於那一群人。

問卷若蒐集了可辨識個人的資料,清理檔與原始檔的保存方式與期限,要依當地法規處理,並交由當地持牌專業人士確認。

一個去識別化的示例:清理順序做反之後發生的事

一個做客戶滿意度調查的團隊,回收之後先做了編碼。把所有量表題轉成數字,把選項文字統一。然後才回頭刪重複填答。

問題出在重複填答的判斷。同一個人填了兩次,兩次的答案不完全相同。要保留哪一份,需要看哪一份填得完整。但編碼時,有人已經把空白的格子填成了零,方便計算。空白與零分不出來,完整度無從判斷。

最後只能回到原始檔重來。幸好原始檔有留。這個例子說明兩件事。清單上的順序是有理由的,無效填答要在改動任何內容之前處理。以及,空白永遠不要用零代替,要用一個不可能出現在答案裡的代碼,或是直接留空。

開放題要另外花時間,不能只清雜訊

清單第十二項只處理了開放題裡的無效回答。有內容的開放題,還需要一輪整理,才能跟量表題放在一起看。

做法是在開放題右邊加一欄主題。先讀過全部回答,歸納出五到八個主題,再回頭逐列標記。一則回答談到兩件事,就複製成兩列,或是加第二個主題欄。主題的名稱與定義寫在紀錄表。

這一步最容易被跳過,因為它慢,而且無法用公式做。但會議上最常被引用的,往往是開放題裡的一句原話。量表分數告訴你哪裡低,開放題告訴你為什麼。只清理不整理,等於把最有用的那一欄放著不用。

交付前的三項驗收

  • 加總驗收:紀錄表上各規則排除的列數,加上最終有效列數,等於原始列數
  • 重現驗收:請另一位同事只看紀錄表,從原始檔重做一次,得到相同的有效列數
  • 抽樣驗收:從被排除的列裡隨機抽五筆,逐筆確認排除理由站得住腳

第二項最花時間,也最有價值。它檢查的是規則寫得夠不夠清楚。如果同事重做的結果差了幾筆,通常是某一條規則有兩種讀法。把那一條改寫,再重做一次。

什麼情況下不該照這份清單刪資料

樣本原本就很少的時候,例如只回收了二十幾份,每排除一份都影響很大。這時寧可全部保留,改用逐份閱讀的方式分析,並在報告中說明這是質性的整理,不做百分比推論。

另一種情況是研究目的本身就是觀察不認真填答的比例,例如測試問卷長度是否太長。這時直線作答與過短時間都是要保留的資料,不能當雜訊清掉。清理規則永遠跟著研究問題走,沒有一套通用的刪除標準。

← 回到新知列表