顧問手記

顧問用 AI 整理資料出了錯:一次摘要失真的錯誤檢討與五條查核規則

交付前一晚做最後查核,我對著原始文件讀到第三頁,發現報告裡的一句關鍵事實跟原文意思相反。那句話是我從一份 AI 摘要抄過來的。這篇是那個晚上之後寫的檢討

顧問用 AI 整理資料出錯,問題通常出在哪一個環節

問題通常出在把摘要當成來源直接引用,跳過回到原文核對的那一步。工具寫出的摘要讀起來通順又肯定,容易讓人忘記它只是一份轉述。修正方法是把摘要定位成導覽,所有寫進報告的事實都要回原文逐句核對。

摘要失真,指的是摘要的文字與原始文件的意思不一致,可能是遺漏條件、改變時態、混淆主體,或加入原文沒有的內容。它跟打錯字不同,失真的句子通常文法正確、語氣自然。

下面是一次去識別化的錯誤檢討。錯誤在交付前被我自己抓到,沒有造成客戶損失。但它離交付只差十二個小時,我認為值得完整寫下來。

事情的經過:一份競業情報書裡的一句錯誤事實

委託方是一家做商用洗滌設備的公司,想了解一家主要對手的租賃方案動向。公開資料裡有一份對手發佈的年度營運說明,原文是外語,篇幅超過六十頁。

我的時間不夠逐頁細讀。我請 AI 工具把文件摘要成中文重點,再依主題分類。摘要回來,其中一條寫著:該公司已在兩個新市場推出設備租賃方案。

這句話正好支持我當時的判斷方向。我把它寫進報告的事實欄,來源標註為那份營運說明,並在此基礎上推論對手的租賃業務正在擴張,建議客戶提前準備應對方案。

交付前一晚,我照例做來源查核,隨機抽十條事實回原文比對。抽到這一條。原文的句子大意是:如果試行市場的回收狀況達到內部標準,公司將評估在另外兩個市場推出租賃方案。

條件句變成了肯定句,評估變成了已推出。原文講的是一件還沒發生、而且有前提的事。我的推論建立在一件不存在的事實上。

錯誤檢討:這個錯是在哪幾個環節累積出來的

我把那天的工作紀錄攤開,找出四個環節。每一個單獨看都不嚴重,疊在一起就出事了。

  1. 時間壓力下,我把閱讀原文的工作整個交給摘要,自己一頁都沒讀
  2. 摘要的句子符合我已有的假設,我沒有產生懷疑,反而覺得被印證
  3. 我在來源欄填了原始文件的名稱,但實際讀的是摘要,來源標註與事實不符
  4. 查核採用隨機抽樣,這一條能被抽中有運氣成分,關鍵事實沒有被列為必查

第二個環節最值得警惕。摘要如果寫出一句與我的假設相反的話,我一定會去翻原文確認。它說了我想聽的,我就照單全收。確認偏誤在使用工具時並沒有消失,工具的流暢語氣還替它加了分。

第三個環節是誠信問題。來源欄的意思是我讀過這份文件並確認這句話。我填了文件名,實際上沒有讀。這跟引用一篇只看過標題的報導是同一類錯誤。

第四個環節讓我重新設計查核方式。抽查十條、抽中問題,聽起來像制度有效。換個角度看,如果沒抽中,這句話就交出去了。支撐主要結論的事實不該靠抽樣。

修正過程:發現錯誤之後的十二個小時做了什麼

當晚我先做了一件事:把整份報告裡所有來自那份摘要的事實標成黃色,一共十四條。然後打開原文,逐條找對應段落。

十四條裡,十條與原文一致。兩條的數字單位被換算過,結果正確但需要補註。一條就是上面那句。還有一條在原文裡找不到對應段落,我至今不知道它從哪裡來,直接刪除。

事實改了,推論跟著重寫。原本的判斷是對手正在擴張租賃業務,改為:對手已公開表示考慮擴張,成立與否取決於試行市場的結果。建議也從提前準備應對方案,改成設定兩個觀察訊號,訊號出現再啟動準備。

隔天我照時交付,並在方法說明裡加了一段:部分外語文件使用 AI 工具輔助初步閱讀,所有引用事實均經人工回原文核對。我沒有向客戶敘述前一晚的驚險,但我把流程寫清楚了。

之後訂下的五條 AI 整理資料查核規則

那次之後,我把使用工具的方式寫成五條規則,貼在工作筆記的第一頁。

  1. 摘要只當導覽:摘要的用途是告訴我該讀原文的哪幾頁,摘要裡的句子不直接進報告
  2. 事實必回原文:每一條要引用的事實,都要在原文找到對應句子,並記下頁碼或段落位置
  3. 四元素比對:核對時逐一看主詞、時態、條件、數字,四個都一致才算通過
  4. 關鍵事實全查:支撐主要結論的事實不抽樣,全部核對,其餘事實才抽查
  5. 找不到就刪:原文裡找不到對應段落的內容直接刪除,不改寫、不保留、不找替代說法

第三條的四元素來自這次錯誤與之後幾次核對的觀察。主詞錯,是把子公司的事算到母公司頭上。時態錯,是把計畫當成已完成。條件錯,是漏掉如果、預計、視情況。數字錯,是單位、幣別或期間被換過。

第二條增加了工作時間。記頁碼很瑣碎,但它讓交付後的回頭檢查變得可行。客戶問這句話出自哪裡,我能在一分鐘內指出位置。

哪些工作可以交給 AI 工具,哪些不能

檢討之後我沒有停用工具。它在某些工作上確實省時間,重點是分清楚界線。

  • 可以交給工具:長文件的初步導覽、依主題粗分類、列出文件中提到的名詞清單、把我寫好的段落檢查錯字
  • 需要人工覆核:外語文件的翻譯、表格數字的擷取、跨文件的資訊比對
  • 不交給工具:判斷哪個事實重要、決定結論、撰寫建議、確認來源真偽

另一條界線是資料的性質。客戶提供的內部資料,我不貼進無法確認資料處理方式的線上工具。這次用工具處理的是對手公開發佈的文件,不涉及客戶機密。兩者的處理方式不能混為一談。

有客戶在會議上問過:你們用 AI,那我為什麼不自己問就好?我的回答是,可以自己問,拿到的會是一份通順的摘要。顧問的工作在摘要之後才開始:核對它、判斷哪一句重要、決定該怎麼做,並且為這個判斷負責。

這次錯誤如果沒有被抓到,後果會是什麼

檢討時我做了一個不舒服的推演:假設那天晚上沒有抽中那一條,報告照原樣交付,接下來會發生什麼。

客戶會讀到一個明確的判斷,對手已經在兩個新市場推出租賃方案。依照我的建議,他們會開始準備應對,可能調整自家租賃方案的條件,可能提前與通路商談判。這些動作都有成本,而它們回應的是一件還沒發生的事。

更麻煩的是後續。客戶的業務人員在市場上找不到對手推出方案的跡象,會回頭問我依據。我打開原文,才發現自己錯了。到那一步,損失的不只是這一條事實的可信度,整份報告其他的十幾條事實,客戶都有理由重新懷疑。

這個推演讓我確定一件事。工具造成的錯誤與人工造成的錯誤,在客戶眼中沒有差別。報告上簽的是我的名字,客戶不會接受「那是摘要工具讀錯的」這種解釋,也不應該接受。

所以我在工作紀錄裡把這次事件歸類為自己的查核疏失,原因欄寫的是「引用未讀原文」,不寫工具的名稱。歸因寫對了,之後的改進才會落在自己能控制的地方。

這套查核規則的限制與不適用的情況

原始文件本身有錯時,回原文核對也沒有用。對手的公開說明可能刻意樂觀,可能用詞含糊。核對只能保證我忠實轉述了原文,不能保證原文為真。這需要另外用多個獨立來源交叉比對。

文件量極大、無法逐條回查的研究,例如數千則評論的整理,五條規則的成本會高到做不下去。那類工作需要改用抽樣設計,並在報告裡明白揭露抽樣方式與誤差可能。

工具的能力與行為一直在變,這份檢討描述的是我遇到的一種錯誤型態,不代表所有工具或所有情況。規則的核心只有一句,不會隨工具改變:我簽名交出去的事實,要是我自己確認過的。

← 回到新知列表