交付前一晚做最後查核,我對著原始文件讀到第三頁,發現報告裡的一句關鍵事實跟原文意思相反。那句話是我從一份 AI 摘要抄過來的。這篇是那個晚上之後寫的檢討
問題通常出在把摘要當成來源直接引用,跳過回到原文核對的那一步。工具寫出的摘要讀起來通順又肯定,容易讓人忘記它只是一份轉述。修正方法是把摘要定位成導覽,所有寫進報告的事實都要回原文逐句核對。
摘要失真,指的是摘要的文字與原始文件的意思不一致,可能是遺漏條件、改變時態、混淆主體,或加入原文沒有的內容。它跟打錯字不同,失真的句子通常文法正確、語氣自然。
下面是一次去識別化的錯誤檢討。錯誤在交付前被我自己抓到,沒有造成客戶損失。但它離交付只差十二個小時,我認為值得完整寫下來。
委託方是一家做商用洗滌設備的公司,想了解一家主要對手的租賃方案動向。公開資料裡有一份對手發佈的年度營運說明,原文是外語,篇幅超過六十頁。
我的時間不夠逐頁細讀。我請 AI 工具把文件摘要成中文重點,再依主題分類。摘要回來,其中一條寫著:該公司已在兩個新市場推出設備租賃方案。
這句話正好支持我當時的判斷方向。我把它寫進報告的事實欄,來源標註為那份營運說明,並在此基礎上推論對手的租賃業務正在擴張,建議客戶提前準備應對方案。
交付前一晚,我照例做來源查核,隨機抽十條事實回原文比對。抽到這一條。原文的句子大意是:如果試行市場的回收狀況達到內部標準,公司將評估在另外兩個市場推出租賃方案。
條件句變成了肯定句,評估變成了已推出。原文講的是一件還沒發生、而且有前提的事。我的推論建立在一件不存在的事實上。
我把那天的工作紀錄攤開,找出四個環節。每一個單獨看都不嚴重,疊在一起就出事了。
第二個環節最值得警惕。摘要如果寫出一句與我的假設相反的話,我一定會去翻原文確認。它說了我想聽的,我就照單全收。確認偏誤在使用工具時並沒有消失,工具的流暢語氣還替它加了分。
第三個環節是誠信問題。來源欄的意思是我讀過這份文件並確認這句話。我填了文件名,實際上沒有讀。這跟引用一篇只看過標題的報導是同一類錯誤。
第四個環節讓我重新設計查核方式。抽查十條、抽中問題,聽起來像制度有效。換個角度看,如果沒抽中,這句話就交出去了。支撐主要結論的事實不該靠抽樣。
當晚我先做了一件事:把整份報告裡所有來自那份摘要的事實標成黃色,一共十四條。然後打開原文,逐條找對應段落。
十四條裡,十條與原文一致。兩條的數字單位被換算過,結果正確但需要補註。一條就是上面那句。還有一條在原文裡找不到對應段落,我至今不知道它從哪裡來,直接刪除。
事實改了,推論跟著重寫。原本的判斷是對手正在擴張租賃業務,改為:對手已公開表示考慮擴張,成立與否取決於試行市場的結果。建議也從提前準備應對方案,改成設定兩個觀察訊號,訊號出現再啟動準備。
隔天我照時交付,並在方法說明裡加了一段:部分外語文件使用 AI 工具輔助初步閱讀,所有引用事實均經人工回原文核對。我沒有向客戶敘述前一晚的驚險,但我把流程寫清楚了。
那次之後,我把使用工具的方式寫成五條規則,貼在工作筆記的第一頁。
第三條的四元素來自這次錯誤與之後幾次核對的觀察。主詞錯,是把子公司的事算到母公司頭上。時態錯,是把計畫當成已完成。條件錯,是漏掉如果、預計、視情況。數字錯,是單位、幣別或期間被換過。
第二條增加了工作時間。記頁碼很瑣碎,但它讓交付後的回頭檢查變得可行。客戶問這句話出自哪裡,我能在一分鐘內指出位置。
檢討之後我沒有停用工具。它在某些工作上確實省時間,重點是分清楚界線。
另一條界線是資料的性質。客戶提供的內部資料,我不貼進無法確認資料處理方式的線上工具。這次用工具處理的是對手公開發佈的文件,不涉及客戶機密。兩者的處理方式不能混為一談。
有客戶在會議上問過:你們用 AI,那我為什麼不自己問就好?我的回答是,可以自己問,拿到的會是一份通順的摘要。顧問的工作在摘要之後才開始:核對它、判斷哪一句重要、決定該怎麼做,並且為這個判斷負責。
檢討時我做了一個不舒服的推演:假設那天晚上沒有抽中那一條,報告照原樣交付,接下來會發生什麼。
客戶會讀到一個明確的判斷,對手已經在兩個新市場推出租賃方案。依照我的建議,他們會開始準備應對,可能調整自家租賃方案的條件,可能提前與通路商談判。這些動作都有成本,而它們回應的是一件還沒發生的事。
更麻煩的是後續。客戶的業務人員在市場上找不到對手推出方案的跡象,會回頭問我依據。我打開原文,才發現自己錯了。到那一步,損失的不只是這一條事實的可信度,整份報告其他的十幾條事實,客戶都有理由重新懷疑。
這個推演讓我確定一件事。工具造成的錯誤與人工造成的錯誤,在客戶眼中沒有差別。報告上簽的是我的名字,客戶不會接受「那是摘要工具讀錯的」這種解釋,也不應該接受。
所以我在工作紀錄裡把這次事件歸類為自己的查核疏失,原因欄寫的是「引用未讀原文」,不寫工具的名稱。歸因寫對了,之後的改進才會落在自己能控制的地方。
原始文件本身有錯時,回原文核對也沒有用。對手的公開說明可能刻意樂觀,可能用詞含糊。核對只能保證我忠實轉述了原文,不能保證原文為真。這需要另外用多個獨立來源交叉比對。
文件量極大、無法逐條回查的研究,例如數千則評論的整理,五條規則的成本會高到做不下去。那類工作需要改用抽樣設計,並在報告裡明白揭露抽樣方式與誤差可能。
工具的能力與行為一直在變,這份檢討描述的是我遇到的一種錯誤型態,不代表所有工具或所有情況。規則的核心只有一句,不會隨工具改變:我簽名交出去的事實,要是我自己確認過的。