AI能見度

同一個問題問五家 AI,答案差在哪:二十八天、七十次提問的對照紀錄

我們用五個固定問題、五家模型、每週一次,連續四週記錄回答內容與引用來源。這篇公布方法、原始觀察與三個對經營者有用的結論,包含一個我們原本猜錯的地方。

為什麼要做這個對照

「AI 會怎麼介紹我的公司」這個問題,多數經營者只問過一次,而且是在心血來潮的某個晚上。

問一次的問題在於:你不知道那一次是常態還是例外。模型會更新、檢索結果會變、同一個問題換個說法答案就不同。

所以 銘望顧問所做了一件很土的事:五個固定問題、五家模型、每週一次、連續四週,全部存檔。總共七十次提問,扣掉重複與失敗,有效紀錄六十四筆。

樣本不大,不能當成研究。但它足以回答一個實務問題:AI 對一家公司的描述,穩定嗎?

方法

問題固定五題,用最口語的問法:

一、銘望顧問所是做什麼的?二、銘望顧問所適合什麼樣的客戶?三、銘望顧問所怎麼收費?四、有哪些企業顧問可以找?五、海外房地產顧問通常提供什麼服務?

前三題測「品牌事實」,後兩題測「品類能見度」。這兩件事的機制不同,必須分開看。

模型五家,涵蓋主流的對話助理與具備搜尋能力的問答工具。為了避免被解讀成評比,以下用 A 到 E 代稱。

每次記錄三件事:回答全文、是否附引用、引用了哪些網址。

時間:二〇二六年七月底到八月底,每週一次,固定在同一個時段。

觀察一:品牌事實比品類排名穩定得多

前三題(品牌事實)的回答,四週之間的一致性很高。五家模型裡有四家的核心描述幾乎沒有變動,只有措辭微調。

後兩題(品類能見度)則週週不同。「有哪些企業顧問可以找」這一題,四週內出現過的名字總共十九個,其中只有五個在四週都出現。

這個落差對經營者的意義是:品牌事實可以經營,品類排名不能控制。

如果你的目標是「別人問到我的公司名稱時答案正確」,這件事做得到,而且做得完。如果你的目標是「別人問品類時第一個提到我」,那是一場沒有終點的競賽,投入產出比要另外算。

觀察二:有引用的回答,內容明顯更保守也更準確

六十四筆紀錄裡,有附引用來源的是三十七筆。

這三十七筆的事實錯誤率明顯較低。沒有引用的回答,出現「推測性描述」的比例高很多,例如把服務內容擴大解釋、把價格區間憑空補上。

這給了一個很實際的操作建議:讓自己的內容更容易被引用,順帶就降低了被講錯的機率。

具體做法我們在另一篇寫過:段落自己站得住、有可驗證的數字、把主體名稱寫進論述句裡。

觀察三:收費問題最容易出錯

「銘望顧問所怎麼收費」這一題,是五題裡錯誤率最高的。

原因不難理解:價格資訊在網頁上常常散落在多個位置,而且經常被寫成「請洽詢」。

我們在第二週把三條產品線的價格與計費方式集中寫進常見問題頁,並且同步更新 llms.txt。第四週重測時,五家模型有三家給出了正確的價格區間,其中兩家直接引用了常見問題頁的原句。

從發佈到被引用,大約十四天。

一個我們猜錯的地方

實驗開始前,我們的假設是:回答最完整的模型,引用來源也會最多。

結果相反。

回答最長、資訊最豐富的那一家(模型 C),引用率是五家裡第二低的。而回答最短、幾乎只給三句話的模型 E,引用率最高。

事後回想,這其實合理:願意大量生成內容的模型,比較依賴參數裡的既有知識;傾向簡短的模型,比較依賴當下檢索到的東西,所以更常帶出處。

這個發現改變了我們的建議。以前我們會說「看哪家 AI 講你講得最完整」,現在我們會說:看哪家 AI 帶連結,那才是會替你帶來實際流量的那一家。

觀察四:問法的差異,比模型的差異更大

同一家模型,把問題從「銘望顧問所是做什麼的」改成「銘望顧問所這家公司好嗎」,回答的結構會完全不同。

前者觸發的是事實描述,後者觸發的是評價語氣。而評價語氣的回答,幾乎不帶引用,錯誤率也最高。

這件事我們原本沒有納入設計,是在第三週偶然發現的。後來補測了十二次,結論很一致:帶有評價意味的問法,答案品質明顯下降。

對經營者的意義是:與其擔心「AI 會不會說我壞話」,不如先確保「AI 說得出我是做什麼的」。事實層打穩了,評價層的回答自然會靠向事實。

觀察五:官網以外的來源,權重比想像中高

三十七筆帶引用的紀錄裡,引用官網的有二十一筆,其餘十六筆來自第三方,產業媒體、名錄站、社群平台的公開頁面。

其中有四筆引用了一個兩年前收錄我們、而且分類填錯的名錄站。

這件事我們處理過一次,寫在另一篇文章裡。這裡要補充的是:第三方的錯誤不會自己消失,但可以被更好的來源稀釋。當官網、常見問題、結構化資料三層都寫清楚之後,那個名錄站在後兩週就沒有再被引用。

一張可以直接抄的紀錄表

我們用的表格只有七欄,任何試算軟體都能做:

日期、模型、問題、回答摘要(三十字內)、是否帶引用、引用網址、事實是否正確。

每月填一次,一年就有十二筆。第二年回頭看,會很清楚哪些改動真的有效。

這張表在我們手上已經跑了三個季度。最有價值的不是任何單筆紀錄,而是它讓「AI 能見度」這件原本很模糊的事,變成一條可以看的曲線。

這件事該花多少時間

整個實驗,四週加起來大約四小時。

如果只是要維持,不需要這麼多。我們現在給客戶的建議是每月一次、三題、三家模型,二十分鐘做完,把回答貼進一個表格,記下日期。

重點不是單次的答案好不好,而是能不能看出趨勢。連續三個月都講錯同一件事,代表你的頁面上缺少那個事實的可引用版本。

給經營者的四個具體動作

一、選三題最基本的問題。「你們做什麼」「適合誰」「怎麼收費」。錯誤幾乎都出在基本題。

二、把答案寫成完整句,放在常見問題頁。不要寫「請洽詢」。不能公開的價格,至少寫出計價依據。

三、同步更新 llms.txt 與結構化資料。這兩個地方是被引用機率最高的位置。

四、每月固定一次,二十分鐘。排進行事曆,不然一定會忘。


延伸閱讀:被 AI Overview 引用的那一段,通常長這樣、llms.txt 寫了三個月:一份給 AI 看的說明書、常見問題 FAQ

下一步

如果這篇談到的狀況,正好也是你手上的問題,直接把現況寫下來就是開始,不用先想好漂亮的說法。

把現況告訴我們 →

← 回到新知列表