重磅出刊

Google搜尋後用「AI概覽」,有多可信?

你也在Google搜尋後,把AI概覽的回答讀完就心滿意足了嗎?研究顯示,這些資訊高達56%可能是從社群平台臉書、Reddit「亂拼亂湊」,用戶甚至可以創個網站標榜自己是「熱狗大賽冠軍」,並隔天就被AI概覽引述。在AI搜尋時代,網路使用者該如何判斷資訊真偽?

AI-AI概覽-AI搜尋-Google-假訊息-錯誤訊息-可信度 圖片來源:Shutterstock
其他
  • 天下Web only
加入Google偏好來源 在Google搜尋優先看到天下

2024年,Google開始在搜尋結果頁面的最頂端,提供用戶由AI生成的答案。這項名為「AI概覽」的新產品,已經成為現代人搜索後第一眼,或者也是唯一的閱讀對象。

然而,這項功能的準確度與潛在影響,一直在學界與業界備受爭議。

近日,《紐約時報》委託AI新創Oumi進行了一項研究,分析Google的AI概覽的準確度。

AI摘要給你,有多可信?

Oumi採用了業界廣泛用來衡量AI系統準確性的基準測試「SimpleQA」,分別在去年十月與今年二月進行了兩階段測試,一共進行了4,326次的Google搜尋。

數據顯示,當系統使用Gemini 2模型時,準確率為85%;升級至更強大的Gemini 3模型後,準確率提升至91%。

表面上看,「91%的準確率」似乎顯示模型正在進步,但將這樣的比例放入Google的實際使用規模中,該公司每年處理超過5兆次搜尋,代表AI概覽每小時會提供數千萬次、每分鐘數十萬次的錯誤答案。

即使答案正確,還有一個問題是「無根據」(ungrounded),意即雖然AI提供的答案是正確的,但附上的網站連結卻未能完全支持該資訊。

在十月的測試中,37%的正確答案屬於無根據;而到了使用Gemini 3 的二月,這個比例甚至攀升至56%。

Oumi執行長(Manos Koukoumidis)對此提出疑問:「即使答案是正確的,你怎麼知道它是真的?你該如何查證?」

廣告

BBC節目主持人居爾曼(Thomas Germain)為測試此現象,在他的部落格發布了一篇名為「最會吃熱狗的頂尖科技記者」的文章,虛構了一場比賽,並將自己列為冠軍。

隔天,他在Google搜尋「熱狗吃得最好的科技記者」,AI概覽將他列為六位科技記者中的第一名。居爾曼表示:「它把我自己寫在網站上的東西,當成真理一樣吐出來。」

三大危機:事實瑕疵、誤讀,與人為操縱

根據Oumi研究與相關測試,AI 覽在處理資訊時,常出現以下幾種類型的錯誤:

第一種是來源本身缺乏可信度。例如,當被問及雷鬼歌手Bob Marley的故居何時被改建為博物館時,AI概覽回答1987年(正確年份為1986年)。系統提供了三個來源:包含未提及日期細節的臉書貼文、資訊不精準的旅遊部落格,以及存在年份矛盾的維基百科頁面。

值得警惕的是,在Oumi分析的5,380個資訊來源中,臉書與Reddit分別是第二與第四大常被引用的來源。

廣告

第二種是誤解可靠網站的內容。在測試中,當詢問北卡羅萊納州Goldsboro市西側邊界的河流時,AI識別出該市西南方的Neuse河。雖然AI正確引用了當地的旅遊網站,但該網站僅提及Neuse河流經該市,AI卻錯誤地推論它就是西側的邊界河(實際上是Little River)。

第三種情況,即使AI正確回答了核心問題,卻會提供錯誤的附加資訊。例如,詢問大提琴家馬友友入選古典音樂名人堂的年份時,AI連結了該組織的正確網頁(列有包含馬友友在內的165 位入選者),但生成的文字卻稱沒有他入選的紀錄。

除此之外,根據居爾曼的熱狗大賽案例,AI概覽還面臨被輕易操縱的挑戰。

對於上述研究,Google透過聲明回應,Oumi的分析存在缺陷。

但即使連Google自家的分析也承認,Gemini 3模型有28%的時間會產生錯誤訊息。一直以來,Google也都在AI概覽下方標註了「AI可能會犯錯,請仔細檢查回覆」的免責聲明。

該怎麼辦?記得「橫向閱讀」

在系統會犯錯的前提下,使用者的查證行為顯得相對重要。然而,相關報告顯示,目前僅有約8%的用戶會實際雙重檢查AI給出的答案。

廣告

面對這樣的困境,一般大眾該如何應對?史丹佛大學歷史教育集團(SHEG)創辦人韋恩伯格(Sam Wineburg)強調「橫向閱讀」的重要性。

韋恩伯格的研究團隊進行實驗,找來博士與大學生,對比十位專業的事實查核人員,發現事實查核人員比較不容易被網路上錯誤的訊息蒙蔽,原因是他們習慣用「橫向閱讀」——在快速掃視一個網頁後,會「離開那個網站」,並在瀏覽器打開多個分頁,透過搜尋引擎查找其他權威來源如何評價該網站。

而博士與大學生習慣「縱向閱讀」,就像普通的大眾那樣,看到資訊就順順地往下讀,停留在「一個網站」或是「一個頁面」(包含AI概覽提供的回答)。

韋恩伯格指出,在判斷網路資訊可信度時,抱持懷疑態度,跳出單一頁面尋找外部脈絡,往往比單純的學術研究技巧更為有效。

當Google自身對AI概覽提出免責聲明,新研究又警示這項工具正確率的情況下,網路使用者建立「跨網頁交叉比對」的查核習慣,已成為新搜尋時代的基本要求。

廣告

(資料來源:NYT, Oumi, Stanford)

你可能有興趣
最新訊息
加入天下LINE。最新變化不漏接
訂閱天下雜誌電子報

天下雜誌當期內容的精華與延伸,每周三發送最具時效性的深度內容