重磅出刊

產出劣質農場文,AI將自食惡果

【林之晨專欄】生成式AI普及,網路上充斥愈來愈多錯誤資訊,人們必須花更多心力去辨識,否則難以下嚥;AI也恐因長期被餵食劣質資料,導致模型崩壞。

AI-ChatGPT-生成式-內容農場-假訊息-林之晨 圖片來源:Shutterstock
其他
加入Google偏好來源 在Google搜尋優先看到天下

不知道你有沒有發現近來用Google搜尋時,清單出現愈來愈多名不見經傳的內容農場網站。隨著ChatGPT等生成式AI普及,這些專門鑽搜尋引擎演算法漏洞、用殺人標題配上量產內容,以騙取用戶點擊,賺得廣告收入的寄生蟲網站,就像吃了類固醇一樣迅速壯大。

另一方面,包括亞馬遜、Etsy在內的許多電商網站,也開始被大量AI貼牌、AI藝術周邊等劣質商品所淹沒,讓血拚體驗不斷惡化。

甚至連維基百科也開始出現大量AI內容,引起編輯社群爭執,到底要默許它們以豐富站上的條目,還是要把這些參差不齊、有時連引用清單都寫錯的文章擋在門外?

很多科技業觀察家因此開始擔心,隨著網路上充斥這些AI產製的速食內容,分辨信號與雜訊將會愈來愈困難。換言之,人們恐怕要花更多的力氣去過濾、查證,而不是吸收。

另一方面,一篇近期發表、名為「遞迴的詛咒:用生成數據訓練造成模型的遺忘」論文中,來自牛津、劍橋、多倫多大學與倫敦帝國學院聯手完成的研究顯示,當語言模型吃進太多AI產製的所謂「組合數據」(Synthetic Data),短期會造成模型缺陷,長期則會導致「模型崩壞」(Model Collapse),再也無法生成有變化的內容。

這個道理不難理解,現代AI的結構,基本上是模仿人腦,因此缺陷也類似人腦,當你一直訓練學生背公式,看到題目就帶入公式解,久而久之,學生便再也無法想出公式以外的解題方法。

廣告

換言之,當AI要維持高速發展,必須不斷吸收人類的創意,才能鍛鍊出日益壯大的神經網絡。而此刻,因為企業競爭,大量運用AI內容去填滿網路,將開始成為AI加速發展的難題。

最終,在可預見的未來,一個內容好或不好,消費者還是真正的裁判。因此,在人們的興趣可以被精準預測之前,AI只能依賴實務上的結果來學習。

從這裡也不難理解,基於已知價值觀去變形出來的組合數據,其實無法拓展AI的視野。

結論就是,AI還需要與人類的判斷、創意共存很久一段時間,大家切莫驚慌。(責任編輯:王儷華)

關於作者 林之晨
關於作者 林之晨
AppWorks董事長暨合夥人、台灣大哥大總經理。1999年開始投入科技業,曾先後在台北與紐約共同創辦碩網資訊等新創。2010年回台成立AppWorks,現為大東南亞創業加速器龍頭,也是區域最活躍的創投機構之一。2019年AppWorks與台灣大建立策略聯盟,由林之晨擔任集團總經理。
延伸閱讀
你可能有興趣
廣告
最新訊息
每日6元,固定為自己充電
訂閱天下雜誌電子報

天下雜誌當期內容的精華與延伸,每周三發送最具時效性的深度內容