不知道你有沒有發現近來用Google搜尋時,清單出現愈來愈多名不見經傳的內容農場網站。隨著ChatGPT等生成式AI普及,這些專門鑽搜尋引擎演算法漏洞、用殺人標題配上量產內容,以騙取用戶點擊,賺得廣告收入的寄生蟲網站,就像吃了類固醇一樣迅速壯大。
另一方面,包括亞馬遜、Etsy在內的許多電商網站,也開始被大量AI貼牌、AI藝術周邊等劣質商品所淹沒,讓血拚體驗不斷惡化。
甚至連維基百科也開始出現大量AI內容,引起編輯社群爭執,到底要默許它們以豐富站上的條目,還是要把這些參差不齊、有時連引用清單都寫錯的文章擋在門外?
很多科技業觀察家因此開始擔心,隨著網路上充斥這些AI產製的速食內容,分辨信號與雜訊將會愈來愈困難。換言之,人們恐怕要花更多的力氣去過濾、查證,而不是吸收。
另一方面,一篇近期發表、名為「遞迴的詛咒:用生成數據訓練造成模型的遺忘」論文中,來自牛津、劍橋、多倫多大學與倫敦帝國學院聯手完成的研究顯示,當語言模型吃進太多AI產製的所謂「組合數據」(Synthetic Data),短期會造成模型缺陷,長期則會導致「模型崩壞」(Model Collapse),再也無法生成有變化的內容。
這個道理不難理解,現代AI的結構,基本上是模仿人腦,因此缺陷也類似人腦,當你一直訓練學生背公式,看到題目就帶入公式解,久而久之,學生便再也無法想出公式以外的解題方法。
換言之,當AI要維持高速發展,必須不斷吸收人類的創意,才能鍛鍊出日益壯大的神經網絡。而此刻,因為企業競爭,大量運用AI內容去填滿網路,將開始成為AI加速發展的難題。
最終,在可預見的未來,一個內容好或不好,消費者還是真正的裁判。因此,在人們的興趣可以被精準預測之前,AI只能依賴實務上的結果來學習。
從這裡也不難理解,基於已知價值觀去變形出來的組合數據,其實無法拓展AI的視野。
結論就是,AI還需要與人類的判斷、創意共存很久一段時間,大家切莫驚慌。(責任編輯:王儷華)
天下總主筆陳良榕專欄。半導體狂熱、科技巨頭謀略的最犀利解讀
看懂科技大勢,獨家解讀
請查看您的信箱,我們將寄送驗證信給您,確保未來信件會送到您的信箱