議題背景:

臺灣時間8月24日晚間11:00,《自然人類行為》(Nature Human Behaviour)發布一篇由南加州大學電腦科學系與心理學系團隊完成的研究,指出大型語言模型幾乎不更動原意,卻讓人類的寫作風格趨於相似,寫作複雜度的變異幅度減少了2成到5成。研究團隊提醒,書寫一旦趨同,要從一個人的用字讀出身分、人格與心理健康的線索,就會變得更難。

研究團隊蒐集國際論壇與社群平台「Reddit」的創作文章、地方新聞、學術論文摘要、散文、社群媒體貼文與政治演說等七個資料集、超過88萬篇文本,先觀察ChatGPT問世前後語言複雜度的長期變化,再以GPT-3.5、Llama 3 70B與Gemini Pro,搭配12種提示詞改寫人類寫下的文字。改寫後有87%的文本與原文語意高度相似,但用來分析這些文本的模型,辨識作者個人特徵的準確度平均下降6個百分點,其中判別作者年齡的準確度受影響最深。改寫後的文章一面倒地被判讀為出自同理心較低、道德關懷較強、年齡較大、政治上偏自由派的作者。

研究也發現,學術論文摘要最早出現趨同的跡象。在AI使用率上升大約5個月後,就看得到學術論文摘要之間的差異縮小;Reddit的創作文章則在20個月後;地方新聞則是三組資料中唯一沒有出現這種前後關係的文體。研究團隊推測,稿件要經過編輯台這道關卡,可能降低了AI的風格同質化效果。

論文連結:https://doi.org/10.1038/s41562-026-02550-0

為使大眾更加理解這份研究對台灣本土語言保存,以及對語言判讀應用的意義,台灣科技媒體中心邀請客家與族群語言研究、人工智慧治理領域的專家提供觀點。

 

專家怎麼說?
【張陳基】【李韶曼】


2026年08月20日
國立聯合大學客家研究學院院長/文化創意與數位行銷學系教授 張陳基

一、AI保留了意思,卻讓我們愈來愈「說一樣的話」

這篇研究探討:當大型語言模型成為日常寫作助手,人類語言是否會在不知不覺中趨於一致。研究團隊分析七個資料集、超過八十八萬篇文本,結合時間序列觀察、控制式改寫與個人特質分類。結果發現,模型大致保留原意,卻使寫作的多元複雜度縮減約二至五成,也削弱年齡、性別、人格與同理心等語言線索。AI不只潤飾文句,也在重塑何謂「正式、專業、日常」的語言。這篇論文不僅證實了語言同質化的存在,更深刻指出這種同質化是帶有強烈「偏向性」的,會讓全人類的語言在不知不覺中,向特定優勢族群的樣貌靠攏。

二、AI時代的新數位落差:不被AI支援的語言,可能加速被淘汰

對台灣而言,問題不只是大家寫得愈來愈像,而是高資源語言可能加速排除低資源語言。台灣長期推動族群主流化,希望讓客家與原住民族進入主流公共生活;但若AI主要支援華語與英語,使用者為了取得準確、便利的服務,就會被迫轉換語言。結果不是客語回到主流,而是客語在數位社會加速被遺棄。

三、從「族群主流化」走向「AI族群主流化」:讓少數語言真正進入AI生態系

因應上,首先應推動「語料、模型、服務」三方向開放,讓客語及各族群語言的文本、語音、腔調與文化知識進入訓練過程。其次,應建立語言多樣性與族群主流化檢測,評估模型是否抹除地方詞彙、文化用語與個人風格。第三,也應由族群社群參與資料授權、模型治理與評估,使少數語言進入教育、媒體及公共服務,並避免產生族群偏見。

四、文化保存最迫切:客語AI不是科技加值,而是語言生存工程

研究指出的「心理狀態偵測、招募甄選、個人化服務、文化保存」四類風險中,我認為「文化保存」對台灣最迫切,語言一旦退出數位場域,流失往往難以逆轉。研究也警告,AI生成內容重新進入網路語料、並成為下一代模型的訓練資料後,可能形成語言變異持續縮減的回饋循環。AI若不會聽、不會說、不會寫客語,就會傳達這種語言「不值得使用」、「不方便使用」的訊號。客語AI不是科技加值,而是數位時代的語言生存工程。

 


2026年08月24日
國立成功大學敏求智慧運算學院副教授 李韶曼

Q1:想請教您,這篇研究的內容主要是什麼?我們應該怎麼解讀?

這篇研究分三個層次,檢驗大型語言模型作為寫作輔助,是否讓人類的語言趨於同質。研究先分析三種美國的長期資料:網路論壇Reddit上的創作故事、地方新聞報導,以及學術論文摘要。結果發現,ChatGPT問世後,三種資料寫作複雜度的差異都明顯縮小;而且AI文本占比愈高,往後幾個月的差異就愈小。研究團隊接著模擬我們平常用AI潤稿的情境,直接讓模型改寫人的寫作:雖然語意高度相似,文章之間寫作複雜度的差異卻縮減了二至五成。

研究更發現,原本能從文字推測的作者特質,包括人格、同理心、道德價值、年齡、性別,以及政治傾向,在文本經模型改寫後都變得較難判讀,特別是年齡受影響最深。改寫後的文章,一面倒地被判讀為出自同理心較低、年齡較大、在美國政治光譜上偏自由派的作者。對應人格特質的語言線索,像是代名詞、口語、髒話這些最能標記個人的字眼常被AI刪除,並增加正向情緒與社交詞彙。

這些發現可以有兩個解讀。第一,AI模型雖保留了我們說什麼,卻改變了我們怎麼說,但怎麼說本身,實際承載了個人身分與心理資訊。心理狀態偵測、招募甄選、個人化服務這些常見的應用,都建立在作者本人資訊留存於文字的前提上。AI改寫一旦刪去這些訊息,對所有藉語言理解人的應用就會造成影響。比如憂鬱與自殺意念的語言資訊若被抹去,我們更難從文字及早發現需要幫助的人。

第二,AI讓人類的寫作向訓練資料裡的多數靠攏,這對台灣的文化保存尤其切身相關。本研究的語料全為英文,寫作者以美國人為主,改寫後浮現的作者樣貌,是英文世界的多數;模型效法的是資料裡統計上最常見的寫法,後續的調校又以標註者的偏好為準,無論語言,只看多數。其他研究已看到非西方使用者以AI輔助寫作時,文字傾向西方風格,文化細節隨之流失。

那麼,中文語料裡的多數是誰?在最大的公開網頁語料庫裡,英文約占四成,中文簡繁合計不到5%,其中又以簡體為大宗;繁體只是一小部分,台語、客語與原住民族語更近乎缺席。若把台灣人的寫作與表達交給AI改寫,會呈現什麼樣貌?這個問題,需要以台灣語料,做同等研究來回答。