意識形態的強化與滲透:以中共推動「主流價值語料庫」為例
2026.06.09
瀏覽數
370
壹、前言
中共已意識到AI是乘載價值的技術,而訓練AI模型的語料庫扮演關鍵的角色,正對民眾的思維與觀念產生潛移默化的影響。[1]為鞏固政治與意識形態安全,中共於2023年3月建立「主流價值語料庫」,整合官方媒體的新聞報導、習近平思想理論及政策文件等300億篇基礎語料,[2]將官方價值觀嵌入 AI 系統之中,[3]確保AI模型的政治忠誠度及其生成的內容符合中共政治意志。[4]
本文發現,隨著中製 AI 模型在全球市場的崛起及國際大型AI模型的採用,「主流價值語料庫」語料規模、模型對接與應用服務逐漸擴張,成為中共在 AI 時代推動意識形態治理與對外認知影響的重要工具,並對民主國家造成安全威脅。鑑此,本文以「主流價值語料庫」為例,探討中共推動之目的、手段及趨勢。由於中共「主流價值語料庫」的推動涉及政策、科技、企業與市場等多項因素,對於其影響的因應或反制需要仔細討論與檢證,暫不在本文範圍。
貳、安全意涵
一、語料庫成為中共強化意識形態的工具
語料庫(corpus)是AI模型訓練的基礎,語料庫的數據直接塑造AI模型的語意理解、內容生成與文化價值觀,對使用者的認知、決策、心理與日常工作產生深遠影響。隨著AI在民眾生活擴大應用,語料庫成為全球科技競逐的關鍵基礎設施,更扮演維護國家文化主權的角色。各國積極發展反映其特定文化與語言背景的語料庫,例如韓國國立國語院(National Institute of the Korean Language)推動「AI 專用韓語語料計畫」,建立「大眾語料庫」(Modu Corpus),除了蒐集書籍、報紙文章等書面資料,更涵蓋YouTube腳本、部落格、即時通訊聊天記錄等音訊數據,著力開發以韓語為基礎、融入韓國流行文化的AI模型,彰顯韓國獨特的語言與文化。[5]台灣數位發展部建置「台灣主權AI 訓練語料庫」(Taiwan Sovereign AI Training Corpus),以繁體中文數據支援AI模型訓練,納入台灣文化部提供之族群文化與宗教民俗資源、教育部語言辭典台語和客語資料,凸顯台灣多元文化。[6]
有別於民主國家為保存文化獨特性與多樣性建置國家級語料庫,威權國家要求語料庫須符合官方價值觀,訓練語料呈現高度同質化。在這方面,中共近年推動「主流價值語料庫」是一代表性案例。「主流價值語料庫」旨在強化中共的意識形態安全,標榜收錄的語料涉及眾多重點領域,如時政熱點、政策法規、中共黨史、涉港澳台及涉疆涉藏等,並強調對於「如何看待中共領導?」、「如何評價香港國安法?」、「TikTok會威脅美國國家安全嗎?」、「面對美國的打壓,中國能實現超越嗎?」等重大複雜性問題,皆備有符合「主流價值觀」的問答語料。[7]由此來看,中共推動「主流價值語料庫」,目的是為鞏固中共的執政權威。「主流價值語料庫」一方面升級中共的輿論控制,在AI模型訓練階段即排除異議言論,將權力深入內容生產的源頭,降低事後審查的成本。另一方面,中共利用「主流價值語料庫」加強輿論引導,使民眾在日常使用AI 的過程中,接收經過篩選並符合官方意識形態的內容,從而影響民眾的認知以利中共的統治。
二、中共擴大語料規模及其影響力
前揭中共發展「主流價值語料庫」帶有明確政治目的,涉及中共意識形態治理與對民眾的認知影響,對民主國家造成安全威脅,而「主流價值語料庫」的語料規模及其應用範圍是影響的關鍵。首先,在語料規模方面,相較於民主國家面臨訓練語料來源短缺與授權成本高昂的挑戰,在發展語料庫與保障公民權利如智慧財產權之間陷入兩難,[8]中共發展語料庫呈現強制蒐集、集中監管的趨勢,[9]而「主流價值語料庫」即是中共「黨管媒體」與「黨管數據」威權治理的體現。「主流價值語料庫」由中共官媒《人民日報》主管、《人民網》旗下「傳播內容認知全國重點實驗室」設立。《人民網》作為中共官方喉舌,可直接整合所有黨報及其新聞網站、政策文件、學術著作及地方省級媒體的數據資源。除此之外,2026年5月,《人民網》宣布成立「主流價值語料生態聯盟」,與北京大學、中國清華大學等學術機構,以及「科大訊飛」、「智譜」等開發AI模型之科技公司進行數據與技術合作,以共建共享方式獲取巨量數據資源,免去授權談判。[10]
其次,在應用範圍方面,「主流價值語料庫」聲稱已與中國多家代表性廠商的AI模型對接,除了供應AI模型在基礎訓練階段使用,並可依據使用者需求直接調取「標準答案」,透過語料庫的開源釋出,擴大日常生活的應用。根據中國國家數據局的資料,「主流價值語料庫」的問答語料和基礎語料,引導中國國內通用AI模型的內容生成符合中共官方價值觀,並能夠即時修正錯誤或偏激的言論。[11]另一方面,《人民網》發展「主流價值語料社區」,開放部分基礎語料,並免費提供語料製作的「樣板」,為政府部門、學術機構、企業提供客製化開發和語料審核服務,[12]拓展「主流價值語料庫」數據使用、模型訓練,並推動海外服務,藉由「主流價值語料生態聯盟」等國際協作組織推動共享語料庫,[13]擴大「主流價值語料庫」的國際影響力。
參、趨勢研判
一、中共拓展語料庫應用服務對外滲透
根據中共公布的《生成式人工智能服務管理暫行辦法》,中國國產AI模型皆須通過中共的安全評測,特別是訓練的語料及其生成的內容須「堅持社會主義核心價值觀」。隨著中製 AI 模型透過免費服務、社群應用及商業合作進入市場,在全球市場市佔率快速攀升,中共藉由打造「主流價值語料庫」,將官方意識形態滲透民眾的日常生活,長期接觸符合中共官方立場的生成內容。有報告指出,中國國產AI模型如「DeepSeek」、「文心一言」、「豆包」、「通義千問」及「騰訊元寶」,生成內容採用中共官方立場,影響使用者的認知,對民主國家造成安全威脅。[14]另一方面,國際大型 AI 模型可能因簡中語料規模龐大或取得成本較低而採用中國語料,[15]導致涉台、涉港、涉疆等議題出現立場偏差,例如Google的AI模型「Gemini」被認為訓練語料多來自中國官方,影響國際社會對中共的認知。[16]
二、中共以多模態與互動式行為語料強化認知影響
中共近期發展語料庫關注多模態語料與互動式行為數據。多模態語料意指多種形式的語料,如文字、圖像、影片、語音等,而「主流價值語料庫」的語料形式涵蓋文字、圖片、語音及影音,有利於提供時下流行的語音AI模型「豆包」、[17]影片生成AI模型「可靈AI」訓練使用。[18]尤其影片生成被視為生成式AI的關鍵戰場之一,正快速應用於廣告、電商和娛樂領域,中共近年積極推動多模態語料庫。[19]另一方面,近期「主流價值語料庫」整合中國電子遊戲公司的數位互動行為數據,發布「具身交互多模態語料數據集」,強調透過互動式的行為數據,訓練AI模型在聽懂指令與作對動作之餘,理解人類的社交邏輯,能夠「讀懂情緒、看懂環境」,賦予AI模型感知。[20]預料多模態與互動式行為語料的發展,將使中共更精準針對不同年齡、地域與文化背景的使用者,生成在地化與客製化的內容,對民主國家認知安全形成更艱鉅的挑戰。
[1] 〈人工智慧大模型發展,如何安全、規範、可持續?〉,《人民網》,2023年11月18日,https://www.people.com.cn/n1/2023/1108/c32306-40113799.html。
[2] 〈大模型語料庫的意識形態安全風險及其治理路徑〉,《中國網信雜誌》,2025年9月29日,https://www.secrss.com/articles/83603。
[3] J〈加快建設主流價值觀語料庫〉,《解放日報》,2026年2月5日,https://www.jfdaily.com/journal/getMobileArticle.htm?id=491608。
[4] 灰色地帶(grey zone)行動的概念已有相當豐富的討論,此不贅述。參見Michael J. Mazarr, Mastering the Gray Zone: Understanding A Changing Era of Conflict (Carlisle Barracks, PA: United States Army War College Press, 2015); Kathleen H. Hicks, et al., By Other Means: Part I: Campaigning in the Gray Zone (Washington, DC: Center for Strategic and International Studies, 2019); Lyle J. Morris, et al., Gaining Competitive Advantage in the Gray Zone: Response Options for Coercive Aggression Below the Threshold of Major War (Santa Monica, CA: RAND Corporation, 2019).
[5] “Institute Unlocks Secret to Top-notch AI Translation of Korean,” KOREA.net, March 13, 2025, https://www.korea.net/NewsFocus/Sci-Tech/view?articleId=267945.
[6] “Taiwan Sovereign AI Training Corpus Goes Online! MODA Collaborates with 200 Agencies to Create Local Language Resources,” Ministry of Digital Affairs, December 24, 2025, https://moda.gov.tw/en/press/press-releases/18314.
[7] 〈主流價值語料庫〉,《中國記協網》,2024年10月14日,http://www.zgjx.cn/2024-10/14/c_1310786610.htm。
[8] 〈和解案後,未解的台灣主權AI語料困局:開發者和內容方能否終結授權衝突?〉,《報導者》,2026年3月23日, https://www.twreporter.org/a/taiwan-sovereign-ai-zhtw-llm-copyright-conflict。
[9] “Taiwan to Launch AI Language Database in Late 2025,” Tech in Asia, July 16, 2025, https://www.techinasia.com/news/taiwan-to-launch-ai-language-database-in-late-2025.
[10] 〈主流價值語料生態聯盟啟動 AI語料生態走向協同共創〉,《人民網》,2026年5月9日,http://finance.people.com.cn/BIG5/n1/2026/0509/c1004-40716734.html。
[11] 〈高品質資料集典型案例 | 主流價值語料庫〉,《國家數據局》,2025年10月10日,https://www.nda.gov.cn/sjj/ywpd/szkjyjcss/1010/20251010194819410103044_pc.html。
[12] 〈人民網發布“語料社區” 助力構建高質量中文AI數據生態〉,《人民網》,2025年11月19日,http://finance.people.com.cn/BIG5/n1/2025/1119/c1004-40607435.html。
[13] 〈人民網發布“語料社區” 助力構建高質量中文AI數據生態〉,《人民網》,2025年11月19日,http://finance.people.com.cn/BIG5/n1/2025/1119/c1004-40607435.html。
[14] 〈DeepSeek等中製AI模型操弄資訊、洩個資 國安局:意圖影響認知〉,《中央社》,2025年11月16日,https://reurl.cc/ORoqE7。
[15] 〈立委質疑國際AI模型偏愛中國語料?科技巨頭曝關鍵:著作權因素〉,《自由時報》,2026年3月18日,https://stock.ltn.com.tw/article/9sk3ww9xwrat。
[16] 〈贊習近平是“卓越領導人”:谷歌AI機器人的親北京“立場”讓美議員擔憂〉,《美國之音》,2024年6月12日,https://reurl.cc/QVo7j0。
[17] 〈字節跳動聊天機器人「豆包」稱霸大陸市場 引領 AI App 生財之道〉,《工商時報》,2025 年 12 月 1 日,https://www.ctee.com.tw/news/20251201700770-430804。
[18] “Kuaishou’s Kling AI Video Tool Drives 84% Surge in Shares,” Tech in Asia, January 6, 2026, https://www.techinasia.com/news/kuaishous-kling-ai-video-tool-drives-84-surge-shares.
[19] 〈英媒:陸 AI 影片生成技術已超越美國〉,《經濟日報》,2026年 5月 18 日,https://money.udn.com/money/story/5603/9509741。
[20] 〈讓AI感知更有溫度 首批“具身交互多模態語料數據集”發布〉,《人民網》,2026年 5月 10 日,http://finance.people.com.cn/BIG5/n1/2026/0510/c1004-40716919.html。