Grok與ChatGPT實測皆遭AI偵測器識破 內容創作與學術誠信面挑戰
人工智慧(AI)生成內容日益普及,同時也引發如何辨識這些內容的挑戰。一份最新研究指出,即使是xAI開發的Grok和OpenAI旗下的ChatGPT這兩款風格迥異的生成式AI模型,在經過專業AI內容偵測器Copyleaks的實測後,都被以百分之百的機率判定為AI生成內容。
根據《Copyleaks》報導,AI內容偵測技術仰賴分析文本中的「數學模式」,其中關鍵指標包括Perplexity(困惑度)與Burstiness(突發性)。Perplexity衡量AI模型預測下一個詞的能力,數值越低代表模型預測越確定,AI內容也就越容易被偵測。而Burstiness則評估句子長度和結構變化的程度,人類寫作通常較具「突發性」,AI生成的內容則往往缺乏此類變化。
測試結果顯示,儘管Grok和ChatGPT的設計目標與個性截然不同,兩者仍無一例外地被偵測器識破。ChatGPT因其結構統一性、僵硬可預測的措辭,以及填補詞和轉折詞的頻繁使用而屢遭標記,其非人類措辭的頻率甚至比人類寫作高出2,200倍。相較之下,xAI的Grok以風趣、網路原生且個性鮮明著稱,部分訓練數據來自X公司(前稱Twitter)且能存取即時數據,但在偵測中卻因困惑度模式、風趣語氣下隱藏的重複,以及較低的突發性而被識別。
《CoinGape》指出,xAI創辦人馬斯克(Elon Musk)對Grok寄予厚望,曾預測Grok 4.7將超越OpenAI和Anthropic的所有現有AI模型,尤其看好其在真實世界工程應用上的優勢,歸因於獨特的SpaceX訓練語料庫。xAI近期也已發布Grok 4.6版本,該模型在Agent式編碼和知識工作的多個基準測試中表現亮眼,根據Cognition的評估,Grok 4.6相較於Grok 4.5有顯著提升,並超越了OpenAI的GPT-5.6 Sol。
然而,這些性能上的進步並未使其免於被AI內容偵測器識別。研究強調,無論AI模型的風格和功能如何,改變AI輸出的風格和個性並不會改變其底層詞彙和措辭選擇的數學機率,因此仍可被偵測。即使將AI生成的文章進行改寫,仍會因為其內在的AI邏輯和可預測推理模式而被發現。
這項發現對各界帶來重要啟示。對教育工作者而言,AI模型本身是否可偵測並非最大挑戰,真正的難題在於AI生成內容經由人工編輯後,其AI模式可能被隱藏。對於企業團隊,制定涵蓋所有AI模型的治理政策至關重要,以管理未揭露AI生成內容帶來的潛在風險。而內容經理人則可透過更精細的Prompt(提示詞)來引導AI模仿特定寫作風格,藉以降低被偵測的機率。此議題對於台灣的教育界和內容產業來說,同樣需要密切關注,以維護學術誠信並確保內容的真實性。