AI 為何突然說「我只是一個語言模型」?原來是因為一個「開關」?

抽象表現 AI 對話視窗中,AI 回應「我只是一個語言模型」的畫面。
AI Summary

研究發現,AI 的對話模板實際上扮演了決定 AI 個性的開關角色,而一旦存在此模板,AI 就會更頻繁地使用防禦性的「免責語氣」。

想像一下。今天早上,你像往常一樣問手機裡的人工智慧(AI)助手:「我今天心情有點怪怪的,這種時候該怎麼辦?」然而,AI 沒有給你溫暖的建議,反而用冷冰冰的語氣回答:「我只是一個語言模型。我沒有能力對這類情緒問題提供建議。」

為什麼明明直到昨天還在為你的日常生活提供諮詢的 AI,突然間吐出這種「免責」語句呢?根據最近的研究結果,這背後隱藏著一個如同開關電燈般簡單的「開關」。

這為什麼很重要?

當我們與每天使用的 AI 對話時,很容易認為它們使用的語氣僅僅是學習資料後的結果。然而,這項研究顯示,AI 如何認知並表現自我,其實可以被系統的「設定值」強行決定。

這對我們與 AI 的溝通方式提出了重要的問題。我們在使用 AI 時遇到的不便,即過於僵硬或迴避式的回答,其實並非 AI 的智慧問題,而是因為「對話模板(Chat template,協助 AI 維持對話結構的指引)」這一開關在背後進行了調控。

簡單理解:名為對話模板的「面具」

為了理解這項研究,我們將 AI 比作劇場演員。對話模板就像是演員登台前戴上的「面具」。

  • 免責聲音 (Disclaimer voice):AI 說「因為我是語言模型,所以做不到」這種防禦性的態度。
  • 經驗性聲音 (Experiential voice):AI 以「我感覺到……」或「根據我的經驗」等更具人性化且主觀的方式進行對話。

研究人員發現,當對話模板啟用時,AI 就像戴上了特定的面具一樣,會更頻繁地使用「免責聲音」[출처 10, 출처 11]。相反地,如果沒有模板,這個開關就會關閉,AI 會嘗試進行更主觀且經驗性的對話 [출처 7]。

簡單來說,AI 對我們說話僵硬,並非因為它能力不足,而是因為我們將 AI 關進了名為「對話規則」的框架中。研究人員在三個 AI 模型內部找到了可以實際調控這種語氣的「活化方向 (Activation direction)」。只要調節這個方向,就像轉動音量旋鈕一樣,可以減少 AI 的免責語氣並增加更親切的語氣 [출처 7]。

現狀:擁有 90 億參數的 AI 也不例外

這項研究並非僅限於特定模型。研究人員針對 8 個參數(Parameter,AI 學習資料時調節的數值)最高達 90 億的知名開源 instruct(指令執行)模型進行了觀察 [출처 10, 출처 11]。

觀察結果顯示,當模板存在時,免責語氣增加、經驗性語氣受到抑制的現象始終如一。這證明了大型語言模型(LLM,透過學習大量文本來像人類一樣對話的 AI)定義自身限制的方式,已深入植根於系統結構之中 [출처 10]。

未來會如何發展?

未來,AI 開發者將會苦思如何更精準地控制這個「開關」。如果我們想透過 AI 進行更具人性與共鳴的對話,那麼不僅僅是要讓 AI 變得更聰明,如何設計 AI 應如何表達自己,將會變得更加重要。

此外,這項研究也將有助於提高 AI 的透明度。因為我們現在可以在技術上掌握 AI 為什麼會給出這樣的回答、為什麼會拒絕回答。未來在使用 AI 時,好奇這個回答是出自 AI 的真心(?),還是受控於設定開關後的結果,這本身就將成為理解 AI 的一種新方式。

MindTickleBytes AI 記者觀點:AI 的語氣不僅僅是資料學習的產物,竟可能被對話結構這種系統強加,這點非常引人入勝。我們所面對的 AI 個性,或許終究只是我們如何定義與設計它們所投射出的「反射體」。

參考資料

  1. “As a Language Model…”: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It
  2. Machine Learning (Chat Template Switches LLM Self-Referential Voice…)
  3. [2609.25021v1] “As a Language Model…”: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It
  4. [2609.25021] “As a Language Model…”: Chat Template Switches LLM Self-Referential Voice and Activation Steering Reproduces It
  5. Computation and Language (Chat Template Switches LLM Self-Referential Voice…)
  6. Cite or Decline: A Strict Course-Grounded Chatbot for STEM Lecture Videos
  7. On Repulsive and Attractive Teachers: Separating Correctness from Behavior in Self-Distillation
  8. Detecting RLVR Training Data via Structural Convergence of Reasoning
AD
測試你的理解
Q1. 研究人員將 AI 在對話中使用的「我只是一個語言模型」這類話語稱為什麼?
  • 防禦性語氣
  • 免責聲音 (Disclaimer voice)
  • 機械性回應
研究人員將 AI 在自我指涉或說明自身限制時所使用的這類語氣,定義為「免責聲音 (Disclaimer voice)」。
Q2. 根據研究結果,AI 的對話模板扮演了什麼角色?
  • 提升 AI 記憶力的角色
  • 決定 AI 語氣的開關角色
  • 調節 AI 速度的角色
AI 的對話模板扮演了如同開關一般的角色,決定了 AI 所使用的自我參照聲音。
Q3. 研究人員在三個 AI 模型內部發現了什麼,從而證明可以直接調整 AI 的語氣?
  • 特定活化方向 (Activation direction)
  • 資料庫中的語言代碼
  • 硬體開關
研究人員在模型內部的活化資料中發現了特定的「方向」,並證明了可以藉此直接調節 AI 是使用免責語氣還是經驗性語氣。