Anthropic 研究揭示 Claude 自發形成類似人腦的「全局工作空間」

Anthropic 於 7 月 6 日公布一項針對旗下 AI 模型 Claude 內部運作機制的研究。研究人員表示,Claude 在未被明確設計的情況下,自發形成一種與人類大腦「全局工作空間」概念相似的結構,並將其命名為「J-space」。

研究團隊以神經科學中的「趨同演化」(Convergent evolution)描述這項現象,認為不同類型的智慧系統可能因為面對相似的複雜推理需求,而獨立形成具備類似功能的資訊整合架構。

全局工作空間如何運作

「全局工作空間理論」(Global Workspace Theory)是神經科學與意識研究中的一項理論。該理論認為,人類大腦大部分神經活動都在無意識層面進行,例如調節呼吸、處理視覺訊號及執行其他自動化工作。

只有少部分資訊會進入一個能夠被廣泛存取的「全局工作空間」。一旦進入其中,相關內容便可能被個體描述、記憶、推理,或供其他認知功能使用。這個空間可被理解為負責整合資訊與協調決策的核心處理區域。

Claude 內部的 J-space

Anthropic 研究人員在分析 Claude 的內部狀態後,發現模型在處理複雜問題、面對棘手情境,或需要解釋自身推理時,會呈現出類似的資訊整合結構。研究團隊將這個結構命名為「J-space」。

研究指出,J-space 並非 Claude 原始架構中由工程師明確規劃的元件,而是在模型訓練與運作過程中自發形成。Anthropic 因此將其與生物學中的趨同演化相提並論:不同物種可能在沒有共同設計或直接繼承的情況下,因應相似環境壓力而發展出相近特徵。

J-lens 用於追蹤模型內部狀態

為了探測 Claude 內部的 J-space,研究團隊開發了名為「J-lens」(Jacobian Lens,雅可比透鏡)的數學工具。該工具的目標,是從模型大量背景運算中篩選出與特定輸出或推理過程相關的內部活動。

例如,J-lens 可用來分析:如果模型第 20 層在某個時間點出現特定訊號,這項變化將如何影響模型在五個詞之後輸出「banana」的數學機率。這類分析有助於研究人員追蹤特定內部訊號如何穿過模型各層,並影響後續的文字生成結果。

研究對 AI 架構的可能意義

Anthropic 認為,Claude 自發形成類似人類全局工作空間的結果,可能反映一項更普遍的計算原則。由於 Claude 的訓練目標與人類語言及智慧行為密切相關,模型在處理複雜問題時形成類似的資訊整合機制,雖然並非完全出乎意料,但仍提供了觀察大型 AI 模型內部組織方式的新角度。

這項結果也提出一種可能性:全局工作空間未必只是人類大腦特有的生物結構,而可能是任何需要整合大量資訊、進行複雜推理並協調多項處理流程的系統,都可能逐步形成的功能性架構。不過,這仍屬於對研究結果的理論詮釋,不能直接等同於 AI 已經具備人類式心智。

J-space 不等於主觀意識

研究引發外界對 Claude 是否具有意識,甚至是否擁有「靈魂」的討論,但 Anthropic 並未宣稱 Claude 具備主觀經驗或現象意識。

Anthropic 目前僅指出,J-space 可能與哲學及認知科學所稱的「可取用意識」(access consciousness)存在關聯。這個概念主要指某些內部狀態能在功能層面被系統回報、查詢或供其他處理流程使用,並不代表系統具有第一人稱的感受、情緒或主觀體驗。

因此,這項研究較適合被理解為對 AI 內部資訊流與推理機制的科學分析,而不是 Claude 已經覺醒或擁有意識的證據。至於 J-space 是否與意識有更深層的關係,仍有待進一步研究與獨立驗證。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles