芬蘭阿爾托大學團隊以 AI 模型解析人類閱讀與視線決策

芬蘭阿爾托大學(Aalto University)主導的跨國研究團隊,結合香港科技大學、香港城市大學與新加坡國立大學研究人員,開發出一套用於模擬人類閱讀機制的人工智慧模型。研究於 8 月 10 日發表在《自然人類行為》(Nature Human Behaviour)期刊,主張 AI 不只能重現人類的眼球移動,也能從文本內容與閱讀目標出發,解釋讀者如何分配注意力。

研究團隊表示,這項成果有別於過去主要依賴大量文本與眼球移動資料進行訓練的閱讀模型。新模型嘗試將閱讀行為、文本理解與個人認知特徵結合,藉此分析讀者在有限時間內如何決定下一步視線應該移向何處。

從模仿閱讀行為轉向理解閱讀決策

過去的人類閱讀模擬模型,多半透過輸入大量文章與眼球追蹤資料,學習預測人們會在哪些字詞或句子停留。然而,這類模型主要著重於行為模仿,未必真正掌握文本內容,也可能難以將結論套用到不同語言或閱讀情境。

阿爾托大學教授歐拉斯維塔(Antti Oulasvirta)表示,舊有模型只是在模仿人類行為,並未真正掌握文本內容,結論也無法通用於不同語言。他指出:「這是我們首度利用人工智慧來理解人類如何閱讀,而不僅是模仿。」

以「資源合理性」模擬多層次視線控制

研究模型以「資源合理性」(resource rationality)為核心。這項概念假設,讀者在閱讀過程中會持續評估視線下一步的移動方向,目標是在有限時間與注意力資源下,盡可能提升對文本的理解程度。

模型的視線控制決策涵蓋單字、句子及完整文本等不同層次。當讀者遇到可能影響整體理解的關鍵字詞或句子時,模型會提高注意力並集中蒐集相關資訊;在資訊價值較低的段落,則可能加快掃視或跳讀。

研究團隊也將讀者的個人特徵轉化為可調整的模型參數,包括記憶力、眼球移動速度與清晰視野範圍等因素。香港城市大學教授趙盛東指出,這項模擬技術「為大腦運作提供全新視角」。

不同讀者在閱讀同一段文字時,可能採取不同的視線策略。例如,記憶力較佳且閱讀速度較快的人,較能迅速在段落之間移動;記憶力較弱的讀者,則可能需要更頻繁地回頭重讀,以補足先前遺漏的資訊。

建立逐步累積的「記憶表徵」

在運作過程中,模型會把已讀取的內容轉換為「記憶表徵」(memory representation),也就是經過濃縮的文本資訊。這種記憶並不完整,而是會隨模型掃視過的字詞逐步累積,並根據後續讀取內容持續更新。

當模型遇到關鍵字句時,會調整注意力分配並聚焦於相關位置,以取得有助於理解全文的資訊。研究人員接著透過提問測試模型的文本理解能力,再將模型的注意力決策與真實人類的眼球軌跡進行比對。

根據研究團隊說法,比對結果顯示,模型成功重現了讀者在實際閱讀時的行為。這表示模型不只是依照統計資料預測視線位置,也能在文本理解與資訊蒐集之間建立關聯。

智慧眼鏡與法律文件簡化成潛在應用

研究團隊認為,這項技術未來可能改善數位閱讀與輔助閱讀體驗。其中一項應用,是將複雜且艱澀的法律文件轉換成符合不同讀者理解程度的白話版本。模型若能掌握讀者已理解與尚未理解的內容,便有機會協助系統調整說明方式與資訊呈現順序。

擴增實境(AR)與智慧眼鏡則是另一個可能的應用方向。透過分析使用者的眼球軌跡,系統或可調整視野內文字的排列方式、顯示節奏與資訊密度,讓內容在讀者需要時出現在適當位置。

不過,來源研究目前主要證明模型能夠重現人類閱讀行為與注意力決策,實際導入智慧眼鏡或自動簡化法律文件,仍須進一步驗證其準確性、跨語言能力與在真實使用環境中的可靠度。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles