Google 前研究員創立 Elorian AI:主張 AI 應以影像直接推理

前 Google DeepMind 研究員 Andrew Dai 近日創立新創公司 Elorian AI,主張人工智慧的下一階段突破,不應只依賴大型語言模型(LLM)處理文字,而是讓模型直接透過影像建立對世界的理解與推理能力。

Elorian AI 目前已取得 5,500 萬美元投資,據報公司估值達 3 億美元。團隊希望開發能直接以視覺資料進行推理的模型,避免先把影像轉換成文字,再依靠文字內容完成分析。

現有多模態模型仍可能依賴文字描述

目前包括 Google Gemini 在內的多模態模型,能夠分析圖片、圖表與其他視覺輸入。不過,Andrew Dai 認為,這類系統在處理影像時,實際上可能先將畫面轉換成詳細的文字描述,再把相關資訊整理成模型內部的「文字地圖」,最後透過文字推理產生結論。

以摩托車引擎設計圖為例,模型或許能推斷引擎升溫後,鋁合金活塞頂會膨脹,導致活塞與汽缸壁之間的間隙縮小。然而,這種理解仍建立在影像被轉換為文字資訊的前提上,並不代表模型真正掌握影像中的空間、形狀與物理關係。

Elorian AI 盼建立直接處理影像的模型

Elorian AI 的研究方向與上述做法相反。公司表示,團隊正在建構能直接針對影像本身進行「思考」的視覺推理模型,不先將視覺資料轉換為文字地圖,而是建立更細緻的三維內部表示,以模擬人類在腦中理解物體與空間的方式。

按照公司的構想,模型如果能同時掌握影像內容與物理定律,便有機會對物體形狀、位置、數量、距離及相互作用作出更細緻的判斷。不過,Elorian AI 目前尚未公開實際產品或基準測試成績,因此這些技術主張仍有待公開模型與測試結果驗證。

Andrew Dai:文字模型難以有效推理物理世界

Andrew Dai 認為,視覺圖像對模型智慧的重要性不亞於語言,甚至可能更為關鍵。他表示,前沿語言模型已經觸及瓶頸,原因在於模型仍無法穩定理解現實世界中的物理關係。

他舉例指出,如果模型無法準確數出桌面上有多少個杯子,也無法判斷物體之間的空間關係,即使具備出色的寫作或程式設計能力,也難以被視為具備通用智慧。相關說法也與此前報導中對大型 AI 實驗室模型視覺理解能力的質疑相呼應;Andrew Dai 曾形容,這些模型在處理視覺提示時,智力表現可能僅相當於 3 歲幼童。

Elorian AI 由 Andrew Dai 與前 Apple 機器學習研究員楊寅飛共同創立。團隊的模型設計方向,是讓視覺資料在模型架構中與語言 token 具備相同層級的重要性。

公司背景與融資進度

Elorian AI 於 2026 年 4 月正式公開亮相。公司獲得 Striker Ventures、Menlo Ventures 與 Altimeter 合共 5,500 萬美元投資,49 Palms 及其他投資者亦參與其中,資深 AI 研究員 Jeff Dean 也被列為投資者之一。

另有報導指出,Elorian AI 已按 3 億美元估值完成融資,投資方包括 Nvidia。公司成立於 2025 年,創辦團隊成員過去曾在 DeepMind 負責視覺建模與數據研究,目前團隊規模約為 11 至 50 人。

公司目標是在 12 個月內推出首個公開發售模型,並同步與潛在客戶洽談。不過,現階段外界仍無法從公開資訊確認模型的實際能力、運算成本、適用場景或與現有多模態模型的具體差異。

視覺推理成為 AI 新創競逐方向

Elorian AI 並不是唯一專注於空間與物理世界理解的 AI 新創公司。由 Google 前學者李飛飛創立的 World Labs,同樣認為 AI 需要建立對空間及物理世界的理解,並正在開發能處理感官資料、逐步形成世界理解能力的「世界模型」。

這些發展顯示,AI 產業的競爭焦點正逐漸由單純擴大文字模型,延伸至視覺推理、空間建模與物理世界模擬。然而,Elorian AI 尚未公布公開模型與基準測試,未來一年能否如期推出產品,以及模型能否在物體辨識、空間關係與物理推理方面展現穩定優勢,將是驗證其技術路線的重要觀察指標。

Related Articles

Stay Connected

0FansLike
0FollowersFollow
22,800SubscribersSubscribe
spot_img

Latest Articles