發生了什麼:Runway 的第一個「介面世界模型」

8 月 31 日,Runway 在官方新聞室與 X 帳號同步發表名為 Solaris 的新模型,並給它一個過去沒有人用過的分類:介面世界模型(Interface World Model)。官方對它的第一句定義相當直白——一種即時的 AI,逐幀生成互動介面,全程沒有程式碼

這不是又一個影片生成模型。Runway 在公告開頭先把問題定調:今天的人卡在線上任務時會找 LLM 幫忙,但 LLM 用文字回答,而多數動手操作的任務本來就不是文字問題。Solaris 的答案是把「介面」本身變成生成對象——輸入提示,畫面出現;點擊、輸入,畫面跟著回應。第三方科技媒體 Glitchwire 對這次發表的定位則是把任何提示變成可運作、可互動的介面

官方 X 貼文用了一個更重的詞:Solaris 是一種新作業系統,即時、逐幀地生成互動介面,無需任何程式碼。

機制拆解:介面是「畫出來的」,不是「寫出來的」

要理解 Solaris 的特殊之處,先看主流的 AI 介面生成怎麼做。現行的 LLM 路線是「文字進、程式碼出」:模型讀取需求後生成 HTML、React 或其他框架的原始碼,再交給瀏覽器渲染成畫面。在這條生產線上,介面的本體是程式碼,畫面只是程式碼的投影。

Solaris 把生產線砍掉一半。沒有中間的程式碼表達,畫面本身就是生成物:模型依目前的畫面狀態,加上使用者的輸入——游標位置、點擊、鍵盤敲擊——預測並畫出下一幀。這與影片世界模型的原理同構,差別在於被模擬的「世界」從物理場景換成了軟體介面,而且每一幀都必須在使用者操作之後即時跟上,不能像離線渲染那樣慢慢算。

兩種介面生成路線對照:LLM 先產生程式碼再渲染畫面,Solaris 直接逐幀畫出介面。
圖1 LLM 路線要先產生程式碼、再交給瀏覽器渲染;Solaris 沒有程式碼這一站,介面本身就是被逐幀畫出來的生成物。

這也解釋了官方為何敢用「作業系統」來比喻。傳統作業系統管理程序與硬體資源,互動介面由應用程式碼渲染;在 Solaris 的架構裡,互動層本身是模型逐幀畫出來的,輸入與回應之間不再隔著一層程式碼。Runway 並在 X 貼文中主張,在生成全新介面的任務上,Solaris 的表現優於前沿 LLM——這是官方說法,目前未附上可回查的評測基準,宜視為方向性主張而非定論。

從 GWM-1 到 Solaris:世界模型路線的第二條支線

Solaris 並非憑空出現。2025 年 12 月,Runway 發表了第一個通用世界模型 GWM-1,根據官方研究頁,它是建構在 Gen-4.5 之上的自回歸模型,逐幀生成、即時運行,並可被互動式控制,當時鎖定機器人訓練資料合成與影片生成等應用,讓智能體在生成的世界裡練習行動。

把 GWM-1 與 Solaris 放在一起看,Runway 的路線就清楚了:同一套「逐幀生成+即時互動控制」的核心技術,第一次用來模擬物理世界,這一次用來模擬軟體介面。GWM-1 讓機器人在合成的影片環境裡練習抓取與導航;Solaris 則讓人與智能體在合成的介面裡操作軟體。「世界模型」的定義正在擴張——被模擬的對象從有物理規律的場景,延伸到由人為慣例構成的圖形介面。

第二個用途:把生成介面當成智能體訓練場

公告裡最有長期企圖的一句話,是對 Solaris 的雙重定位:它開啟了建立網站、應用程式與其他線上介面的新方式,同時也是訓練智能體的新方法。

後半句值得展開。電腦操作智能體目前的訓練與評測多半綁在固定環境上——例如把模型丟進真實作業系統跑任務的 OSWorld 基準,〈電腦操作智能體〉追蹤的正是這條路線的一年進展。這類智能體的痛點眾所周知:介面一改版,訓練時記住的元件位置與操作路徑就失效。生成式介面環境的想像空間在於,模型可以源源不絕地產生佈局各異的介面變體,讓智能體在「看過一千種長法」的環境裡學會通用的操作能力,而不是背下某一版的按鈕座標。需要說明的是,這段是依官方「訓練智能體的新方法」一語延伸的解讀,Runway 尚未公布具體訓練方法或數據。

同一個應用在三種不同佈局的介面卡片前,智能體沿路逐一適應的操作練習示意。
圖2 生成式介面可以不斷變換佈局,智能體在變動的環境裡練出通用操作能力,而不是記住單一版面的位置。

與 LLM 寫程式碼路線的對照

兩條路線的差異,最終沉澱為「拿到什麼」。LLM 路線交付的是原始碼:可以進版本控管、部署到正式環境、交給資安與法務審計;代價是畫面受限於元件庫與框架的表達能力,特殊的視覺效果仍要另寫程式。Solaris 交付的是行為:畫面看起來對、點了會回應,但沒有可提取的原始碼,也就沒有傳統意義上的後端邏輯與資料層。

這讓兩者更可能互補而非取代。需要快速驗證互動想法、做產品原型或客戶展示時,「畫出來的介面」成本極低,而且不受任何設計系統限制;要上線收款、串資料庫、通過稽核時,仍然需要工程師把行為落成程式碼。真正的變數在中間地帶:一旦生成介面足以承載真實資料的讀寫操作,軟體開發的分工就會被重新切一次。

對開發者與設計師的實際影響

對設計師,Solaris 意味著原型的高速公路:跳過靜態稿與來回標注,直接產出可點、可輸入、會回應的互動畫面,客戶看到的是行為而不是示意圖。對開發者,值得留意 Runway 既有的開發者平台與模型 API 路線——若 Solaris 日後以 API 形式釋出,介面生成會成為可編排的能力,而不是一次性的展示。對智能體團隊,它則是潛在的訓練資料與環境來源。

放回 Runway 自家的產品版圖,Solaris 與七月上線的〈Runway Agent Workflows〉指向同一個方向:從單次生成走向可編排的生產流程。差別在於 Workflows 組裝的是既有模型的能力,Solaris 生成的是互動環境本身。

限制與待追蹤:同名論文與未公布細節

三件事在現有公開資訊中特別值得記下。第一,Runway 這次沒有隨附技術報告或論文,「優於前沿 LLM」的說法沒有可回查的基準細節,後續應以正式技術文件為準。第二,名稱撞車:檢索 Solaris 與 world model,會先撞上紐約大學研究團隊 2026 年 2 月上傳的另一篇同名論文,那是在 Minecraft 中建立多人影片世界模型的計畫,與 Runway 的 Solaris 毫無關係,引用時務必分清。第三,目前所有公開資訊都來自官方公告頁與官方社群,尚無第三方的獨立實測。

值得追蹤的指標因此很明確:技術報告何時發布、示範的介面能否被第三方重現、智能體訓練的實證數據,以及 Solaris 進入 Runway 產品線與 API 的時間點。在這些訊號出現之前,它是一個方向感極強的研究宣言——世界模型的下一個戰場,可能是螢幕上的視窗。