DAIR.AI 的 Elvis Saravia 提出以「任務」取代單一提示詞作為互動單元,整合語音、螢幕、文字與標註等多模態訊號一次交付完整上下文,降低智能體的反覆修正成本。

提示詞之後的互動單元

DAIR.AI 共同創辦人 Elvis Saravia 在 X 發表〈What Comes After the Prompt〉,提出以「任務」(task)作為比單一提示詞更大的互動單元。一個任務會在一次互動中,把指令與盡可能完整的相關上下文一起交給智能體,內容可涵蓋較長的語音說明、當前螢幕畫面、精確文字、標註、轉錄稿與影像。他將此構想歸功於 Andrej Karpathy 近期關於「長語音會話作為提示詞」的討論,並進一步用更多模態延伸該思路。

Saravia 為每種模態劃分角色:語音承載推理過程、優先順序與不確定性,螢幕給出當前狀態與環境,標註將注意力引導到具體細節,文字則保留精確需求、名稱與約束。這些訊號共同為模型提供更豐富的工作表徵。

前端載入上下文降低修正循環

實務上,Saravia 會在講解工作時錄下語音筆記、截取相關畫面、用快速標註標記,再貼上智能體所需的精確文字,把原本要分多次提供的上下文一次性前置載入。他指出,更豐富的任務減少了重複來回——那種得反覆說明脈絡、指出同樣細節、或糾正原本可從一開始就避免的假設的情況。

他舉例,在一個自己不熟悉的平台上排程發布時,以語音說明目標與約束、共享排程頁面螢幕並標註關鍵欄位,智能體就能一次完成設定,過去常見的後續追問不再出現。這類方法對 browser use 與 computer use 尤其適用,因為智能體可同時看見環境、聽見推理過程、跟隨標註、再用文字取得精確細節。

Saravia 強調,簡單請求仍應使用簡單提示詞;只有任務運行時間長、精度要求高、需導航陌生介面,或錯誤會導致多輪修正時,他才會動用更豐富的多模態任務。多模態任務因包含更多上下文而成本較高,但根據他的經驗,這筆投入通常值得。

從任務軌跡到可複用技能

除了當下的效率,Saravia 會把這些任務的執行軌跡儲存下來,從中檢視重複出現的模式,例如動作序列、反覆強調的約束、品質檢查與能穩定改善結果的修正。這些模式可被萃取為可複用技能,讓下一個智能體從更強的工作流程起步,也讓自動化的判斷有據可循:哪些部分可穩定自動化、哪些仍需人類介入。

他預期,原生支援語音、視覺、影像與文字的全模態(omnimodal)模型,會讓這種互動風格變得自然,使用者在同一個會話中可同時說話、展示、指點、打字與提供範例。Saravia 透過 DAIR.AI 學院持續分享相關實作。「任務」這個名稱是暫時性的,但核心主張已透過反覆使用變得清晰:給智能體更豐富的工作軌跡、讓它重建意圖、儲存過程、並複用有效的模式。若要比較把長跨度軌跡轉成自我驗證循環的研究路線,可延伸閱讀〈AREX 遞迴自改進研究代理〉。