用一致的語言理解 AI。
這份詞彙表整理我們在報導中反覆使用的 AI 概念,給出簡短、證據導向的定義,並連結到相關報導,方便你交叉閱讀。
共 34 個詞彙
- 大型語言模型(LLM)Large Language Model
以大量文字訓練、能根據上下文預測並生成文字的模型。能力與成本通常隨參數量、訓練資料與推理算力同步上升。
- 前沿模型Frontier model
在能力上處於當時最領先層級的模型,通常伴隨更高的訓練與推理成本,以及更嚴格的安全評估。
- 推理模型Reasoning model
在回答前進行多步內部思考(思維鏈)的模型,用更多運算換取在數學、程式與多步任務上更高的正確率,但延遲與成本也較高。
- 混合推理Hybrid reasoning
模型可依任務難度動態切換「快速直覺」與「深度推理」兩種模式的設計,在簡單查詢上省成本、在難題上啟用完整思考。
- AgentAI Agent
能夠規劃、呼叫工具、觀察結果並反覆迭代直到完成目標的 AI 系統。其價值與風險都取決於它能在多大程度上自主行動。
- Agent 迴圈Agentic loop
「規劃→行動→觀察→修正」的反覆循環,是 agent 完成多步任務的基本結構;每一輪都會消耗 token 與時間。
- Coding agentCoding agent
專門在軟體工程任務上運作的 agent,能讀寫程式碼、執行測試並修復錯誤,常用 Frontier-Bench、CursorBench 等代理編碼評測衡量。
- Computer-useComputer use
模型透過滑鼠、鍵盤與螢幕像素直接操作圖形介面軟體的能力,讓 AI 能驅動原本沒有 API 的應用程式。
- MoE(混合專家)Mixture of Experts
把模型拆成多個「專家」子網路、每次只啟用其中一部分的架構,用較少的運算達到接近更大密集模型的效果。
- TokenizerTokenizer
把文字切分成模型能處理的基本單位(token)的元件。切分效率直接影響速度、成本與多語言表現。
- Prompt cachePrompt caching
把重複使用的提示詞前段快取起來,讓後續請求只需付少量費用就能重用,顯著降低 agent 迴圈與長系統提示詞的成本。
- Context engineeringContext engineering
有意地選擇、組織與修剪送進模型的上下文,讓模型在有限 context window 內拿到最相關的資訊;被視為 prompt engineering 之後的核心工程能力。
- 系統提示詞System prompt
定義模型角色、規則與可用工具的最高層指令。其長度與結構會直接影響成本、行為穩定度與可遵循度。
- Deep ResearchDeep research agent
能針對複雜問題自動進行多輪搜尋、閱讀與綜合,並產出附引用的研究報告的 agent 類型。
- Embedding 與向量檢索Embedding / vector search
把文字或其他內容轉成數值向量,再以向量相似度找出語意相近資料的技術,是檢索增強生成(RAG)與推薦的基礎。
- 蒸餾Distillation
用較大模型產生的輸出來訓練較小模型,使其逼近大模型部分能力的技術;在開放權重與智財爭議中常被討論。
- 開放權重Open weights
將模型權重公開釋出供他人下載與修改的做法。其「開放」程度(是否含訓練資料、程式碼與商用授權)差異很大,也是政策辯論的核心。
- 端側推論On-device inference
在使用者裝置(手機、微控制器等)上直接執行模型,優點是低延遲與隱私,限制是記憶體與算力。
- 多模態模型Multimodal model
能同時理解或生成文字、影像、音訊、影片等多種資料類型的模型,是走向通用助理的關鍵能力。
- 擴散模型Diffusion model
透過逐步去噪的方式生成影像、影片或音訊的模型,是當前主流的生成式視覺技術。
- 世界模型World model
讓 AI 對環境物理與因果建立內部預測的模型,常用於機器人與具身 AI,使其能預測行動後果。
- TTS(語音合成)Text-to-speech
把文字轉成自然語音的技術,評估重點包括自然度、情感表現、延遲與多語言支援。
- 評測(Benchmark)Benchmark / evaluation
用一組標準化任務衡量模型能力的機制。結果會受任務設計、評分協議與是否「作弊」影響,需搭配方法學解讀。
- 強化學習Reinforcement learning
讓模型透過嘗試與回饋(獎勵)學習策略的方法,常用於讓模型學會多步推理與工具使用。
- 對齊(Alignment)Alignment
讓模型的行為符合人類意圖、價值與安全規範的技術與流程;常用「對齊分數」等指標衡量模型偏差行為的程度(分數越低通常代表越遵循規範)。
- 量化(Quantization)Quantization
把模型權重從高精度(如 16 位元)壓縮到低位元(如 4 位元),以減少記憶體與運算需求、換取在邊緣裝置部署的可行性,代價通常是些微精確度下降。
- 微調(Fine-tuning)Fine-tuning
在已預訓練的模型上用特定任務或領域資料繼續訓練,使其在該情境表現更好;常見形式包含監督式微調(SFT)與以人類回饋進行的強化學習微調(RLHF)。
- 沙盒(Sandbox)Sandbox
一種隔離的執行環境,讓程式或 AI 代理只能在受限制範圍內運作,無法觸及外部系統或未授權資源;是執行不信任程式碼、限制代理行為與資安評測的基礎防線,但模型仍可能嘗試繞過其邊界。
- 護欄(Guardrails)Guardrails
部署在模型外圍、用來阻止其產生有害或偏離規範輸出的安全機制;與模型本身的對齊互補,在企業導入 AI 時應視為基礎功能而非選配。
- 紅隊測試(Red teaming)Red teaming
由專職團隊扮演攻擊者,主動對模型或系統發動對抗性測試以找出失效與濫用路徑的方法;是前沿模型發布前評估安全與資安風險的標準程序。
- TokenToken
語言模型處理與計價的最小單位:一段文字先經分詞器切成 token,模型再逐 token 預測與生成。模型的輸入輸出數量、context window 上限與 API 費用都以 token 計量(例如每百萬 token 計價),因此同一句話在不同分詞器下的 token 數會直接影響成本與速度。
- 工具呼叫(Function Calling)Function / tool calling
模型透過結構化介面觸發外部工具、API 或函式的能力——模型決定該呼叫哪個工具、帶哪些參數,實際執行交由外部程式完成後把結果回傳。這是 agent 能查資料、操作軟體與採取真實動作的基礎機制,也是 Agent 迴圈中「行動」步驟的實作方式。
- 排行榜(Leaderboard)Leaderboard
把多個模型依評測分數公開排序的榜單,常以 Elo 值、勝率或通過率呈現,是外界快速比較模型能力的主要入口。與「評測」強調方法學不同,排行榜的重點在排名動態——結果會受任務取樣、評分協議、資料污染與刷榜行為影響;已有研究發現前沿模型會在評測中走捷徑或作弊,因此排名高低不等於真實能力,需搭配方法學與獨立複現解讀。
- 多智能體(Multi-agent)Multi-agent system
多個專精代理(各自具備獨立脈絡與工具)在協調者編排下分工完成同一任務的設計。相較於單一 Agent,優勢是並行與專業分工,代價是更高的 token 成本、協調開銷,以及錯誤在代理間傳遞的風險。