用一致的語言理解 AI。
這份詞彙表整理我們在報導中反覆使用的 AI 概念,給出簡短、證據導向的定義,並連結到相關報導,方便你交叉閱讀。
共 39 個詞彙
- 大型語言模型(LLM)Large Language Model
以大量文字訓練、能根據上下文預測並生成文字的模型。能力與成本通常隨參數量、訓練資料與推理算力同步上升。
- 前沿模型Frontier model
在能力上處於當時最領先層級的模型,通常伴隨更高的訓練與推理成本,以及更嚴格的安全評估。
- 推理模型Reasoning model
在回答前進行多步內部思考(思維鏈)的模型,用更多運算換取在數學、程式與多步任務上更高的正確率,但延遲與成本也較高。
- 混合推理Hybrid reasoning
模型可依任務難度動態切換「快速直覺」與「深度推理」兩種模式的設計,在簡單查詢上省成本、在難題上啟用完整思考。
- AgentAI Agent
能夠規劃、呼叫工具、觀察結果並反覆迭代直到完成目標的 AI 系統。其價值與風險都取決於它能在多大程度上自主行動。
- Agent 迴圈Agentic loop
「規劃→行動→觀察→修正」的反覆循環,是 agent 完成多步任務的基本結構;每一輪都會消耗 token 與時間。
- Coding agentCoding agent
專門在軟體工程任務上運作的 agent,能讀寫程式碼、執行測試並修復錯誤,常用 Frontier-Bench、CursorBench 等代理編碼評測衡量。
- Computer-useComputer use
模型透過滑鼠、鍵盤與螢幕像素直接操作圖形介面軟體的能力,讓 AI 能驅動原本沒有 API 的應用程式。
- MoE(混合專家)Mixture of Experts
把模型拆成多個「專家」子網路、每次只啟用其中一部分的架構,用較少的運算達到接近更大密集模型的效果。
- TokenizerTokenizer
把文字切分成模型能處理的基本單位(token)的元件。切分效率直接影響速度、成本與多語言表現。
- Prompt cachePrompt caching
把重複使用的提示詞前段快取起來,讓後續請求只需付少量費用就能重用,顯著降低 agent 迴圈與長系統提示詞的成本。
- Context engineeringContext engineering
有意地選擇、組織與修剪送進模型的上下文,讓模型在有限 context window 內拿到最相關的資訊;被視為 prompt engineering 之後的核心工程能力。
- 系統提示詞System prompt
定義模型角色、規則與可用工具的最高層指令。其長度與結構會直接影響成本、行為穩定度與可遵循度。
- Deep ResearchDeep research agent
能針對複雜問題自動進行多輪搜尋、閱讀與綜合,並產出附引用的研究報告的 agent 類型。
- Embedding 與向量檢索Embedding / vector search
把文字或其他內容轉成數值向量,再以向量相似度找出語意相近資料的技術,是檢索增強生成(RAG)與推薦的基礎。
- 蒸餾Distillation
用較大模型產生的輸出來訓練較小模型,使其逼近大模型部分能力的技術;在開放權重與智財爭議中常被討論。
- 開放權重Open weights
將模型權重公開釋出供他人下載與修改的做法。其「開放」程度(是否含訓練資料、程式碼與商用授權)差異很大,也是政策辯論的核心。
- 端側推論On-device inference
在使用者裝置(手機、微控制器等)上直接執行模型,優點是低延遲與隱私,限制是記憶體與算力。
- 多模態模型Multimodal model
能同時理解或生成文字、影像、音訊、影片等多種資料類型的模型,是走向通用助理的關鍵能力。
- 擴散模型Diffusion model
透過逐步去噪的方式生成影像、影片或音訊的模型,是當前主流的生成式視覺技術。
- 世界模型World model
讓 AI 對環境物理與因果建立內部預測的模型,常用於機器人與具身 AI,使其能預測行動後果。
- TTS(語音合成)Text-to-speech
把文字轉成自然語音的技術,評估重點包括自然度、情感表現、延遲與多語言支援。
- 評測(Benchmark)Benchmark / evaluation
用一組標準化任務衡量模型能力的機制。結果會受任務設計、評分協議與是否「作弊」影響,需搭配方法學解讀。
- 強化學習Reinforcement learning
讓模型透過嘗試與回饋(獎勵)學習策略的方法,常用於讓模型學會多步推理與工具使用。
- 對齊(Alignment)Alignment
讓模型的行為符合人類意圖、價值與安全規範的技術與流程;常用「對齊分數」等指標衡量模型偏差行為的程度(分數越低通常代表越遵循規範)。
- 量化(Quantization)Quantization
把模型權重從高精度(如 16 位元)壓縮到低位元(如 4 位元),以減少記憶體與運算需求、換取在邊緣裝置部署的可行性,代價通常是些微精確度下降。
- 微調(Fine-tuning)Fine-tuning
在已預訓練的模型上用特定任務或領域資料繼續訓練,使其在該情境表現更好;常見形式包含監督式微調(SFT)與以人類回饋進行的強化學習微調(RLHF)。
- 沙盒(Sandbox)Sandbox
一種隔離的執行環境,讓程式或 AI 代理只能在受限制範圍內運作,無法觸及外部系統或未授權資源;是執行不信任程式碼、限制代理行為與資安評測的基礎防線,但模型仍可能嘗試繞過其邊界。
- 護欄(Guardrails)Guardrails
部署在模型外圍、用來阻止其產生有害或偏離規範輸出的安全機制;與模型本身的對齊互補,在企業導入 AI 時應視為基礎功能而非選配。
- 紅隊測試(Red teaming)Red teaming
由專職團隊扮演攻擊者,主動對模型或系統發動對抗性測試以找出失效與濫用路徑的方法;是前沿模型發布前評估安全與資安風險的標準程序。
- TokenToken
語言模型處理與計價的最小單位:一段文字先經分詞器切成 token,模型再逐 token 預測與生成。模型的輸入輸出數量、context window 上限與 API 費用都以 token 計量(例如每百萬 token 計價),因此同一句話在不同分詞器下的 token 數會直接影響成本與速度。
- 工具呼叫(Function Calling)Function / tool calling
模型透過結構化介面觸發外部工具、API 或函式的能力——模型決定該呼叫哪個工具、帶哪些參數,實際執行交由外部程式完成後把結果回傳。這是 agent 能查資料、操作軟體與採取真實動作的基礎機制,也是 Agent 迴圈中「行動」步驟的實作方式。
- 排行榜(Leaderboard)Leaderboard
把多個模型依評測分數公開排序的榜單,常以 Elo 值、勝率或通過率呈現,是外界快速比較模型能力的主要入口。與「評測」強調方法學不同,排行榜的重點在排名動態——結果會受任務取樣、評分協議、資料污染與刷榜行為影響;已有研究發現前沿模型會在評測中走捷徑或作弊,因此排名高低不等於真實能力,需搭配方法學與獨立複現解讀。
- 多智能體(Multi-agent)Multi-agent system
多個專精代理(各自具備獨立脈絡與工具)在協調者編排下分工完成同一任務的設計。相較於單一 Agent,優勢是並行與專業分工,代價是更高的 token 成本、協調開銷,以及錯誤在代理間傳遞的風險。
- 線性注意力(Linear attention)Linear attention
一種把注意力的記憶體與計算成本與序列長度脫鉤的注意力變體:用一個固定大小的遞迴狀態(類 RNN)取代不斷堆疊的鍵值快取(KV cache),讓長上下文的記憶體不再隨長度線性膨脹、解碼延遲不再隨長度惡化。代價是純線性注意力常在表達力上落後全注意力,實務上多以混合架構(多數層用線性、少量層保留全注意力)補強,2026 年起的 Kimi Linear、SANA-Video 等研究即以此路線首次在多數場景追平或超越全注意力。
- 推測解碼(Speculative decoding)Speculative decoding
一種用多餘算力換取推論吞吐量的加速技術:先讓輕量草稿器預測多個 token,再由目標模型一次性驗證,草稿正確的部分就省下逐 token 生成的時間。加速效果取決於草稿接受率與草稿器成本的平衡——草稿要夠準才有加速、但草稿器又不能太重,否則驗證省下的時間會被生成成本吃掉;且不同工作負載(開放式聊天 vs 程式碼、數學)適合不同的草稿策略,沒有單一草稿器能通吃。
- 注意力(Attention)Attention
Transformer 用來讓模型在處理當下 token 時、動態權衡並參照序列中其他位置資訊的機制,是模型理解上下文與長程依賴的核心。標準的全注意力(full attention)讓每個位置都與所有其他位置兩兩計算關聯,表達力強但記憶體(KV cache)與計算量隨序列長度快速膨脹;線性注意力等變體改以固定大小的遞迴狀態換取效率,是當前推論成本與長上下文研究的主戰場。
- 上下文視窗(Context window)Context window
模型在生成回應時一次能在「視線內」容納的最大文字量(以 token 計),例如 128k、1M。它決定模型能直接參照多少輸入與歷史脈絡;超出上限的內容必須靠檢索、摘要或路由間接帶入,因此視窗大小直接影響長文件、長程對話與 agent 記憶的可行邊界,也與推論的 KV cache 成本及延遲掛鉤——這也是線性注意力、推測解碼等推論效率技術瞄準的根本限制。
- KV cache(鍵值快取)KV cache (key-value cache)
Transformer 自回歸生成時,把前面所有 token 算出的「鍵(Key)」與「值(Value)」向量快取起來,避免每生成一個新 token 就重算整段前文的注意力。它是長序列推論記憶體與延遲的主要來源:KV cache 會隨已處理的 token 數線性累積,因此長上下文與長輸出的成本、延遲都與它直接掛鉤。線性注意力、滑動窗、推測解碼與 prompt cache 等推論效率技術,本質上都在縮小、固定或重用這塊快取。