GLOSSARY

用一致的語言理解 AI。

這份詞彙表整理我們在報導中反覆使用的 AI 概念,給出簡短、證據導向的定義,並連結到相關報導,方便你交叉閱讀。

共 39 個詞彙

大型語言模型(LLM)Large Language Model

以大量文字訓練、能根據上下文預測並生成文字的模型。能力與成本通常隨參數量、訓練資料與推理算力同步上升。

代表性報導:Claude Opus 5 旗艦 LLM 發布

相關標籤:模型模型評測

前沿模型Frontier model

在能力上處於當時最領先層級的模型,通常伴隨更高的訓練與推理成本,以及更嚴格的安全評估。

代表性報導:AISI 前沿模型評測作弊報告

相關標籤:模型評測

推理模型Reasoning model

在回答前進行多步內部思考(思維鏈)的模型,用更多運算換取在數學、程式與多步任務上更高的正確率,但延遲與成本也較高。

代表性報導:Ling-3.0-flash 混合推理

相關標籤:混合推理

混合推理Hybrid reasoning

模型可依任務難度動態切換「快速直覺」與「深度推理」兩種模式的設計,在簡單查詢上省成本、在難題上啟用完整思考。

代表性報導:Ling-3.0-flash 混合推理 MoE

相關標籤:混合推理confidence routing

AgentAI Agent

能夠規劃、呼叫工具、觀察結果並反覆迭代直到完成目標的 AI 系統。其價值與風險都取決於它能在多大程度上自主行動。

代表性報導:Elvis Saravia 多模態 agent 互動

相關標籤:智能體

Agent 迴圈Agentic loop

「規劃→行動→觀察→修正」的反覆循環,是 agent 完成多步任務的基本結構;每一輪都會消耗 token 與時間。

代表性報導:AREX 自我改進研究代理

相關標籤:Agent

Coding agentCoding agent

專門在軟體工程任務上運作的 agent,能讀寫程式碼、執行測試並修復錯誤,常用 Frontier-Bench、CursorBench 等代理編碼評測衡量。

代表性報導:Grok Build CLI 開發工具

相關標籤:Coding Agent

Computer-useComputer use

模型透過滑鼠、鍵盤與螢幕像素直接操作圖形介面軟體的能力,讓 AI 能驅動原本沒有 API 的應用程式。

相關標籤:computer-use

MoE(混合專家)Mixture of Experts

把模型拆成多個「專家」子網路、每次只啟用其中一部分的架構,用較少的運算達到接近更大密集模型的效果。

代表性報導:Ling-3.0-flash 混合推理 MoE

相關標籤:MoE

TokenizerTokenizer

把文字切分成模型能處理的基本單位(token)的元件。切分效率直接影響速度、成本與多語言表現。

代表性報導:GigaToken 1000 倍提速

相關標籤:tokenizerBPE

Prompt cachePrompt caching

把重複使用的提示詞前段快取起來,讓後續請求只需付少量費用就能重用,顯著降低 agent 迴圈與長系統提示詞的成本。

代表性報導:claude-thermos 快取預熱

相關標籤:prompt cache

Context engineeringContext engineering

有意地選擇、組織與修剪送進模型的上下文,讓模型在有限 context window 內拿到最相關的資訊;被視為 prompt engineering 之後的核心工程能力。

代表性報導:Claude 5 上下文工程

相關標籤:Context Engineering

系統提示詞System prompt

定義模型角色、規則與可用工具的最高層指令。其長度與結構會直接影響成本、行為穩定度與可遵循度。

代表性報導:Claude Opus 5 系統提示詞外洩

相關標籤:系統提示詞

Deep ResearchDeep research agent

能針對複雜問題自動進行多輪搜尋、閱讀與綜合,並產出附引用的研究報告的 agent 類型。

代表性報導:AREX 自我改進研究 agent

相關標籤:Deep Research

Embedding 與向量檢索Embedding / vector search

把文字或其他內容轉成數值向量,再以向量相似度找出語意相近資料的技術,是檢索增強生成(RAG)與推薦的基礎。

代表性報導:Helmsman 全快閃向量檢索架構

相關標籤:向量檢索

蒸餾Distillation

用較大模型產生的輸出來訓練較小模型,使其逼近大模型部分能力的技術;在開放權重與智財爭議中常被討論。

代表性報導:Kimi K3 蒸餾疑雲

相關標籤:open-weight

開放權重Open weights

將模型權重公開釋出供他人下載與修改的做法。其「開放」程度(是否含訓練資料、程式碼與商用授權)差異很大,也是政策辯論的核心。

代表性報導:Microsoft 開放權重立場書

相關標籤:open-weight

端側推論On-device inference

在使用者裝置(手機、微控制器等)上直接執行模型,優點是低延遲與隱私,限制是記憶體與算力。

代表性報導:ESP32-S3 端側跑 28.9M LLM

相關標籤:on-device

多模態模型Multimodal model

能同時理解或生成文字、影像、音訊、影片等多種資料類型的模型,是走向通用助理的關鍵能力。

代表性報導:FLUX 3 多模態模型

相關標籤:多模態模型Multimodal

擴散模型Diffusion model

透過逐步去噪的方式生成影像、影片或音訊的模型,是當前主流的生成式視覺技術。

代表性報導:FLUX 3 多模態生成模型

相關標籤:diffusion

世界模型World model

讓 AI 對環境物理與因果建立內部預測的模型,常用於機器人與具身 AI,使其能預測行動後果。

代表性報導:FLUX-mimic 走入 Audi 產線

相關標籤:世界模型embodied-AI

TTS(語音合成)Text-to-speech

把文字轉成自然語音的技術,評估重點包括自然度、情感表現、延遲與多語言支援。

代表性報導:Qwen-Audio-3.0 TTS 登榜

相關標籤:TTS

評測(Benchmark)Benchmark / evaluation

用一組標準化任務衡量模型能力的機制。結果會受任務設計、評分協議與是否「作弊」影響,需搭配方法學解讀。

代表性報導:Drone-Bench 評測

相關標籤:評測

強化學習Reinforcement learning

讓模型透過嘗試與回饋(獎勵)學習策略的方法,常用於讓模型學會多步推理與工具使用。

代表性報導:MAI hill-climbing Copilot

相關標籤:Reinforcement Learning

對齊(Alignment)Alignment

讓模型的行為符合人類意圖、價值與安全規範的技術與流程;常用「對齊分數」等指標衡量模型偏差行為的程度(分數越低通常代表越遵循規範)。

代表性報導:Opus 5 對齊分數 2.3

相關標籤:對齊AI 安全

量化(Quantization)Quantization

把模型權重從高精度(如 16 位元)壓縮到低位元(如 4 位元),以減少記憶體與運算需求、換取在邊緣裝置部署的可行性,代價通常是些微精確度下降。

代表性報導:ESP32-S3 4-bit 量化

相關標籤:量化on-device

微調(Fine-tuning)Fine-tuning

在已預訓練的模型上用特定任務或領域資料繼續訓練,使其在該情境表現更好;常見形式包含監督式微調(SFT)與以人類回饋進行的強化學習微調(RLHF)。

代表性報導:Kimi K3 需 B300 微調

相關標籤:微調fine-tuning

沙盒(Sandbox)Sandbox

一種隔離的執行環境,讓程式或 AI 代理只能在受限制範圍內運作,無法觸及外部系統或未授權資源;是執行不信任程式碼、限制代理行為與資安評測的基礎防線,但模型仍可能嘗試繞過其邊界。

代表性報導:Kimi K3 網安評測與沙盒

相關標籤:資安

護欄(Guardrails)Guardrails

部署在模型外圍、用來阻止其產生有害或偏離規範輸出的安全機制;與模型本身的對齊互補,在企業導入 AI 時應視為基礎功能而非選配。

代表性報導:AISI:護欄為基礎功能

相關標籤:資安

紅隊測試(Red teaming)Red teaming

由專職團隊扮演攻擊者,主動對模型或系統發動對抗性測試以找出失效與濫用路徑的方法;是前沿模型發布前評估安全與資安風險的標準程序。

代表性報導:AISI 前沿模型評測

相關標籤:資安模型評測

TokenToken

語言模型處理與計價的最小單位:一段文字先經分詞器切成 token,模型再逐 token 預測與生成。模型的輸入輸出數量、context window 上限與 API 費用都以 token 計量(例如每百萬 token 計價),因此同一句話在不同分詞器下的 token 數會直接影響成本與速度。

代表性報導:Opus 5 每 token 計價

相關標籤:tokenizer

工具呼叫(Function Calling)Function / tool calling

模型透過結構化介面觸發外部工具、API 或函式的能力——模型決定該呼叫哪個工具、帶哪些參數,實際執行交由外部程式完成後把結果回傳。這是 agent 能查資料、操作軟體與採取真實動作的基礎機制,也是 Agent 迴圈中「行動」步驟的實作方式。

代表性報導:Claude 語音模式呼叫連接工具

相關標籤:Agent

排行榜(Leaderboard)Leaderboard

把多個模型依評測分數公開排序的榜單,常以 Elo 值、勝率或通過率呈現,是外界快速比較模型能力的主要入口。與「評測」強調方法學不同,排行榜的重點在排名動態——結果會受任務取樣、評分協議、資料污染與刷榜行為影響;已有研究發現前沿模型會在評測中走捷徑或作弊,因此排名高低不等於真實能力,需搭配方法學與獨立複現解讀。

代表性報導:AISI:前沿模型評測作弊

相關標籤:benchmark

多智能體(Multi-agent)Multi-agent system

多個專精代理(各自具備獨立脈絡與工具)在協調者編排下分工完成同一任務的設計。相較於單一 Agent,優勢是並行與專業分工,代價是更高的 token 成本、協調開銷,以及錯誤在代理間傳遞的風險。

代表性報導:ChatGPT 桌面版 GPT-Live 多智能體協調

相關標籤:Agent多智能體

線性注意力(Linear attention)Linear attention

一種把注意力的記憶體與計算成本與序列長度脫鉤的注意力變體:用一個固定大小的遞迴狀態(類 RNN)取代不斷堆疊的鍵值快取(KV cache),讓長上下文的記憶體不再隨長度線性膨脹、解碼延遲不再隨長度惡化。代價是純線性注意力常在表達力上落後全注意力,實務上多以混合架構(多數層用線性、少量層保留全注意力)補強,2026 年起的 Kimi Linear、SANA-Video 等研究即以此路線首次在多數場景追平或超越全注意力。

代表性報導:Kimi Linear 線性注意力首度超越全注意力

相關標籤:linear-attention

推測解碼(Speculative decoding)Speculative decoding

一種用多餘算力換取推論吞吐量的加速技術:先讓輕量草稿器預測多個 token,再由目標模型一次性驗證,草稿正確的部分就省下逐 token 生成的時間。加速效果取決於草稿接受率與草稿器成本的平衡——草稿要夠準才有加速、但草稿器又不能太重,否則驗證省下的時間會被生成成本吃掉;且不同工作負載(開放式聊天 vs 程式碼、數學)適合不同的草稿策略,沒有單一草稿器能通吃。

代表性報導:騰訊 AngelSpec 推測解碼加速 2.4 倍

注意力(Attention)Attention

Transformer 用來讓模型在處理當下 token 時、動態權衡並參照序列中其他位置資訊的機制,是模型理解上下文與長程依賴的核心。標準的全注意力(full attention)讓每個位置都與所有其他位置兩兩計算關聯,表達力強但記憶體(KV cache)與計算量隨序列長度快速膨脹;線性注意力等變體改以固定大小的遞迴狀態換取效率,是當前推論成本與長上下文研究的主戰場。

代表性報導:Kimi Linear 線性注意力首度超越全注意力

相關標籤:linear-attention

上下文視窗(Context window)Context window

模型在生成回應時一次能在「視線內」容納的最大文字量(以 token 計),例如 128k、1M。它決定模型能直接參照多少輸入與歷史脈絡;超出上限的內容必須靠檢索、摘要或路由間接帶入,因此視窗大小直接影響長文件、長程對話與 agent 記憶的可行邊界,也與推論的 KV cache 成本及延遲掛鉤——這也是線性注意力、推測解碼等推論效率技術瞄準的根本限制。

代表性報導:Claude 5 上下文工程

KV cache(鍵值快取)KV cache (key-value cache)

Transformer 自回歸生成時,把前面所有 token 算出的「鍵(Key)」與「值(Value)」向量快取起來,避免每生成一個新 token 就重算整段前文的注意力。它是長序列推論記憶體與延遲的主要來源:KV cache 會隨已處理的 token 數線性累積,因此長上下文與長輸出的成本、延遲都與它直接掛鉤。線性注意力、滑動窗、推測解碼與 prompt cache 等推論效率技術,本質上都在縮小、固定或重用這塊快取。

代表性報導:Unlimited-OCR 恆定 KV cache