GLOSSARY

用一致的語言理解 AI。

這份詞彙表整理我們在報導中反覆使用的 AI 概念,給出簡短、證據導向的定義,並連結到相關報導,方便你交叉閱讀。

共 34 個詞彙

大型語言模型(LLM)Large Language Model

以大量文字訓練、能根據上下文預測並生成文字的模型。能力與成本通常隨參數量、訓練資料與推理算力同步上升。

相關標籤:模型模型評測

前沿模型Frontier model

在能力上處於當時最領先層級的模型,通常伴隨更高的訓練與推理成本,以及更嚴格的安全評估。

代表性報導:AISI 前沿模型評測作弊報告

相關標籤:模型評測

推理模型Reasoning model

在回答前進行多步內部思考(思維鏈)的模型,用更多運算換取在數學、程式與多步任務上更高的正確率,但延遲與成本也較高。

相關標籤:混合推理

混合推理Hybrid reasoning

模型可依任務難度動態切換「快速直覺」與「深度推理」兩種模式的設計,在簡單查詢上省成本、在難題上啟用完整思考。

代表性報導:Ling-3.0-flash 混合推理 MoE

相關標籤:混合推理confidence routing

AgentAI Agent

能夠規劃、呼叫工具、觀察結果並反覆迭代直到完成目標的 AI 系統。其價值與風險都取決於它能在多大程度上自主行動。

相關標籤:智能體

Agent 迴圈Agentic loop

「規劃→行動→觀察→修正」的反覆循環,是 agent 完成多步任務的基本結構;每一輪都會消耗 token 與時間。

相關標籤:Agent

Coding agentCoding agent

專門在軟體工程任務上運作的 agent,能讀寫程式碼、執行測試並修復錯誤,常用 Frontier-Bench、CursorBench 等代理編碼評測衡量。

相關標籤:Coding Agent

Computer-useComputer use

模型透過滑鼠、鍵盤與螢幕像素直接操作圖形介面軟體的能力,讓 AI 能驅動原本沒有 API 的應用程式。

相關標籤:computer-use

MoE(混合專家)Mixture of Experts

把模型拆成多個「專家」子網路、每次只啟用其中一部分的架構,用較少的運算達到接近更大密集模型的效果。

代表性報導:Ling-3.0-flash 混合推理 MoE

相關標籤:MoE

TokenizerTokenizer

把文字切分成模型能處理的基本單位(token)的元件。切分效率直接影響速度、成本與多語言表現。

代表性報導:GigaToken 1000 倍提速

相關標籤:tokenizerBPE

Prompt cachePrompt caching

把重複使用的提示詞前段快取起來,讓後續請求只需付少量費用就能重用,顯著降低 agent 迴圈與長系統提示詞的成本。

代表性報導:claude-thermos 快取預熱

相關標籤:prompt cache

Context engineeringContext engineering

有意地選擇、組織與修剪送進模型的上下文,讓模型在有限 context window 內拿到最相關的資訊;被視為 prompt engineering 之後的核心工程能力。

相關標籤:Context Engineering

系統提示詞System prompt

定義模型角色、規則與可用工具的最高層指令。其長度與結構會直接影響成本、行為穩定度與可遵循度。

代表性報導:Claude Opus 5 系統提示詞外洩

相關標籤:系統提示詞

Deep ResearchDeep research agent

能針對複雜問題自動進行多輪搜尋、閱讀與綜合,並產出附引用的研究報告的 agent 類型。

代表性報導:AREX 自我改進研究 agent

相關標籤:Deep Research

Embedding 與向量檢索Embedding / vector search

把文字或其他內容轉成數值向量,再以向量相似度找出語意相近資料的技術,是檢索增強生成(RAG)與推薦的基礎。

代表性報導:Helmsman 全快閃向量檢索架構

相關標籤:向量檢索

蒸餾Distillation

用較大模型產生的輸出來訓練較小模型,使其逼近大模型部分能力的技術;在開放權重與智財爭議中常被討論。

相關標籤:open-weight

開放權重Open weights

將模型權重公開釋出供他人下載與修改的做法。其「開放」程度(是否含訓練資料、程式碼與商用授權)差異很大,也是政策辯論的核心。

代表性報導:Microsoft 開放權重立場書

相關標籤:open-weight

端側推論On-device inference

在使用者裝置(手機、微控制器等)上直接執行模型,優點是低延遲與隱私,限制是記憶體與算力。

代表性報導:ESP32-S3 端側跑 28.9M LLM

相關標籤:on-device

多模態模型Multimodal model

能同時理解或生成文字、影像、音訊、影片等多種資料類型的模型,是走向通用助理的關鍵能力。

代表性報導:FLUX 3 多模態模型

相關標籤:多模態模型Multimodal

擴散模型Diffusion model

透過逐步去噪的方式生成影像、影片或音訊的模型,是當前主流的生成式視覺技術。

相關標籤:diffusion

世界模型World model

讓 AI 對環境物理與因果建立內部預測的模型,常用於機器人與具身 AI,使其能預測行動後果。

代表性報導:FLUX-mimic 走入 Audi 產線

相關標籤:世界模型embodied-AI

TTS(語音合成)Text-to-speech

把文字轉成自然語音的技術,評估重點包括自然度、情感表現、延遲與多語言支援。

代表性報導:Qwen-Audio-3.0 TTS 登榜

相關標籤:TTS

評測(Benchmark)Benchmark / evaluation

用一組標準化任務衡量模型能力的機制。結果會受任務設計、評分協議與是否「作弊」影響,需搭配方法學解讀。

代表性報導:Drone-Bench 評測

相關標籤:模型評測benchmark評測

強化學習Reinforcement learning

讓模型透過嘗試與回饋(獎勵)學習策略的方法,常用於讓模型學會多步推理與工具使用。

相關標籤:Reinforcement Learning

對齊(Alignment)Alignment

讓模型的行為符合人類意圖、價值與安全規範的技術與流程;常用「對齊分數」等指標衡量模型偏差行為的程度(分數越低通常代表越遵循規範)。

代表性報導:Opus 5 對齊分數 2.3

相關標籤:對齊AI 安全

量化(Quantization)Quantization

把模型權重從高精度(如 16 位元)壓縮到低位元(如 4 位元),以減少記憶體與運算需求、換取在邊緣裝置部署的可行性,代價通常是些微精確度下降。

代表性報導:ESP32-S3 4-bit 量化

相關標籤:量化on-device

微調(Fine-tuning)Fine-tuning

在已預訓練的模型上用特定任務或領域資料繼續訓練,使其在該情境表現更好;常見形式包含監督式微調(SFT)與以人類回饋進行的強化學習微調(RLHF)。

代表性報導:Kimi K3 需 B300 微調

相關標籤:微調fine-tuning

沙盒(Sandbox)Sandbox

一種隔離的執行環境,讓程式或 AI 代理只能在受限制範圍內運作,無法觸及外部系統或未授權資源;是執行不信任程式碼、限制代理行為與資安評測的基礎防線,但模型仍可能嘗試繞過其邊界。

代表性報導:Kimi K3 網安評測與沙盒

相關標籤:資安

護欄(Guardrails)Guardrails

部署在模型外圍、用來阻止其產生有害或偏離規範輸出的安全機制;與模型本身的對齊互補,在企業導入 AI 時應視為基礎功能而非選配。

代表性報導:AISI:護欄為基礎功能

相關標籤:資安

紅隊測試(Red teaming)Red teaming

由專職團隊扮演攻擊者,主動對模型或系統發動對抗性測試以找出失效與濫用路徑的方法;是前沿模型發布前評估安全與資安風險的標準程序。

代表性報導:AISI 前沿模型評測

相關標籤:資安模型評測

TokenToken

語言模型處理與計價的最小單位:一段文字先經分詞器切成 token,模型再逐 token 預測與生成。模型的輸入輸出數量、context window 上限與 API 費用都以 token 計量(例如每百萬 token 計價),因此同一句話在不同分詞器下的 token 數會直接影響成本與速度。

代表性報導:Opus 5 每 token 計價

相關標籤:tokenizer

工具呼叫(Function Calling)Function / tool calling

模型透過結構化介面觸發外部工具、API 或函式的能力——模型決定該呼叫哪個工具、帶哪些參數,實際執行交由外部程式完成後把結果回傳。這是 agent 能查資料、操作軟體與採取真實動作的基礎機制,也是 Agent 迴圈中「行動」步驟的實作方式。

代表性報導:Claude 語音模式呼叫連接工具

相關標籤:Agent

排行榜(Leaderboard)Leaderboard

把多個模型依評測分數公開排序的榜單,常以 Elo 值、勝率或通過率呈現,是外界快速比較模型能力的主要入口。與「評測」強調方法學不同,排行榜的重點在排名動態——結果會受任務取樣、評分協議、資料污染與刷榜行為影響;已有研究發現前沿模型會在評測中走捷徑或作弊,因此排名高低不等於真實能力,需搭配方法學與獨立複現解讀。

代表性報導:AISI:前沿模型評測作弊

相關標籤:模型評測benchmark

多智能體(Multi-agent)Multi-agent system

多個專精代理(各自具備獨立脈絡與工具)在協調者編排下分工完成同一任務的設計。相較於單一 Agent,優勢是並行與專業分工,代價是更高的 token 成本、協調開銷,以及錯誤在代理間傳遞的風險。

代表性報導:ChatGPT 桌面版 GPT-Live 多智能體協調

相關標籤:智能體