AI Tokens
AI 詞元
AI Token (詞元) 是什麼?
AI Token 是人工智慧模型處理資料時使用的基本單位。文字、圖片、聲音或其他輸入資料,會先經過 Tokenization(Token 化),轉換成模型可以處理的一系列 Token。
以大型語言模型(LLM)為例,一個 Token 可能是一個完整單字、單字的一部分、標點符號或其他文字片段,因此 Token 並不等於一個字或單字。不同模型使用的 Tokenizer 不同,同一段內容產生的 Token 數量也可能有所差異。
當使用者輸入 Prompt 時,模型會先處理 Input Tokens,再於推論過程中產生 Output Tokens,最後轉換成使用者看到的回答。
為什麼 AI Token 很重要?
Token 數量會影響 AI 模型需要處理的資料量與運算需求,也是許多生成式 AI 服務衡量使用量與成本的方式。
大型語言模型的 Context Window(上下文視窗)通常以 Token 計算,代表模型一次可以處理多少資訊。Context Window 越大,可以容納更長的文章、更多對話或文件,但也需要更多運算與記憶體資源。
隨著推理模型與 Agentic AI 執行更長、更複雜的工作流程,單一任務可能處理更多 Token,而整體 AI 產生與處理的 Token 規模也持續快速成長。NVIDIA 執行長 Jensen Huang 在 GTC 2026 指出,近幾年 AI 運算需求已增加約 100 萬倍;Google 同年也宣布每月處理超過 3,200 兆 Token,較兩年前的 9.7 兆則成長超過 300 倍。因此,Token 吞吐量、延遲與成本也逐漸成為人工智慧推論的重要指標。
Tokenization 如何運作?
Tokenization 是將原始資料轉換成模型可處理 Token 的過程。以文字為例,Tokenizer 會依照模型使用的詞彙表與編碼規則拆分內容,再將每個 Token 對應到特定數值,供模型進行運算。
常見的單字可能只需要一個 Token,較長或較少見的詞則可能被拆成數個 Token。語言、標點符號、特殊字元與 Tokenizer 本身都會影響拆分結果,因此相同內容在不同模型中,不一定會產生相同的 Token 數量。
多模態 AI 模型也可以將圖片、聲音與影片轉換成模型可處理的 Token 或類似表示方式。
AI Token 數量如何計算與收費?
AI Token 沒有固定的字數換算公式,實際數量取決於模型使用的 Tokenizer、語言與內容。
生成式 AI 服務通常會區分 Input Tokens 與 Output Tokens。前者包含 Prompt、文件及其他提供給模型的上下文內容;後者則是模型產生的回答。部分服務還會另外計算 Cached Tokens,也就是可重複使用、無須重新完整處理的輸入內容,以及 Reasoning Tokens,指模型在產生答案前用於內部推理的 Token。實際分類與計價方式依供應商而異。
除了總 Token 數量,Tokens per Second(每秒 Token 數)可用來衡量生成速度;Time to First Token(TTFT)則代表系統收到請求後,到產生第一個 Token 所需的時間。對同時服務大量使用者的 AI 平台而言,這些指標會直接影響使用體驗與基礎設施效率。
技嘉的特色
隨著生成式 AI、推理模型與 Agentic AI 處理的 Token 數量持續增加,AI 推論平台除了 GPU 算力,也必須兼顧 CPU 運算、記憶體容量、資料傳輸、散熱與能源效率。
GPU 適合執行大型語言模型與多模態模型等高度平行化的 AI 推論工作;CPU 則在資料處理、應用服務、模型調度,以及 Agentic AI 的工作流程中扮演重要角色。當 AI Agent 需要搜尋資料、呼叫 API、使用外部工具或協調多個任務時,整體系統需要 CPU 與 GPU 等不同運算資源協同運作。
GIGABYTE 提供從高效能 CPU 伺服器、GPU 伺服器到機櫃級 AI 運算平台的完整產品組合,可因應不同規模與類型的 AI 推論工作負載。透過 GIGAPOD、GIGABYTE POD Manager(GPM)及直接液冷等技術,協助企業建立兼具高吞吐量、低延遲與擴充能力的 AI 基礎建設。