全部笔记All notes

大模型术语表

阅读 5m 28s5m 28s read

术语表

大模型 API 开发相关的常用术语解释。本术语表按主题分类,方便快速查阅。


基础概念

术语英文解释
大语言模型LLM (Large Language Model)基于海量文本训练的语言模型,能理解和生成自然语言
生成式 AIGenerative AI能生成新内容(文本、图像、代码等)的 AI 系统
预训练Pre-training在大规模数据上的初始训练,学习通用语言知识
微调Fine-tuning在特定数据上的二次训练,适配特定任务
推理Inference模型根据输入生成输出的过程
对齐Alignment让模型行为符合人类意图和价值观
涌现能力Emergent Abilities模型规模增大后出现的新能力

Token 相关

Token 是大模型处理文本的基本单位,理解 Token 对成本控制至关重要。

术语解释
Token模型处理的最小文本单位。英文约 4 字符/Token,中文约 1.5 字符/Token
Tokenizer将文本转换为 Token 序列的工具,不同模型使用不同的 Tokenizer
Context Window上下文窗口,模型单次能处理的最大 Token 数(如 GPT-4o 为 128K)
Input Tokens输入消息消耗的 Token 数,包括 system、历史消息等
Output Tokens模型生成内容消耗的 Token 数,通常比输入贵
TPMTokens Per Minute,每分钟 Token 限制
RPMRequests Per Minute,每分钟请求数限制

Token 估算:

  • 英文:1 Token ≈ 4 字符 ≈ 0.75 单词
  • 中文:1 Token ≈ 1.5 字符 ≈ 0.7 汉字

API 相关

术语解释
EndpointAPI 接口地址,如 /v1/chat/completions
API Key访问 API 的密钥,用于身份验证和计费
Rate Limit请求频率限制,超过会返回 429 错误
Quota使用配额,账户的总使用限制
Latency响应延迟,从发送请求到收到响应的时间
TTFTTime To First Token,首 Token 延迟,流式输出的关键指标
Throughput吞吐量,单位时间内处理的请求/Token 数

消息角色

不同角色在对话中有不同作用:

角色说明用途
system系统提示设定模型行为、角色、规则
user用户输入用户的问题或指令
assistant模型回复模型生成的响应
tool工具结果工具调用返回的结果

消息流程:

system → user → assistant → user → assistant → ...

参数术语

控制模型输出行为的关键参数:

参数范围解释
temperature0-2控制随机性。0=确定性输出,1=平衡,2=高创造性
top_p0-1核采样。0.1=只考虑前 10% 概率的词
max_tokens正整数最大生成 Token 数,控制输出长度
stop字符串/数组停止生成的标记,如 ["\n\n"]
presence_penalty-2 到 2话题新颖度。正值鼓励新话题
frequency_penalty-2 到 2重复惩罚。正值减少重复
seed整数随机种子,用于可复现输出

参数选择建议:

场景temperaturetop_p
代码生成0-0.30.1-0.3
创意写作0.7-1.00.9-1.0
数据提取00.1
对话聊天0.5-0.70.8-0.9

Prompt 相关

Prompt 工程是提升模型效果的关键技能:

术语解释
Prompt提示词,给模型的输入指令,决定输出质量
System Prompt系统提示,定义模型角色、行为规则、输出格式
Few-shot少样本学习,在 Prompt 中提供示例让模型学习
Zero-shot零样本,不提供示例直接提问
One-shot单样本,只提供一个示例
CoTChain of Thought,思维链,让模型逐步推理
Prompt Injection提示词注入攻击,恶意输入试图改变模型行为
Jailbreak越狱,绕过模型安全限制的技术

技术架构

术语解释
Transformer主流的模型架构,基于自注意力机制
Attention注意力机制,让模型关注输入的不同部分
Self-Attention自注意力,计算序列内部的关联
Embedding嵌入,将文本转换为稠密向量表示
Vector Database向量数据库,存储和检索向量的专用数据库
RAGRetrieval-Augmented Generation,检索增强生成
Semantic Search语义搜索,基于含义而非关键词的搜索

Agent 相关

Agent 是能自主完成复杂任务的 AI 系统:

术语解释
Agent智能体,能自主决策、调用工具、完成任务的 AI 系统
Tool Calling工具调用,模型调用外部工具/API 的能力
Function Calling函数调用,Tool Calling 的早期叫法(OpenAI)
ReActReasoning + Acting,推理与行动交替的模式
Planning任务规划,将复杂任务分解为子任务
Reflection反思,Agent 评估和改进自己的输出
Memory记忆,Agent 存储和检索历史信息的能力

Agent 执行模式:

思考 → 行动 → 观察 → 思考 → ... → 最终答案

多模态

术语解释
Multimodal多模态,支持多种输入/输出类型(文本、图像、音频等)
Vision视觉能力,理解和分析图像
VLMVision-Language Model,视觉语言模型
TTSText-to-Speech,文本转语音
STTSpeech-to-Text,语音转文本(也叫 ASR)
OCROptical Character Recognition,光学字符识别
Image Generation图像生成,如 DALL-E、Midjourney

训练相关

术语解释
LoRALow-Rank Adaptation,低秩适配,高效微调方法
QLoRAQuantized LoRA,量化 LoRA,更省显存
PEFTParameter-Efficient Fine-Tuning,参数高效微调
Full Fine-tuning全参数微调,更新所有参数
RLHFReinforcement Learning from Human Feedback,基于人类反馈的强化学习
SFTSupervised Fine-Tuning,监督微调
DPODirect Preference Optimization,直接偏好优化
Epoch训练轮次,完整遍历数据集一次
Learning Rate学习率,控制参数更新幅度

部署相关

术语解释
Quantization量化,降低模型精度以减少资源需求
INT4/INT84/8 位整数量化,大幅减少显存占用
FP16/BF1616 位浮点精度,平衡精度和效率
FP3232 位浮点精度,完整精度
GGUFllama.cpp 使用的模型格式,支持 CPU 推理
GPTQGPU 量化格式
AWQActivation-aware Weight Quantization
vLLM高性能推理引擎,支持 PagedAttention
Ollama本地运行 LLM 的工具
KV CacheKey-Value 缓存,加速推理

评估指标

术语解释
Perplexity困惑度,衡量模型预测能力,越低越好
BLEU机器翻译评估指标,衡量与参考译文的相似度
ROUGE文本摘要评估指标,衡量与参考摘要的重叠
Hallucination幻觉,模型生成虚假或不存在的信息
Benchmark基准测试,标准化的评估数据集
Accuracy准确率,正确预测的比例
F1 ScoreF1 分数,精确率和召回率的调和平均

缩写速查

缩写全称中文
LLMLarge Language Model大语言模型
APIApplication Programming Interface应用程序接口
SDKSoftware Development Kit软件开发工具包
SSEServer-Sent Events服务器发送事件
JSONJavaScript Object NotationJSON 格式
RESTRepresentational State TransferREST 架构
GPUGraphics Processing Unit图形处理器
VRAMVideo Random Access Memory显存
CUDACompute Unified Device ArchitectureNVIDIA 并行计算平台
MPSMetal Performance ShadersApple GPU 加速
RAGRetrieval-Augmented Generation检索增强生成
CoTChain of Thought思维链
RLHFReinforcement Learning from Human Feedback人类反馈强化学习

相关文档