术语表
大模型 API 开发相关的常用术语解释。本术语表按主题分类,方便快速查阅。
基础概念
| 术语 | 英文 | 解释 |
|---|
| 大语言模型 | LLM (Large Language Model) | 基于海量文本训练的语言模型,能理解和生成自然语言 |
| 生成式 AI | Generative AI | 能生成新内容(文本、图像、代码等)的 AI 系统 |
| 预训练 | Pre-training | 在大规模数据上的初始训练,学习通用语言知识 |
| 微调 | Fine-tuning | 在特定数据上的二次训练,适配特定任务 |
| 推理 | Inference | 模型根据输入生成输出的过程 |
| 对齐 | Alignment | 让模型行为符合人类意图和价值观 |
| 涌现能力 | Emergent Abilities | 模型规模增大后出现的新能力 |
Token 相关
Token 是大模型处理文本的基本单位,理解 Token 对成本控制至关重要。
| 术语 | 解释 |
|---|
| Token | 模型处理的最小文本单位。英文约 4 字符/Token,中文约 1.5 字符/Token |
| Tokenizer | 将文本转换为 Token 序列的工具,不同模型使用不同的 Tokenizer |
| Context Window | 上下文窗口,模型单次能处理的最大 Token 数(如 GPT-4o 为 128K) |
| Input Tokens | 输入消息消耗的 Token 数,包括 system、历史消息等 |
| Output Tokens | 模型生成内容消耗的 Token 数,通常比输入贵 |
| TPM | Tokens Per Minute,每分钟 Token 限制 |
| RPM | Requests Per Minute,每分钟请求数限制 |
Token 估算:
- 英文:1 Token ≈ 4 字符 ≈ 0.75 单词
- 中文:1 Token ≈ 1.5 字符 ≈ 0.7 汉字
API 相关
| 术语 | 解释 |
|---|
| Endpoint | API 接口地址,如 /v1/chat/completions |
| API Key | 访问 API 的密钥,用于身份验证和计费 |
| Rate Limit | 请求频率限制,超过会返回 429 错误 |
| Quota | 使用配额,账户的总使用限制 |
| Latency | 响应延迟,从发送请求到收到响应的时间 |
| TTFT | Time To First Token,首 Token 延迟,流式输出的关键指标 |
| Throughput | 吞吐量,单位时间内处理的请求/Token 数 |
消息角色
不同角色在对话中有不同作用:
| 角色 | 说明 | 用途 |
|---|
| system | 系统提示 | 设定模型行为、角色、规则 |
| user | 用户输入 | 用户的问题或指令 |
| assistant | 模型回复 | 模型生成的响应 |
| tool | 工具结果 | 工具调用返回的结果 |
消息流程:
system → user → assistant → user → assistant → ...
参数术语
控制模型输出行为的关键参数:
| 参数 | 范围 | 解释 |
|---|
| temperature | 0-2 | 控制随机性。0=确定性输出,1=平衡,2=高创造性 |
| top_p | 0-1 | 核采样。0.1=只考虑前 10% 概率的词 |
| max_tokens | 正整数 | 最大生成 Token 数,控制输出长度 |
| stop | 字符串/数组 | 停止生成的标记,如 ["\n\n"] |
| presence_penalty | -2 到 2 | 话题新颖度。正值鼓励新话题 |
| frequency_penalty | -2 到 2 | 重复惩罚。正值减少重复 |
| seed | 整数 | 随机种子,用于可复现输出 |
参数选择建议:
| 场景 | temperature | top_p |
|---|
| 代码生成 | 0-0.3 | 0.1-0.3 |
| 创意写作 | 0.7-1.0 | 0.9-1.0 |
| 数据提取 | 0 | 0.1 |
| 对话聊天 | 0.5-0.7 | 0.8-0.9 |
Prompt 相关
Prompt 工程是提升模型效果的关键技能:
| 术语 | 解释 |
|---|
| Prompt | 提示词,给模型的输入指令,决定输出质量 |
| System Prompt | 系统提示,定义模型角色、行为规则、输出格式 |
| Few-shot | 少样本学习,在 Prompt 中提供示例让模型学习 |
| Zero-shot | 零样本,不提供示例直接提问 |
| One-shot | 单样本,只提供一个示例 |
| CoT | Chain of Thought,思维链,让模型逐步推理 |
| Prompt Injection | 提示词注入攻击,恶意输入试图改变模型行为 |
| Jailbreak | 越狱,绕过模型安全限制的技术 |
技术架构
| 术语 | 解释 |
|---|
| Transformer | 主流的模型架构,基于自注意力机制 |
| Attention | 注意力机制,让模型关注输入的不同部分 |
| Self-Attention | 自注意力,计算序列内部的关联 |
| Embedding | 嵌入,将文本转换为稠密向量表示 |
| Vector Database | 向量数据库,存储和检索向量的专用数据库 |
| RAG | Retrieval-Augmented Generation,检索增强生成 |
| Semantic Search | 语义搜索,基于含义而非关键词的搜索 |
Agent 相关
Agent 是能自主完成复杂任务的 AI 系统:
| 术语 | 解释 |
|---|
| Agent | 智能体,能自主决策、调用工具、完成任务的 AI 系统 |
| Tool Calling | 工具调用,模型调用外部工具/API 的能力 |
| Function Calling | 函数调用,Tool Calling 的早期叫法(OpenAI) |
| ReAct | Reasoning + Acting,推理与行动交替的模式 |
| Planning | 任务规划,将复杂任务分解为子任务 |
| Reflection | 反思,Agent 评估和改进自己的输出 |
| Memory | 记忆,Agent 存储和检索历史信息的能力 |
Agent 执行模式:
思考 → 行动 → 观察 → 思考 → ... → 最终答案
多模态
| 术语 | 解释 |
|---|
| Multimodal | 多模态,支持多种输入/输出类型(文本、图像、音频等) |
| Vision | 视觉能力,理解和分析图像 |
| VLM | Vision-Language Model,视觉语言模型 |
| TTS | Text-to-Speech,文本转语音 |
| STT | Speech-to-Text,语音转文本(也叫 ASR) |
| OCR | Optical Character Recognition,光学字符识别 |
| Image Generation | 图像生成,如 DALL-E、Midjourney |
训练相关
| 术语 | 解释 |
|---|
| LoRA | Low-Rank Adaptation,低秩适配,高效微调方法 |
| QLoRA | Quantized LoRA,量化 LoRA,更省显存 |
| PEFT | Parameter-Efficient Fine-Tuning,参数高效微调 |
| Full Fine-tuning | 全参数微调,更新所有参数 |
| RLHF | Reinforcement Learning from Human Feedback,基于人类反馈的强化学习 |
| SFT | Supervised Fine-Tuning,监督微调 |
| DPO | Direct Preference Optimization,直接偏好优化 |
| Epoch | 训练轮次,完整遍历数据集一次 |
| Learning Rate | 学习率,控制参数更新幅度 |
部署相关
| 术语 | 解释 |
|---|
| Quantization | 量化,降低模型精度以减少资源需求 |
| INT4/INT8 | 4/8 位整数量化,大幅减少显存占用 |
| FP16/BF16 | 16 位浮点精度,平衡精度和效率 |
| FP32 | 32 位浮点精度,完整精度 |
| GGUF | llama.cpp 使用的模型格式,支持 CPU 推理 |
| GPTQ | GPU 量化格式 |
| AWQ | Activation-aware Weight Quantization |
| vLLM | 高性能推理引擎,支持 PagedAttention |
| Ollama | 本地运行 LLM 的工具 |
| KV Cache | Key-Value 缓存,加速推理 |
评估指标
| 术语 | 解释 |
|---|
| Perplexity | 困惑度,衡量模型预测能力,越低越好 |
| BLEU | 机器翻译评估指标,衡量与参考译文的相似度 |
| ROUGE | 文本摘要评估指标,衡量与参考摘要的重叠 |
| Hallucination | 幻觉,模型生成虚假或不存在的信息 |
| Benchmark | 基准测试,标准化的评估数据集 |
| Accuracy | 准确率,正确预测的比例 |
| F1 Score | F1 分数,精确率和召回率的调和平均 |
缩写速查
| 缩写 | 全称 | 中文 |
|---|
| LLM | Large Language Model | 大语言模型 |
| API | Application Programming Interface | 应用程序接口 |
| SDK | Software Development Kit | 软件开发工具包 |
| SSE | Server-Sent Events | 服务器发送事件 |
| JSON | JavaScript Object Notation | JSON 格式 |
| REST | Representational State Transfer | REST 架构 |
| GPU | Graphics Processing Unit | 图形处理器 |
| VRAM | Video Random Access Memory | 显存 |
| CUDA | Compute Unified Device Architecture | NVIDIA 并行计算平台 |
| MPS | Metal Performance Shaders | Apple GPU 加速 |
| RAG | Retrieval-Augmented Generation | 检索增强生成 |
| CoT | Chain of Thought | 思维链 |
| RLHF | Reinforcement Learning from Human Feedback | 人类反馈强化学习 |
相关文档