大模型的工作原理
理解 Token、上下文窗口、注意力机制和 Temperature 等核心概念,帮你写出更好的提示词。
大模型的工作原理
不需要理解复杂的数学,只需要搞懂几个核心概念,就能帮你写出好得多的提示词。
概念一:Token(语言的最小单位)
模型不是一个字一个字地读你的话,而是把文字切成一小块一小块的,每块叫一个 Token。
- 英文中,一个常见单词 ≈ 1 个 Token(如 hello = 1 Token)
- 中文中,一个汉字 ≈ 1~2 个 Token(如「你好」≈ 2 Token)
- 标点符号、空格也都算 Token
为什么重要? 因为模型按 Token 收费,也按 Token 限制长度。你写了一万字的提示词,可能已经消耗了 1.5 万 Token。
概念二:上下文窗口(模型的记忆容量)
每个模型有一个「工作台」大小,叫做上下文窗口。它能同时看到的所有文字——包括你的提示词和它的回答——加起来不能超过这个窗口。
| 模型 | 上下文窗口 | 大约等于 |
|---|---|---|
| DeepSeek-V3 | 128K Token | ~10 万字 |
| Kimi | 200K Token | ~15 万字 |
| 通义千问 | 128K Token | ~10 万字 |
窗口用完了怎么办?模型会「忘记」最早的内容。所以重要的信息要放在提示词的开头和结尾。
概念三:注意力机制(模型的聚光灯)
模型在读你的提示词时,不是每个字一视同仁的。它有一个叫「注意力」的机制,就像一盏聚光灯——对某些内容投入更多注意力,对某些内容少一些。
一般来说:
- 开头和结尾的内容获得的注意力最多
- 有结构的内容(标题、列表、分隔线)更容易被注意到
- 重复出现的关键词会被重点关注
这就是为什么好的提示词要用清晰的结构来组织。
概念四:Temperature(创造力旋钮)
Temperature 是一个 0 到 2 之间的数字,控制模型回答的「创造力」:
| Temperature | 效果 | 适用场景 |
|---|---|---|
| 0~0.3 | 非常确定,每次回答几乎一样 | 代码生成、数据分析、事实问答 |
| 0.4~0.7 | 平衡,有一定灵活性 | 日常对话、文章写作 |
| 0.8~1.2 | 富有创造力,回答多样 | 头脑风暴、创意写作 |
| 1.3~2.0 | 非常随机,可能出现奇怪内容 | 实验性探索 |
打个比方:Temperature 低就像让一个严谨的会计回答问题,Temperature 高就像让一个天马行空的艺术家来回答。
这些概念怎么用
当你写提示词时,记住:
- 控制长度:别把所有资料都塞进去,精选最相关的
- 结构清晰:用标题、列表帮助模型「看到」重点
- 重要信息放两端:开头说清任务,结尾强调关键要求
- 调 Temperature:需要准确就调低,需要创意就调高
理解模型的工作原理,不是为了成为 AI 专家,而是为了更聪明地和 AI 对话。