必要名词
- 文本表示:
- 把文字转换成模型
能够计算的数字。
- 把文字转换成模型
- Text Embedding:
- 一种文本表示,把一段话变成
可以比较的数字向量。 - 常用于语义检索、聚类和相似度计算。
- 一种文本表示,把一段话变成
- Token:
- 模型读取和生成文字时使用的
基本单位。 - 它不一定等于一个汉字或一个单词。
- 模型读取和生成文字时使用的
先说结论
语言人工智能不只会聊天。工程上可以先把它的常见工作归成三类:
- 分类:
- 判断一段文字属于什么类别。
- 嵌入:
- 把文字变成
向量,方便比较和检索。
- 把文字变成
- 生成:
- 根据已有上下文,逐个 Token 产生新内容。
翻译、摘要、信息抽取和问答,也可以落到这三类能力或它们的组合里。
一条工单怎样用上三类能力
假设我在做一个售后工单 Agent,收到一句话:
text
支付已经扣款,但订单没有生成。同一条工单可以同时被分类、转成向量并生成回复,但三种结果承担的责任不同。
- 分类:
- 输出
支付异常或订单异常。 - 分类结果可以决定工单进入哪条处理流程。
- 输出
- 嵌入:
- 把整条工单变成一串向量。
- 检索系统用它寻找
语义相近的历史工单和处理规则。
- 生成:
- 根据工单、规则和订单查询结果组织回复。
- 它负责表达,不负责凭空证明订单状态。
考考你
语言 AI 常见的三类工作是什么?
- 分类:判断类别。
- 嵌入:转成向量,用于比较和检索。
- 生成:根据上下文产生新内容。
Text Embedding 和生成有什么区别?
- Embedding 输出给机器比较的向量。
- 生成输出给人阅读的新内容。
参考
- 《图解大模型:生成式 AI 原理与实战》第 1 章,第 3—30 页。
- Hugging Face:Text classification
- Sentence Transformers 文档
- Hugging Face:Causal language modeling