Parsewise 的 RAG

01技术 · RAG

RAG 是一条从提问到基于你数据作答的流水线。 客户用自己的话提问 — 平台按语义找到相关片段,并据此组织出回答。

语义

嵌入

问题和文档被映射进同一个向量空间 — 匹配的是语义,不是字面。

检索

向量库

毫秒级就能取到语义最近的片段 — 哪怕库很大。

回答

给模型的上下文

大模型基于检索到的片段作答 — 依据你的数据,而不是凭空想象。

03架构

每个节点只把一件事做好。 嵌入负责算语义,向量库负责检索,大模型负责挑片段 — 需要时还能亮出来源。

嵌入
1024 维语义空间
向量库
pgvector · 两个库
切片
文档片段
查询扩展
同义词与改写
同步
每天早上更新
片段筛选
模型自己挑
缓存
高频查询更快
来源
可选:展示文档
RAG
04准确度

按语义找,按事实答

模型不编 — 它引用。 找到的片段进入提示词,答案就建立在它们之上。没有片段时,助手会老实说不知道。

01

个维度。
为库里每个片段生成一个稠密语义向量。

02

个库。
商品目录和知识分开检索 — 上下文更准。

03

来自你的数据。
答案由检索到的片段拼成。

05速度

库变大,向量检索几乎没感觉。 从一百份文档到数万份 — 响应时间只差几十毫秒。

01

检索 p95
语义检索,覆盖整个知识库

02

首个 token
答案立刻开始打字

03

文件入库
从上传到能作答

04

性能衰减
库增长了速度也稳住

06细节

好的 RAG 是一门抠细节的功夫。 查询扩展、老老实实地挑片段,以及按需给出原始出处。

/01

查询扩展

同义词和改写提高检索召回。

/02

由大模型挑片段

由模型决定哪些片段进入答案。

/03

可选:展示文档

高亮的原文片段 — 一个开关的事。

开始使用

上传你的文档和商品目录,然后把别人问你的问题拿去问助手。 这是唯一有意义的检验。