Parsewise 的 RAG

01技术 · RAG

RAG 是一条从提问到基于你数据作答的流水线。 客户用自己的话提问 — 平台按语义找到相关片段,并据此组织出回答。

去试试
RAG · 语义

嵌入

问题和文档被映射进同一个向量空间 — 匹配的是语义,不是字面。

RAG · 检索

向量库

毫秒级就能取到语义最近的片段 — 哪怕库很大。

RAG · 回答

给模型的上下文

大模型基于检索到的片段作答 — 依据你的数据,而不是凭空想象。

02流水线

从提问到回答,中间是四步。 每一步都是毫秒级,合起来不到一秒就给出基于你数据的回答。

步骤/01

提问

「没小票能退吗?」— 一句大白话,没有关键词。

步骤/02

查询扩展

平台补上同义词和改写 — 检索召回率随之提高。

步骤/03

向量检索

从知识库里取出语义最接近的片段 — 零点几秒。

步骤/04

带上下文的回答

模型拿到片段并据此作答 — 以流式打进对话。

03架构

每个节点只把一件事做好。 嵌入负责算语义,向量库负责检索,大模型负责挑片段 — 需要时还能亮出来源。

嵌入
1024 维语义空间
向量库
pgvector · 两个库
切片
文档片段
查询扩展
同义词与改写
同步
每天早上更新
片段筛选
模型自己挑
缓存
高频查询更快
来源
可选:展示文档
RAG
04 · 准确度

个维度。 为库里每个片段生成一个稠密语义向量。

个库。 商品目录和知识分开检索 — 上下文更准。

来自你的数据。 答案由检索到的片段拼成。

按语义找,按事实答

模型不编 — 它引用。 找到的片段进入提示词,答案就建立在它们之上。没有片段时,助手会老实说不知道。

05速度

库变大,向量检索几乎没感觉。 从一百份文档到数万份 — 响应时间只差几十毫秒。

01

检索 p95
语义检索,覆盖整个知识库

02

首个 token
答案立刻开始打字

03

文件入库
从上传到能作答

04

性能衰减
库增长了速度也稳住

检索 · 毫秒 · 随库规模增长(文件数)
检索目标 250 毫秒
06细节
需求

按类型的作品集按年份

各类型项目逐年增长

MVP重构AI运维合计

MVP、重构、AI 与运维——累计

优势概览

工作室在关键维度上的画像

速度、质量、透明、工程

项目阶段随时间

调研、设计与研发相互交叠

并行推进——不是瀑布