Parsewise 的 RAG
01技术 · RAG
按语义作答
RAG 是一条从提问到基于你数据作答的流水线。 客户用自己的话提问 — 平台按语义找到相关片段,并据此组织出回答。
去试试
RAG · 语义
嵌入
问题和文档被映射进同一个向量空间 — 匹配的是语义,不是字面。
RAG · 检索
向量库
毫秒级就能取到语义最近的片段 — 哪怕库很大。


RAG · 回答
给模型的上下文
大模型基于检索到的片段作答 — 依据你的数据,而不是凭空想象。
02流水线
一个答案的路径
从提问到回答,中间是四步。 每一步都是毫秒级,合起来不到一秒就给出基于你数据的回答。
步骤/01
提问
「没小票能退吗?」— 一句大白话,没有关键词。
步骤/02
查询扩展

平台补上同义词和改写 — 检索召回率随之提高。
步骤/03
向量检索

从知识库里取出语义最接近的片段 — 零点几秒。
步骤/04
带上下文的回答

模型拿到片段并据此作答 — 以流式打进对话。
03架构
围绕同一个内核
每个节点只把一件事做好。 嵌入负责算语义,向量库负责检索,大模型负责挑片段 — 需要时还能亮出来源。
嵌入
1024 维语义空间
向量库
pgvector · 两个库
切片
文档片段
查询扩展
同义词与改写
同步
每天早上更新
片段筛选
模型自己挑
缓存
高频查询更快
来源
可选:展示文档
RAG
04 · 准确度
个维度。 为库里每个片段生成一个稠密语义向量。
个库。 商品目录和知识分开检索 — 上下文更准。
来自你的数据。 答案由检索到的片段拼成。
按语义找,按事实答
模型不编 — 它引用。 找到的片段进入提示词,答案就建立在它们之上。没有片段时,助手会老实说不知道。
05速度
快 — 而且明天也不会变慢
库变大,向量检索几乎没感觉。 从一百份文档到数万份 — 响应时间只差几十毫秒。
01
检索 p95
语义检索,覆盖整个知识库
02
首个 token
答案立刻开始打字
03
文件入库
从上传到能作答
04
性能衰减
库增长了速度也稳住
检索 · 毫秒 · 随库规模增长(文件数)
检索目标 250 毫秒
06细节
RAG
在你的数据上验证
检验 RAG 最好的办法,是拿你自己的文档。 传两个文件,问一个你自己知道答案的问题。
需求
告诉我们你的需求
按类型的作品集按年份
各类型项目逐年增长
MVP重构AI运维合计
MVP、重构、AI 与运维——累计
优势概览
工作室在关键维度上的画像
速度、质量、透明、工程
项目阶段随时间
调研、设计与研发相互交叠
并行推进——不是瀑布