01
解析不是纯粹的文本抽取
复杂合同通常包含跨页表格、扫描内容、标题层级和视觉标记。把页面简单拼接成纯文本,会让字段与值、条款与附注之间的关系消失。
此前在 AscendFlow Law 中负责视觉文档 RAG 方案,使用 PDF-Extract-Kit 处理版面、公式与中文 OCR,再组织结构化 Markdown。这属于历史项目经历,不是当前独立文本 RAG 实现所具备的全部能力。
02
评估要覆盖还原与检索两端
只看最终回答,很难判断错误来自解析、切分、召回还是生成。完整评估应把解析保真、来源召回、引用准确性和答案质量分开,而不是用一个总分覆盖所有阶段。
当前独立实现提取文本 PDF 的内容并保留来源信息,尚不包含 OCR 或视觉解析。现有材料也不足以提供统一评测指标,因此这里先讨论设计与验证方法。
03
经验:先定位证据,再生成答案
对于法律与合同场景,可追溯证据比语言流畅度更重要。一个更可靠的产品顺序是先返回原文位置和证据片段,再让模型完成摘要或解释。
从技术笔记回到完整案例
查看项目与验证范围