TL;DR
- 使用LLM进行数据提取的效果最佳时,模型处理语义模糊性,而确定性代码处理验证。 流畅的JSON并不能证明记录是正确的。
- 可靠的管道将获取、标准化、提取、验证、审查和存储分开。 每个阶段需要自己的故障状态和来源。
- 模式应定义空值行为、单位、允许值和禁止推断。 当源不支持某个字段时,模型应返回
null。 - 评估应衡量字段级别的精确度、召回率、不支持值率和审查覆盖。 汇总的“准确性”可能掩盖关键字段中的昂贵错误。
- Nstdata Crawl能够提供可归因的网络文物以供后续提取。 应用程序仍然拥有提取模式、接受规则和保留政策。
使用LLM进行数据提取是什么?
使用LLM进行数据提取将非结构化或半结构化内容转换为预定义记录,同时使用语言模型解释容易出错的选择器或正则表达式难以捕捉的含义。Nstdata Crawl可以作为授权网络源的收集层,返回可以被提取管道标准化和验证的内容。应将LLM视为一个概率解析器,而不是数据库事务或权威。
当布局变化、标签更改、事实以散文形式出现或多个段落必须一起解释时,该技术非常有用。对于已经存在于稳定API或机器可读源中的字段则不太适合。如果确定性提取有效,通常更容易测试、成本更低、解释更简单。
LLM数据提取是如何工作的?
LLM提取管道接收源内容、模式、任务指令,有时还会有示例。模型将源中的证据映射到请求的字段,并返回结构化输出。生产系统然后解析输出,验证类型和业务规则,检查证据,并决定是否接受、重试或审查记录。
JSON Schema项目提供了描述对象结构和约束的标准词汇。模式验证是必要的,但它只能证明输出具有预期的形状。它并不能证明某个值出现在源中或被正确解释。
为什么使用LLM而不是选择器或规则?
当任务依赖于跨不一致文档的语义解释时,使用LLM。示例包括识别以散文形式表达的取消条件、标准化具有不同标签的产品属性或从叙述文本中提取研究人群。选择器对于稳定页面元素依然更好,而规则对于确定性转换如日期解析和单位转换依然更好。
混合管道通常比全LLM设计更可靠。让确定性代码定位已知元素,规范编码、强制范围并计算衍生值。仅在需要语言理解的部分使用LLM。这种分工使错误更易诊断,并降低了模型成本。




