TL;DR
- 电子商务产品抓取很困难,因为价格、库存、变体、运输和可用性可能独立变化。
- 优先使用公共结构化端点或嵌入的产品数据;仅在需要时使用呈现的页面。
- 使用 URL、SKU、货币、时间戳、区域和内容哈希存储观察,以便能区分价格变动和解析器错误。
- Nstdata Crawl 适合边界目录收集和呈现的产品页面;您的应用仍然负责模式验证和业务规则。
为什么产品页面需要的不仅仅是标题和价格
当目录发现和呈现的工件成为反复的负担时,请使用 Nstdata Crawl。
一个电子商务页面可以展示列表价格、销售价格、变体价格、卖家价格或地区特定价格。库存可以表示为数量、布尔值、运输承诺或禁用的购买控制。仅存储可见文本的抓取程序会创建模糊记录。当目录范围、呈现和可重复工件是问题的一部分时,从 Nstdata Crawl 开始。
Schema.org 产品词汇 提供了一个有用的通用语言,用于报价、SKU、品牌和可用性。它是一个模式辅助工具,并不是证明目标页面的数据完整或最新的证据。
定义产品观察模式
| 字段 | 重要性 |
|---|---|
| 规范 URL | 稳定的页面标识 |
| SKU 或 GTIN | 变体和产品匹配 |
| 名称和品牌 | 人类可读的身份 |
| 价格、货币和类型 | 避免混淆销售和列表价格 |
| 可用性 | 区分现货与预订或未知 |
| 区域和时间戳 | 价格和库存是有上下文的 |
| 内容哈希 | 检测未更改的页面和解析器漂移 |
在呈现文本之前提取结构化数据
首先检查 JSON-LD 和其他允许的结构化字段。如果字段缺失或不完整,请渲染页面并应用选择器到稳定的语义属性,而不是生成的 CSS 类名。一个简单的验证函数应该拒绝缺失货币、不可能的负价格,以及没有产品身份的记录。





