发现
我们监控的来源包括 SEC EDGAR 申报文件、监管机构新闻稿、新闻聚合器和官方公司公告。第一阶段:同源 URL 监控。第二阶段:带有来源归属的外部搜索拓展。
我们如何严谨地收集、验证并维护您可以信赖的数据。
我们确保每个提取的字段均可追溯至原始文本中的特定位置。若无法在原始文档中定位该信息,我们将不会将其纳入数据库。
我们秉持零幻觉原则,不采用任何推断、暗示或生成的数据。在进行任何结构化存储之前,我们的提取管道会通过模式匹配严格校验每个字段与源信息的一致性。
在数据提取开始前,我们会先按数据集类型对文章进行分类。融资类文章绝不会进入罚款数据管道。此举能有效防止数据交叉污染及因结构错位导致的幻觉。
我们监控的来源包括 SEC EDGAR 申报文件、监管机构新闻稿、新闻聚合器和官方公司公告。第一阶段:同源 URL 监控。第二阶段:带有来源归属的外部搜索拓展。
我们利用关键字和结构分析,将每篇文章精准路由至对应的数据集管道(融资、裁员、罚款、收购、IPO)。若文章被错误路由,将被系统拦截并转交人工审核。
我们优先使用正则表达式进行模式匹配。仅在正则表达式无法覆盖时才启用 LLM(大语言模型)提取,并且每个由 LLM 提取的字段在正式入库前,都会与原始源文本进行反向比对验证。
高置信度记录将自动通过。对于特殊情况——如异常金额、模糊实体或首次出现的信息源——系统会自动标记,交由人工进行再次复核。
已入库的记录会定期与源 URL 进行重新核对。如果原始来源发生更新或撤回,我们的数据也会同步更新或予以标注。
source_url 和 verified_at 时间戳自动化数据管道可能会产生“幻觉”。如果融资类文章被误导入罚款管道,可能会生成完全虚构的执法记录。我们“分类优先、源头锚定”的方法,旨在确保您查询到的每一笔数据都是真实发生的事实——有据可查、可追溯且可验证。
我们的 API 返回的每条记录都包含以下信息:
source_url — 主要源文档的直接链接verified_at — 最后一次验证的 ISO 8601 时间戳extraction_method — 提取方式:regex(正则表达式)、llm_verified(LLM 验证)或 manual(人工)confidence_score — 基于通过验证层级的 0.0 到 1.0 置信度分数