PROC MATCHA

匹配人与地址

Matcha 将杂乱、拼错、只输入了一半的地址关联到它们真正指向的记录,在您自己的机器上运行,并为每一个判定附上经校准的概率和理由。个人姓名、企业名称、电子邮件、IP 位置和标识符在同一引擎上运行。 疑难案例可加入 Jev (typesafe.ai) 或本地 Ollama 模型。

随 Jenner 附带。无外部服务、无 API 密钥,除非您选择加入模型,否则没有数据离开您的网络;可加入的是 Jev (typesafe.ai) 或本地 Ollama 模型。

一只表面泛着泡沫的抹茶碗,旁边斜靠着一支竹制茶筅的钢笔画

适用对象

六类以地址为键、而这个键从不会以同一种方式被输入两次的工作。

KYC 与客户开户

申请人在手机上、匆忙之间,只输入一次地址。Matcha 在申请人仍停留在页面上时,就将其与您的参照表进行解析比对;当两条记录同样可信时,它会指出能够定夺的那一个字段,因此表单可以询问“Milton or Morton?”,而不是让检查失败或直接放行。

AML 与制裁筛查

筛查就是把成本倒过来的匹配:漏掉一个命中代价高昂,一次误报却很便宜。Matcha 把这些成本作为输入,并据此移动阈值,因此为客户开户的同一引擎也能对客户进行筛查。地址今天即可使用;对照制裁与 PEP 名单的个人与企业名称筛查在同一引擎上运行,采用同样的判定。

欺诈检测

Matcha 报告它考虑过的每一个候选,附上逐字段的证据,以及真实答案根本不在表中的概率。欺诈规则可以基于匹配器实际查看的内容来运作,而不是依赖单一分数;IP 位置实体则把会话的位置与客户声称的地址进行核对。

营销与 CRM 去重

同一个家庭在注册、订单和导入数据中以十种方式出现。Matcha 将一张表与其自身匹配,写出聚类,并为每一条关联保留经校准的概率,因此去重可以按它所服务的邮寄任务的需要而严格或宽松。按地址与姓氏归户是同一引擎上的一个组合实体。

配送与物流

一次错误配送意味着一趟回程;一个被拒的订单意味着失去这笔销售。Matcha 按各地区的邮政规则标准化每个地址,将其与您的可服务地址表匹配,并在地址真实但超出您的服务范围、或真实但在您的表中缺失时告诉您,让修正落到正确的地方。

公共部门与公民科技

某市的地块查询服务让居民发送一条地址短信即可收到自己的地块信息。在最难的案例上——那些其之前的匹配器每次都答错的拼写错误和口述失误——仅凭 Matcha 引擎就在第一次尝试中正确回答了 81%,对剩余部分使用模型后达到 91%。

工作原理

Jenner 二进制程序内的原生 Rust。一个步骤,一张判定表,每个判定都有理由。

1

解析与标准化

每个地址被拆分为门牌号、方位、街道、后缀、单元、城市和邮政编码,并按其所在地区的邮政规则(美国为 USPS Publication 28,加拿大为 Canada Post)进行规范化。文本有歧义时,解析器保留每一种读法,交由参照数据来决定。

2

在您的表中寻找候选

引擎从您自己的参照表构建街道词表,并按拼写、读音和官方别名将输入的街道对齐到词表上。候选按门牌号、邮政编码和街道查找,因此 ZIP 写错并不致命。

3

逐字段评分,校准结果

门牌号、街道、后缀、方位、单元和邮政编码分别比较,证据合并为一个经校准的概率。当参照数据中只有一条该名称的街道时,缺少后缀不付出任何代价;有两条时,则会引出一个问题。

4

按成本判定

您说明在您的流程中一次错误匹配、一次漏匹配和一次追问各自的成本。引擎选择期望成本最低的判定,因此只有在按您的数字足够确定时才匹配,否则就返回无匹配,而不是错误匹配。

5

报告它查看过的一切

每个输入一行,含判定、概率和理由;每个候选一行,含逐字段证据;一张指标表说明输入为何未匹配。没有任何东西被悄悄丢弃。

6

只把剩余部分交给模型

可选地,引擎无法定夺的案例连同其候选,在同一步骤内交给语言模型。模型选出一个候选,或者说明没有一个合适;它绝不改写地址。

六种判定,每种都附有概率

match某个候选以高概率是正确记录。直接使用。
likely最可能的候选,当其概率低于 match 阈值时连同真实概率一起报告。绝不是随机挑选。
nonmatch没有可信的候选。视为未找到;考虑过的候选仍会报告。
review引擎无法决定,而您的流程可以询问。仅当您为追问渠道定价时才会输出。
not_in_table一个真实存在但您的参照数据中没有的地址。修正参照数据,而不是输入。
out_of_area邮政编码或地名位于参照数据的覆盖范围之外。转到其他渠道处理。

追问清单:恰好问出正确的问题

大多数匹配器把疑难案例交给一个无人值守的人工审核队列。Matcha 在候选之间无法定夺时知道原因:输入写的是 1200 Milton Street,而参照数据里既有 1200 Milton St 又有 1200 Morton St,两个看起来相像、读起来也相像的街道名。这是一个用一个词就能回答的问题。

因此,当您为追问渠道定价后,未决的行会以 review 输出,附带排序后的候选、能够定夺的确切字段(ask about street、ask about unit),以及您的流程判断这个问题是否值得一问所需的概率。短信服务回复“Milton or Morton?”。开户表单显示两个地址。呼叫中心的屏幕向坐席展示候选而不是一片空白。没有定价渠道时就没有 review 判定:那些行是 nonmatch,附带同样的候选和理由。

从一次评估运行开始

给 Matcha 一份真值文件——几百条您能担保其正确记录的输入——一次运行就会据此为每个判定打分:首次尝试即正确、所做匹配的精确率、错误答案、前五个候选中的召回率、一条校准曲线,以及各错误权重下的期望成本,让您可以从曲线上选择自己的权重,而不是靠猜。

实测结果

两项测试,一项针对公众的真实输入,一项针对美国六个地区被刻意破坏的地址。数字与文档中公布的一致。

公众输入的真实查询

居民在某市地块查询服务中输入的约 2,400 条地址,对照约 378,000 个地块的登记册,正确的地块可从后续发生的事情得知。在最难的 223 个案例上——真实的拼写错误、口述残留和缺失的后缀——该市之前的匹配器在第一次尝试时每次都错。

0% 到 81%

仅凭引擎,首次尝试即正确匹配的疑难案例

91%

对剩余部分使用本地模型或 Jev 后

89% 到 97%

与简单案例的一致率,从仅凭引擎到引擎加模型

被刻意破坏的地址,覆盖全国

从 National Address Database 中随机选取的六个 ZIP 地区抽取 3,000 条真实地址,并按从真实数据中测得的错误组合加以破坏:拼写错误、丢失的方位和后缀、缩写、粘连的词元和数字失误。真值完全已知,每个输入最终都是匹配或不匹配,没有任何一条留给人工处理。

83.3%

仅凭引擎,首次尝试即正确匹配

98.1%

所做匹配的精确率

1.6%

错误答案,约六十分之一

87.8% 到 89.3%

对剩余部分使用 Jev 或本地模型后的首次尝试正确率

单靠相似度分数是危险的:开启模糊街道匹配而其上没有任何东西时,每四条地址就有一条返回错误。备选读法、别名和楼宇解析完成了大部分工作,随后判定层在不够确定时返回无匹配而不是错误匹配,将错误答案从 3.6% 降到 0.7%。成本权重让您可以把这一取舍向任一方向移动。

分阶段提升:每一层带来什么

同样的 3,000 条损坏地址,每次只多开启一层进行匹配。第 1 到第 5 阶段是累积的;最后两项是在完整引擎的残余案例上的两种备选方案。

0%25%50%75%100%34.6%0.0%精确匹配阶段 148.8%20.8%解析与标准化阶段 264.5%25.0%模糊街道阶段 389.3%3.6%别名与单元阶段 484.1%0.7%成本感知判定阶段 590.0% 本地 AI (Ollama)2.1% 本地 AI (Ollama)88.5% Jev (TypeSafe)0.8% Jev (TypeSafe)+ 对残余案例使用 AI正确匹配错误匹配

精确字符串匹配正确 34.6%,无错误。解析与标准化把正确匹配提高到 48.8%,但错误匹配也升至 20.8%。模糊街道匹配把正确率提高到 64.5%,错误率升至 25.0%。别名、替代拼写与单元把正确率提到 89.3%,错误率降到 3.6%。成本感知判定,即完整引擎,正确 84.1%,错误 0.7%。在该引擎的残余案例上,本地 Ollama 模型达到 90.0% 正确、2.1% 错误,Jev 达到 88.5% 正确、0.8% 错误。

3,000 条损坏地址中按阶段划分的正确匹配、错误匹配与遗漏占比。最后两行是从第 5 阶段分出的备选方案,而非先后顺序。
阶段正确匹配错误匹配遗漏
阶段 1: 精确匹配34.6%0.0%65.4%
阶段 2: 解析与标准化48.8%20.8%30.4%
阶段 3: 模糊街道64.5%25.0%10.5%
阶段 4: 别名与单元89.3%3.6%7.1%
阶段 5: 成本感知判定84.1%0.7%15.2%
+ 对残余案例使用 AI: 本地 AI (Ollama)90.0%2.1%7.8%
+ 对残余案例使用 AI: Jev (TypeSafe)88.5%0.8%10.7%

来源:来自随机选取的六个 ZIP 区域的 3,000 条真实美国地址,取自 National Address Database,并按从真实数据中测得的错误构成加以损坏,因此真实答案完全已知。数字与 PROC MATCHA 文档中公布的一致。

  • 单靠模糊匹配很危险。只开启模糊街道匹配而不加任何上层时,每四条地址就有一条返回错误结果,而相似度分数无法告诉您是哪一条。
  • 别名层承担了最重的工作。官方街道别名、替代拼写、单元与楼宇解析把正确匹配从 64.5% 提高到 89.3%,把错误匹配从 25.0% 降到 3.6%。
  • 判定层把错误答案压到 1% 以下。为错误匹配和漏匹配分别定价后,引擎在不够确定时会返回无匹配而不是错误匹配:错误 0.7%,未决案例被报告而不是丢弃。
  • 对残余案例使用 AI 把正确匹配提升到约 90%。本地模型找到的匹配最多,但错误答案大约翻了三倍;Jev 以引擎自身的精度增加匹配,错误率 0.8%。

用您自己的地址运行

Matcha 包含在每一份 Jenner 许可证中。购买 Jenner,阅读 PROC MATCHA 文档,或者告诉我们您的匹配问题,我们会帮您搭建一次评估运行。

茶叶

使用您自己的模型

语言模型按行计费昂贵,按行处理缓慢。Matcha 像一位优秀的分析师那样使用它们:只用于需要判断的案例。

Ollama 搭配 qwen2.5:7b-instruct,完全离线

通过 Ollama 在您自己的硬件上运行本地模型,完全离线,没有任何数据离开机器。我们以 qwen2.5:7b-instruct 做基准测试。本地模型按行计费为零,几乎回答向它提出的每一个问题,因此找到的匹配最多,错误答案也大约翻倍。

Jev,来自 TypeSafe (typesafe.ai) 的 System One 模型

Jev 不生成文本,而是回答一个类型化的问题——如果有的话,哪个候选与这个地址是同一个地方——并返回一个附有经校准概率的选择。当它说 0.9 时,约有 90% 的情况是对的;不确定时,它会说明没有一个候选合适,而不是去猜。这正是成本敏感的匹配器所需要的形态,也是 Jev 能以引擎自身的精确率增加匹配的原因。

Matcha 如何使用 Jev →

在实测运行中,未决区间占输入的 2% 到 8%,因此一项 100,000 条地址的任务只产生几千次模型调用,而不是十万次。

两者都是可选的,默认都关闭。引擎两者都不需要,而远程模型只有在您于配置中设置 allow_remote 之后才能使用。

竹制茶筅

来自 typesafe.ai 的 Jev:面向疑难案例的 System One 模型

Jev 由 TypeSafe (typesafe.ai) 开发。Matcha 只在引擎无法裁定的剩余案例上调用它。

Jev 是 TypeSafe 的 System One 模型。它不生成文本,而是回答一个类型化的问题:哪个候选(如果有的话)与这个地址是同一个地点,并返回一个选择、一个校准过的概率和一个置信度。System One 模型是为这种形态的决策而造,不是为对话而造。

这正是成本敏感的匹配器所需要的形态。校准意味着当 Jev 说 0.9 时,它大约有 90% 的情况是对的,引擎因此可以把它的答案与错误匹配的代价放在一起权衡;而当 Jev 没有把握时,它会说明没有一个候选合适,而不是猜测。

Matcha 只在剩余案例上使用 Jev,即引擎自己无法裁定的案例,因此一个 100,000 条地址的作业只会发起几千次 Jev 调用,而不是十万次。把您的 TypeSafe API 密钥放进环境变量,在 PROC MATCHA 步骤中加入 adjudicate provider=jev;,并在您决定这些案例可以离开机器之前,让 allow_remote 保持关闭。

启用 Jev
export TYPESAFE_API_KEY=...       # never in a file
adjudicate provider=jev;          # inside the PROC MATCHA step

在损坏地址基准上测得,Jev 在引擎自身 98.1% 的精确率下把正确匹配从 83.3% 提升到 87.8%,逐阶段消融实验中的错误答案为 0.8%。在公众输入的真实查询上,它解决疑难案例的频率与本地模型相同,而当没有正确的候选时,它会如实说明,而不是随便选一个。

阅读 typesafe.ai 的文章: Introducing System One models and Jev

茶叶

开放的参照数据,只在您指示时更新

引擎对照您提供的表进行匹配,并借助开放知识包:来自 National Address Database 的美国地址点、来自 Census TIGER 的街道别名,以及来自 Statistics Canada 的加拿大地址,全部属于公有领域或开放许可。Jenner Analytics 在数据源发布时重建这些包,对照上一版本验证,签名后发布到数据通道。

在您亲自运行更新之前,您机器上的任何东西都不会改变。每个包在解压任何一个字节之前都会对照签名清单进行验证,并以原子方式换入,因此正在运行的任务看到的要么是旧包要么是新包,绝不会是不完整的包。PROC MATCHA 从不下载任何东西,报告会记录一次运行使用了哪个数据版本。

按您的计划先检查,再更新
jenner data update --check   # what would change; writes nothing
jenner data update           # install or refresh every pack
jenner data update --pin 2026.9.28

地区

美国为默认,并支持加拿大,包括双语形式。英国、法国、日本、韩国和澳大利亚的地区包正在准备中。每个包都是数据而不是代码,因此增加一个国家就是增加一个包。

一个匹配引擎,覆盖 KYC、AML、欺诈、信用风险、配送与合规

地址今天即可使用。KYC 家族中的每一种其他匹配都在同一引擎上运行:同样经校准的概率、同样按成本加权的判定、同样的输出和同样的评估运行。

一种新的匹配是一个实体定义,而不是一个新产品:记录所具有的角色、每个角色的比较器、分块策略,以及它可以查阅的知识包。评分、判定、追问列表和评估都是共享代码,因此个人姓名匹配的评估与定价方式和地址匹配完全相同。

同一引擎上的能力

IP 地址对邮政地址:地理定位距离与 VPN 信号

Matcha 将会话 IP 地址的地理定位位置与客户声称的地址进行比较,使用测地距离,并以地理定位半径作为不确定度。ASN、代理和 VPN 标志计为不利证据,绝不单独作为结论。结果是与地址匹配相同的经校准概率和按成本加权的判定,因此欺诈规则可以直接据此行动,或将其转入 review。

示例: 一位信用卡申请人从一个地理定位在 40 km 之外、无 VPN 标志的 IP 提交丹佛地址:在半径内一致。同一地址来自另一国家的数据中心 IP:冲突,该行按 review 定价。

咨询可用时间

电子邮件对个人与企业:本地部分、域名与一次性邮箱信号

电子邮件身份实体检验一个地址是否属于开户时声称的个人和组织。本地部分与姓名词元比较,涵盖 first.last、首字母缩写和昵称;域名与该组织的注册域名比较;免费邮箱与一次性域名列表以及 MX 记录的存在都是证据。每个信号都是一个比较器,引擎会说明它们的一致程度。

示例: [email protected] 对照 Northwind Actuarial 的 Jane Okafor:本地部分与姓名一致,域名与公司一致。[email protected] 对照同一记录:一次性域名,概率会如实反映。

咨询可用时间

企业名称匹配:法律形式、缩写与登记标识符

企业实体按 ISO 20275 剥离法律形式,为罕见词加权,展开缩写,并允许登记标识符覆盖名称:LEI、EIN、UEI 和 Companies House 编号。GLEIF Level 1 数据和 EDGAR 曾用名是知识包,因此改了名的公司仍能匹配到您账上的交易对手。供应商验证、交易对手匹配和 KYB 使用同一次运行。

示例: "INTL BUSINESS MACHINES CORP" 对照 "International Business Machines Corporation",且 LEI 一致:match,登记 ID 覆盖。"IBM Credit LLC" 对照母公司:nonmatch,并报告法律形式与罕见词证据。

咨询可用时间

个人姓名匹配:昵称、音译、语音比较与出生日期

个人实体使用昵称包、来自西里尔文、阿拉伯文和 CJK 的音译、语音比较和姓名顺序变体来比较名、中间名和姓,并把颠倒的出生日期或校验和有效的国民身份证号当作它们应有的证据。制裁或 PEP 名单是一张把漏匹配成本设得很高的普通参照表,因此筛查与客户去重是同一引擎,只是价格不同。

示例: "Mohammed Al-Rashid, 03/07/1981" 对照 "Muhammad Alrashid, 07/03/1981":音译一致,日期是日月颠倒,该行作为附带概率的筛查命中返回,而不是被漏掉。

咨询可用时间

电话号码与标识符:IBAN、VIN、NPI 与国民身份证号

电话号码被规范化为 E.164,并检查国家与区域的一致性以及运营商类型。标识符在匹配之前先经验证:IBAN、VIN 和 NPI 校验和、格式与签发方一致性、国民身份证号的形态。有效的标识符是强有力的证据;无效的标识符本身就是一项发现,在对任何候选评分之前就会报告。

示例: 申请人的 IBAN 未通过 mod-97 校验:该行在匹配前即被标记并附上原因,而不是拿去与参照表中的每个账户逐一评分。

咨询可用时间

坐标、家庭、交易对手与产品名称

实体可以组合。设备坐标反向地理编码到最近的地址点;家庭是地址匹配加上姓氏一致;交易对手是企业或个人加上账户和国家;产品或药品名称按词元包含匹配,并可由代码覆盖。评分代码不区分这些差别,这正是每一种都能在同一引擎上、以同样的评估运行落地的原因。

示例: 配送应用的 GPS 定位落在订单地址 30 m 之内:一致,并报告距离。同一地址上两条姓氏一致的客户记录:同一家庭,关联附带经校准的概率。

咨询可用时间

为承担风险的团队而建

KYC 开户与身份验证

一步验证申请人提供的地址、电子邮件、电话和标识符,每项检查一个概率,遇到歧义时一个追问。Matcha 在申请人仍停留在页面上时解析地址,并询问“Milton or Morton?”,而不是让检查失败或直接放行。

咨询可用时间 →

欺诈检测与会话风险

把会话的 IP 位置与所声称的地址比较,把设备坐标与配送地址比较,把电子邮件与个人比较,得到规则可以据以行动的证据,而不是黑箱分数。匹配器考虑过的每一个候选都会报告,并附上真实答案根本不在您表中的概率。

咨询可用时间 →

AML 与制裁筛查

对照制裁与 PEP 名单筛查个人和企业名称,支持音译、昵称、语音比较和出生日期颠倒,并按筛查的需要定价:漏掉命中代价高,误报代价低。名单就是一张参照表,评估运行对照已知案例为您的命中率打分,校准曲线告诉您在您的数据上 0.9 意味着什么。

咨询可用时间 →

信用风险与交易对手识别

把申请、交易或账本上的企业跨法律形式、曾用名和登记标识符归并为一个法律实体,让敞口只计一次。LEI、EIN、UEI 和 Companies House 编号存在时覆盖名称,不存在时佐证名称。

咨询可用时间 →

配送、物流与地址验证

把每条地址标准化到其所在地区的邮政规则,与您的可服务地址表匹配,并得知地址是真实但在您的区域之外,还是真实但不在您的表中。门口的设备坐标确认配送点,成本权重决定何时错误地址比拒绝订单更糟。

咨询可用时间 →

合规、审计与数据治理

每个判定都带有概率、理由和考虑过的候选,记录在您自己保留的表中。除非您选择添加模型,否则没有任何东西离开您的机器;报告记录本次运行使用了哪个数据版本,同一评估运行在数月之后仍能为审计人员重现结果。

咨询可用时间 →

包含在 Jenner 中

PROC MATCHA 是 Jenner 的一部分,不是单独的产品,也不按行收费。在 Windows 和 Linux 上,Jenner 授权按机器一次购买、永久有效:您购买的版本想用多久就能一直运行,并包含一年的新版本和支持。macOS 版 Jenner 在 Mac App Store 上提供,Workspace 按小时计费。

对于匹配的每一行、考虑的每一个候选或提出的每一个问题,Jenner Analytics 都不收取费用。如果您选择 Jev,由 TypeSafe 按输入词元定价,而且它只看到剩余部分。

购买 Jenner

查看价格

常见问题

为了兼容,Jenner 可以运行现有的 PROC DQMATCH 和 PROC DQSCHEME 代码,因此 SAS 数据质量程序可以继续工作。Matcha 是新工作推荐使用的匹配器:它使用同样的 SAS 风格语句语法,但为每个判定返回经校准的概率和理由,可以提出追问,并通过同样的 data= 语法读写 CSV、Parquet、Avro 和大多数数据库,因此您不会被锁定在任何一个工具上。

不会。引擎是 Jenner 二进制程序内的原生 Rust,不进行任何网络调用;参照数据是您提供的表加上安装在您机器上的知识包。语言模型默认关闭。通过 Ollama 使用本地模型时,一切都留在您的硬件上。只有当您在配置中启用时才会使用 Jev 这样的远程模型,而且它只看到未决案例及其候选,绝不会看到整个文件。

美国是默认地区,按 USPS Publication 28 进行标准化,并使用来自 National Address Database 和 Census TIGER 的开放地址数据。支持加拿大,包括法语双语形式和加拿大邮政编码,数据来自 Statistics Canada。英国、法国、日本、韩国和澳大利亚的地区包正在准备中。今天您就可以在任何国家对照自己的参照表进行匹配;地区包增加的是标准化规则和开放地址点。

可以。引擎不需要服务、密钥或网络。参照包用 jenner data update 安装一次,只有当您再次运行该命令时才会刷新。使用本地 Ollama 模型时,可选的裁定步骤也是离线的;只有 Jev 是远程调用,而且只在您开启时才会发生。

当引擎在候选之间无法定夺、而您已为追问渠道定价时,这些行会以 review 输出,附带排序后的候选、能够解决问题的确切字段(后缀、方位、单元)以及概率。您的流程把它变成一个提给能回答之人的问题:一条短信回复、开户表单上的一个提示、一块呼叫中心的屏幕。匹配这一侧没有人阅读这些行,而没有定价渠道时,它们会作为 nonmatch 报告,附带同样的候选。

给一次运行提供一份已知正确记录的输入真值文件,Matcha 就会据此为每个判定打分:首次尝试即正确、精确率、错误答案、前五个候选中的召回率、对范围外输入的正确弃答、一条校准曲线,以及一系列错误权重下的期望成本。本页公布的结果来自同一运行模式,针对结果已知的公众查询和真值确切的被破坏地址。

可以,在同一引擎上。地址今天即可使用。个人姓名、企业名称、电子邮件身份、IP 位置、电话号码、带校验和的标识符以及制裁或 PEP 名单,都是同一引擎匹配的实体,采用同样经校准的概率、按成本加权的判定、输出和评估运行。筛查名单就是一张把漏匹配成本设得很高的普通参照表。请使用本页的表单咨询您所需实体的可用时间。

Matcha 包含在 Jenner 中,因此您购买的是 Jenner:面向 Windows 和 Linux 的按机器永久授权、Mac App Store 上的 macOS 版 Jenner,或按小时计费的 Workspace 额度。没有按行或按匹配收费。价格页面列有当前方案和免费试用。

能。制裁或 PEP 名单是一张个人或企业参照表,而筛查就是把成本倒过来的匹配:漏掉命中定价高,误报定价低。个人实体处理昵称、来自西里尔文、阿拉伯文和 CJK 的音译、语音比较、姓名顺序变体和出生日期颠倒,评估运行对照已知案例为您的命中率打分。请通过本页表单咨询可用时间。

能。IP 位置实体对会话的 IP 地址做地理定位,以地理定位半径作为不确定度,按测地距离与所声称地址的坐标比较,并把 ASN、代理和 VPN 标志视为不利证据。结果是与地址匹配相同的经校准概率和判定,因此欺诈规则或 review 队列可以直接使用。

能。企业实体按 ISO 20275 剥离法律形式,为罕见词加权,展开缩写,并允许登记标识符覆盖名称:LEI、EIN、UEI 和 Companies House 编号。GLEIF 数据和 EDGAR 曾用名是知识包,因此改了名的公司仍能归并到您账上的交易对手。这就是在一次运行中完成供应商验证、交易对手匹配和 KYB。

Jev 是 TypeSafe (typesafe.ai) 开发的 System One 模型。它不生成文本,而是用一个选择、一个校准过的概率和一个置信度来回答一个类型化的问题:哪个候选(如果有的话)与这个地址是同一个地点。Matcha 使用它,是因为这正是匹配决策的形态:当 Jev 说 0.9 时,它大约有 90% 的情况是对的,没有把握时它会说明没有一个候选合适。它只在引擎无法裁定的剩余案例上被调用,每 100,000 行几千次调用;在损坏地址基准上,它在引擎自身 98.1% 的精确率下把正确匹配从 83.3% 提升到 87.8%。它默认关闭,需要环境变量中的 TypeSafe API 密钥以及步骤中的 adjudicate provider=jev;。

可以。把 Matcha 指向 Ollama 在您自己硬件上提供的本地模型,完全离线,同一个裁定步骤就会在没有任何数据离开机器的情况下运行。我们以 qwen2.5:7b-instruct 做基准测试。本地模型几乎回答向它展示的每一个案例,因此找到的匹配最多,在损坏地址基准上正确率为 89.3%,但错误答案比 Jev 大约多一倍。您也可以同时运行两者,每行得到一个 agree 标志。两者都不是必需的:仅靠引擎就不需要模型、密钥或网络。

用您自己的地址试一试

对照几百条您能担保的记录运行一次评估,就能得到一个诚实的数字,说明它在您的数据上表现如何。

应用场景

告诉我们您的匹配问题

地址今天即可使用。申请在您自己的数据上进行评估运行,或咨询同一引擎上某项能力的可用时间,我们会回复时间安排以及搭建所需的条件。

亲自看看 Matcha

购买 Jenner 并在您自己的地址上运行 PROC MATCHA,阅读文档,或观看三分钟的 Jenner 介绍视频。

观看 3 分钟介绍视频