Matcha propojuje nepořádné, překlepané a napůl vyplněné adresy se záznamy, ke kterým ve skutečnosti patří, na vašem vlastním stroji, s kalibrovanou pravděpodobností a zdůvodněním každého rozhodnutí. Jména osob, názvy firem, e-mail, poloha IP adresy a identifikátory běží na stejném enginu. Na těžké případy přidejte Jev (typesafe.ai) nebo lokální model Ollama.
Součást Jenneru. Žádná externí služba, žádný klíč API, žádná data neopouštějí vaši síť, pokud se nerozhodnete přidat model: Jev (typesafe.ai) nebo lokální model Ollama.
Pro koho je určena
Šest úloh, kde je adresa klíčem a klíč se nikdy nenapíše dvakrát stejně.
KYC a onboarding zákazníků
Žadatel napíše svou adresu jednou, na telefonu, ve spěchu. Matcha ji vyhodnotí proti vaší referenční tabulce, ještě když je stále na stránce, a když jsou dva záznamy stejně věrohodné, pojmenuje to jediné pole, které by to rozhodlo, takže se formulář může zeptat „Milton or Morton?“ místo toho, aby kontrola selhala nebo prošla bez povšimnutí.
AML a screening proti sankčním seznamům
Screening je párování s obrácenými náklady: přehlédnutá shoda je drahá a planý poplach levný. Matcha bere tyto náklady jako vstupy a podle nich posouvá své prahy, takže stejný engine, který zákazníka onboarduje, ho dokáže i prověřit. Adresy jsou k dispozici už dnes; screening jmen osob a názvů firem proti sankčním seznamům a seznamům PEP běží na stejném enginu, se stejnými rozhodnutími.
Detekce podvodů
Matcha vykazuje každého kandidáta, kterého zvažovala, s důkazy po jednotlivých polích a pravděpodobností, že správná odpověď v tabulce vůbec není. Pravidlo pro odhalování podvodů tak může pracovat s tím, na co se párovač skutečně díval, a ne s jediným skóre, a entita polohy IP adresy ověřuje polohu relace proti adrese, kterou zákazník uvádí.
Marketing a deduplikace CRM
Stejná domácnost se v registracích, objednávkách a importech objeví deseti způsoby. Matcha páruje tabulku samu se sebou, zapisuje shluky a u každé vazby zachovává kalibrovanou pravděpodobnost, takže deduplikace může být tak přísná nebo tak shovívavá, jak to vyžaduje rozesílka, kterou napájí. Householding podle adresy a příjmení je složená entita na stejném enginu.
Doručování a logistika
Špatné doručení stojí cestu zpět; odmítnutá objednávka stojí prodej. Matcha standardizuje každou adresu podle poštovních pravidel její lokality, spáruje ji s vaší tabulkou obsluhovaných adres a řekne vám, kdy je adresa skutečná, ale mimo vaši oblast, nebo skutečná, ale ve vaší tabulce chybí, takže oprava putuje na správné místo.
Veřejná správa a civic tech
Městská služba pro vyhledávání parcel umožnila obyvatelům poslat adresu esemeskou a dostat zpět svou parcelu. Na nejtěžších případech, překlepech a chybách z diktování, které její předchozí párovač pokaždé vyhodnotil špatně, odpověděl samotný engine Matcha správně na první pokus v 81 % případů a model nasazený na zbytek to zvedl na 91 %.
Jak to funguje
Nativní Rust uvnitř binárky Jenneru. Jeden krok, jedna tabulka rozhodnutí a zdůvodnění každého z nich.
1
Rozparsovat a standardizovat
Každá adresa se rozdělí na číslo domu, směr, ulici, příponu, jednotku, město a poštovní směrovací číslo a normalizuje se podle poštovních pravidel své lokality (USPS Publication 28 pro USA, Canada Post pro Kanadu). Tam, kde je text nejednoznačný, si parser ponechá každé čtení a nechá rozhodnout referenční tabulku.
2
Najít kandidáty ve vaší tabulce
Engine si z vaší vlastní referenční tabulky sestaví slovník ulic a napsanou ulici k němu přiřadí podle pravopisu, zvuku a oficiálních aliasů. Kandidáti se hledají podle čísla domu, poštovního směrovacího čísla a ulice, takže špatný ZIP není fatální.
3
Ohodnotit každé pole, kalibrovat výsledek
Číslo domu, ulice, přípona, směr, jednotka a poštovní směrovací číslo se porovnávají zvlášť a důkazy se skládají do kalibrované pravděpodobnosti. Chybějící přípona nestojí nic, když referenční tabulka má jednu ulici toho jména, a vyvolá otázku, když má dvě.
4
Rozhodnout podle nákladů
Vy řeknete, kolik ve vašem procesu stojí chybná shoda, přehlédnutá shoda a doplňující otázka. Engine zvolí rozhodnutí s nejnižšími očekávanými náklady, takže páruje jen tehdy, když si je pro vaše čísla dostatečně jistý, a když si jistý není, vrátí žádnou shodu místo shody chybné.
5
Vykázat vše, na co se díval
Jeden řádek na vstup s rozhodnutím, pravděpodobností a zdůvodněním; jeden řádek na kandidáta s důkazy po jednotlivých polích; tabulka metrik, která říká, proč se vstupy nespárovaly. Nic se tiše nezahazuje.
6
Poslat modelu jen zbytek
Volitelně jdou případy, které engine nedokáže rozhodnout, i se svými kandidáty k jazykovému modelu, uvnitř téhož kroku. Model vybere jednoho kandidáta, nebo řekne, že žádný nesedí; adresu nikdy nepřepisuje.
Šest rozhodnutí, každé s připojenou pravděpodobností
match
Jeden kandidát je s vysokou pravděpodobností správný záznam. Použijte ho.
likely
Nejpravděpodobnější kandidát, vykázaný se svou skutečnou pravděpodobností, když je pod prahem pro match. Nikdy náhodný výběr.
nonmatch
Žádný věrohodný kandidát. Berte jako nenalezeno; zvažovaní kandidáti se přesto vykazují.
review
Engine nedokázal rozhodnout a váš proces se může zeptat. Vydává se jen tehdy, když oceníte kanál pro doplňující otázky.
not_in_table
Skutečná adresa, kterou vaše referenční tabulka neobsahuje. Opravte referenční tabulku, ne vstup.
out_of_area
Poštovní směrovací číslo nebo místo leží mimo oblast referenční tabulky. Nasměrujte ji jinam.
Seznam doplňujících otázek: zeptejte se přesně na to pravé
Většina párovačů předává své těžké případy do fronty pro ruční kontrolu, kterou nikdo neobsluhuje. Když Matcha nedokáže rozhodnout mezi kandidáty, ví proč: vstup říkal 1200 Milton Street a referenční tabulka má 1200 Milton St i 1200 Morton St, dva názvy ulic, které vypadají podobně a podobně znějí. To je otázka s odpovědí na jedno slovo.
Když tedy oceníte kanál pro doplňující otázky, nerozhodnuté řádky vyjdou jako review se seřazenými kandidáty, přesným polem, které by to rozhodlo (ask about street, ask about unit), a pravděpodobnostmi, které váš proces potřebuje k rozhodnutí, zda otázka stojí za položení. Služba SMS odpoví „Milton or Morton?“. Onboardingový formulář zobrazí obě adresy. Obrazovka call centra ukáže agentovi kandidáty místo prázdného místa. Bez oceněného kanálu žádné rozhodnutí review neexistuje: tyto řádky jsou nonmatch, se stejnými kandidáty a stejným zdůvodněním.
Začněte evaluačním během
Dejte Matche soubor s pravdou, pár set vstupů, za jejichž správný záznam můžete ručit, a jeden běh oskóruje každé rozhodnutí proti němu: správně na první pokus, přesnost provedených shod, chybné odpovědi, úplnost mezi pěti nejlepšími kandidáty, kalibrační křivku a očekávané náklady pro každou váhu chyby, abyste si tu svou mohli vybrat z křivky, a ne hádat.
Naměřené výsledky
Dva testy, jeden na tom, co skutečně píše veřejnost, a jeden na záměrně poškozených adresách ze šesti oblastí USA. Čísla tak, jak jsou zveřejněna v dokumentaci.
Skutečné dotazy napsané veřejností
Asi 2 400 adres, které obyvatelé napsali do městské služby pro vyhledávání parcel, proti registru asi 378 000 parcel, přičemž správná parcela byla známa z toho, co následovalo. Na 223 nejtěžších případech, skutečných překlepech, artefaktech z diktování a chybějících příponách, byl předchozí párovač města na první pokus pokaždé vedle.
0 % až 81 %
těžkých případů spárovaných správně na první pokus, samotný engine
91 %
s lokálním modelem nebo Jevem nasazeným na zbytek
89 % až 97 %
shoda na snadných případech, od samotného enginu po engine s modelem
Záměrně poškozené adresy, celostátně
3 000 skutečných adres ze šesti náhodně vybraných oblastí ZIP, čerpaných z National Address Database a poškozených směsí chyb naměřenou na reálných datech: překlepy, vypuštěné směry a přípony, zkratky, slepené tokeny a přehozené číslice. Pravda je známa přesně a každý vstup končí jako shoda nebo neshoda, aniž by se cokoli odkládalo pro člověka.
83,3 %
správná shoda na první pokus, samotný engine
98,1 %
přesnost provedených shod
1,6 %
chybných odpovědí, asi jedna ze šedesáti
87,8 % až 89,3 %
správně na první pokus s Jevem nebo lokálním modelem nasazeným na zbytek
Samotné skóre podobnosti je nebezpečné: se zapnutým fuzzy párováním ulic a ničím nad ním se každá čtvrtá adresa vrátila špatně. Většinu práce odvedou alternativní čtení, aliasy a rozlišení budov a rozhodovací vrstva pak sníží chybné odpovědi z 3,6 % na 0,7 % tím, že když si není dost jistá, vrátí žádnou shodu místo chybné. Váhy nákladů vám umožní posunout tento kompromis kterýmkoli směrem.
Přínos po fázích: co každá vrstva přidává
Stejných 3 000 poškozených adres, párovaných vždy s jednou další zapnutou vrstvou. Fáze 1 až 5 jsou kumulativní; poslední dvě jsou alternativy nasazené na zbytek po plném enginu.
Přesná shoda řetězců dá 34,6 % správně a nic chybně. Parsování a standardizace zvedne správné shody na 48,8 %, ale chybné na 20,8 %. Fuzzy párování ulic zvedne správné na 64,5 % a chybné na 25,0 %. Alternativní čtení, aliasy a jednotky dostanou správné na 89,3 % a chybné dolů na 3,6 %. Rozhodování podle nákladů, tedy plný engine, dává 84,1 % správně a 0,7 % chybně. Na zbytku po tomto enginu dosáhne lokální model Ollama 90,0 % správně s 2,1 % chybně a Jev 88,5 % správně s 0,8 % chybně.
Podíl 3 000 poškozených adres spárovaných správně, spárovaných chybně nebo nenalezených, po fázích. Poslední dva řádky jsou alternativy odvětvené z fáze 5, ne pokračování řady.
Fáze
Správná shoda
Chybná shoda
Nenalezeno
fáze 1: Přesná shoda
34.6%
0.0%
65.4%
fáze 2: Parsování a standardizace
48.8%
20.8%
30.4%
fáze 3: Fuzzy ulice
64.5%
25.0%
10.5%
fáze 4: Alternativy a jednotky
89.3%
3.6%
7.1%
fáze 5: Rozhodování podle nákladů
84.1%
0.7%
15.2%
+ AI na zbytek: Lokální AI (Ollama)
90.0%
2.1%
7.8%
+ AI na zbytek: Jev (TypeSafe)
88.5%
0.8%
10.7%
Zdroj: 3 000 skutečných adres v USA ze šesti náhodně vybraných oblastí ZIP, čerpaných z National Address Database a poškozených směsí chyb naměřenou na reálných datech, takže pravda je známa přesně. Čísla tak, jak jsou zveřejněna v dokumentaci PROC MATCHA.
Samotné fuzzy párování je nebezpečné. Se zapnutým fuzzy párováním ulic a ničím nad ním se každá čtvrtá adresa vrátí špatně a nic ve skóre podobnosti vám neřekne která.
Vrstva alternativ odvede nejtěžší práci. Oficiální aliasy ulic, alternativní pravopisy a rozlišení jednotek a budov zvednou správné shody z 64,5 % na 89,3 % a sníží chybné z 25,0 % na 3,6 %.
Rozhodovací vrstva stlačí chybné odpovědi pod 1 %. Když oceníte chybnou shodu proti přehlédnuté, engine vrátí žádnou shodu místo chybné, když si není dost jistý: 0,7 % chybně, přičemž nerozhodnuté případy se vykazují, ne zahazují.
AI na zbytku zvedne správné shody na zhruba 90 %. Lokální model najde nejvíce shod a zhruba ztrojnásobí chybné odpovědi; Jev přidává shody s přesností samotného enginu, 0,8 % chybně.
Spusťte ji na vlastních adresách
Matcha je součástí každé licence Jenneru. Kupte Jenner, přečtěte si dokumentaci PROC MATCHA, nebo nám popište svůj párovací problém a pomůžeme vám nastavit evaluační běh.
Jazykové modely jsou drahé na řádek a pomalé na řádek. Matcha je používá tak, jak by to udělal dobrý analytik: jen na případy, které vyžadují úsudek.
Ollama s qwen2.5:7b-instruct, zcela offline
Spusťte lokální model přes Ollama na vlastním hardwaru, zcela offline, takže stroj nic neopustí. Měříme s qwen2.5:7b-instruct. Lokální modely jsou zdarma na řádek a odpovídají téměř na každou otázku, kterou dostanou, což najde nejvíce shod a zhruba zdvojnásobí chybné odpovědi.
Jev, model System One od TypeSafe (typesafe.ai)
Místo generování textu Jev odpovídá na typovanou otázku, který kandidát, pokud vůbec některý, je totéž místo jako tato adresa, a vrací volbu s kalibrovanou pravděpodobností. Když řekne 0,9, má pravdu asi v 90 % případů, a když si není jistý, řekne, že žádný z kandidátů nesedí, místo aby hádal. To je přesně tvar, který párovač zohledňující náklady potřebuje, a proto Jev přidává shody s přesností samotného enginu.
V naměřených bězích tvoří pásmo nerozhodnutých 2 % až 8 % vstupů, takže úloha se 100 000 adresami vyvolá pár tisíc volání modelu, ne sto tisíc.
Obojí je volitelné a obojí je ve výchozím nastavení vypnuté. Engine nepotřebuje ani jedno a vzdálený model lze použít teprve poté, co v konfiguraci nastavíte allow_remote.
Jev od typesafe.ai: modely System One pro těžké případy
Jev vyvíjí TypeSafe (typesafe.ai). Matcha jej volá jen na zbytek, který motor nedokáže rozhodnout sám.
Jev je model System One od TypeSafe. Místo generování textu odpovídá na typovanou otázku, který kandidát, pokud vůbec některý, je totéž místo jako tato adresa, a vrací volbu, kalibrovanou pravděpodobnost a jistotu. Modely System One jsou stavěné pro rozhodnutí tohoto tvaru, ne pro konverzaci.
Přesně tento tvar potřebuje párovač, který počítá s náklady. Kalibrovaný znamená, že když Jev řekne 0.9, má pravdu zhruba v 90% případů, takže motor může jeho odpověď zvážit proti ceně chybné shody, a když si Jev není jistý, řekne, že žádný z kandidátů nesedí, místo aby hádal.
Matcha používá Jev jen na zbytek, případy, které motor nedokáže rozhodnout sám, takže úloha se 100,000 adresami udělá několik tisíc volání Jev, ne sto tisíc. Vložte svůj klíč API TypeSafe do prostředí, přidejte adjudicate provider=jev; do kroku PROC MATCHA a nechte allow_remote vypnuté, dokud nerozhodnete, že tyto případy smějí váš stroj opustit.
Zapnutí Jev
export TYPESAFE_API_KEY=... # never in a file
adjudicate provider=jev; # inside the PROC MATCHA step
Měřeno na benchmarku poškozených adres zvedá Jev správné shody z 83.3% na 87.8% při vlastní přesnosti motoru 98.1%, s 0.8% chybných odpovědí v ablaci po jednotlivých stupních. Na skutečných dotazech psaných veřejností vyřešil těžké případy stejně často jako lokální model, a když žádný kandidát nebyl správný, řekl to, místo aby některého vybral.
Otevřená referenční data, aktualizovaná jen tehdy, když řeknete
Engine páruje proti tabulce, kterou mu dáte, s pomocí otevřených balíčků znalostí: adresních bodů USA z National Address Database, aliasů ulic z Census TIGER a kanadských adres od Statistics Canada, vše ve veřejné doméně nebo pod otevřenou licencí. Jenner Analytics balíčky znovu sestaví, když jejich zdroje publikují, ověří je proti předchozímu vydání, podepíše je a zveřejní v datovém kanálu.
Na vašem stroji se nic nezmění, dokud aktualizaci nespustíte sami. Každý balíček se před rozbalením jediného bajtu ověří proti podepsanému manifestu a vymění se atomicky, takže běžící úloha vidí starý balíček, nebo nový, a nikdy částečný. PROC MATCHA nikdy nic nestahuje a report zaznamenává, které vydání dat běh použil.
Zkontrolujte, pak aktualizujte, podle vlastního harmonogramu
jenner data update --check # what would change; writes nothing
jenner data update # install or refresh every pack
jenner data update --pin 2026.9.28
Lokality
USA jsou výchozí a Kanada je podporována, včetně dvojjazyčných forem. Balíčky lokalit pro Spojené království, Francii, Japonsko, Koreu a Austrálii se připravují. Každý z nich jsou data, ne kód, takže přidání země znamená přidání balíčku.
Jeden párovací engine pro KYC, AML, fraud, kreditní riziko, doručování a compliance
Adresy jsou k dispozici už dnes. Každé další párování z rodiny KYC běží na stejném enginu: stejné kalibrované pravděpodobnosti, stejné rozhodování podle nákladů, stejné výstupy a stejný evaluační běh.
Nový druh párování je definice entity, ne nový produkt: role, které záznam má, komparátor pro každou roli, strategie blokování a balíčky znalostí, do kterých smí nahlížet. Skórování, rozhodování, seznam doplňujících otázek a evaluace jsou sdílený kód, takže párování jmen osob se vyhodnocuje a oceňuje přesně stejně jako párování adres.
Schopnosti na stejném enginu
IP adresa vůči poštovní adrese: vzdálenost geolokace a signály VPN
Matcha porovnává, kam se geolokuje IP adresa relace, s adresou, kterou zákazník uvádí, pomocí geodetické vzdálenosti s poloměrem geolokace jako nejistotou. Příznaky ASN, proxy a VPN se počítají jako důkaz proti, nikdy jako verdikt samy o sobě. Výsledkem je stejná kalibrovaná pravděpodobnost a rozhodnutí podle nákladů jako u párování adres, takže pravidlo pro odhalování podvodů podle něj může jednat, nebo ho poslat na review.
Příklad: Žadatel o kartu uvede adresu v Denveru z IP adresy, která se geolokuje 40 km daleko, bez příznaku VPN: shoda v rámci poloměru. Stejná adresa z IP adresy datového centra v jiné zemi: konflikt, a řádek je oceněn pro review.
E-mail vůči osobě a firmě: lokální část, doména a signály jednorázových adres
Entita e-mailové identity testuje, zda adresa patří osobě a organizaci uvedeným při onboardingu. Lokální část se porovnává s tokeny jména, včetně tvarů first.last, iniciál a přezdívek; doména se porovnává s registrovanými doménami organizace; seznamy freemailových a jednorázových domén a přítomnost záznamu MX jsou důkazy. Každý signál je komparátor a engine říká, jak silně se shodují.
Příklad:[email protected] proti Jane Okafor z Northwind Actuarial: lokální část se shoduje se jménem a doména s firmou. [email protected] proti stejnému záznamu: jednorázová doména, a pravděpodobnost to říká.
Párování názvů firem: právní formy, akronymy a identifikátory z rejstříků
Firemní entita odstraňuje právní formy podle ISO 20275, váží vzácná slova, rozepisuje akronymy a nechá identifikátor z rejstříku přebít název: LEI, EIN, UEI a čísla Companies House. Data GLEIF Level 1 a dřívější názvy z EDGAR jsou balíčky znalostí, takže firma, která se přejmenovala, se stále spáruje s protistranou ve vašich knihách. Ověřování dodavatelů, párování protistran a KYB používají stejný běh.
Příklad: "INTL BUSINESS MACHINES CORP" proti "International Business Machines Corporation" se shodným LEI: match, přebito identifikátorem z rejstříku. "IBM Credit LLC" proti mateřské firmě: nonmatch, s vykázanými důkazy o právní formě a vzácných slovech.
Párování jmen osob: přezdívky, transliterace, fonetika a datum narození
Entita osoby porovnává křestní jména, prostřední jména a příjmení s balíčky přezdívek, transliterací z cyrilice, arabštiny a CJK, fonetickým porovnáním a variantami pořadí jmen a bere přehozené datum narození nebo národní identifikátor s platným kontrolním součtem jako důkaz, kterým je. Sankční seznam nebo seznam PEP je běžná referenční tabulka s vysoko nastavenými náklady za přehlédnutou shodu, takže screening a deduplikace zákazníků jsou stejný engine s jinými cenami.
Příklad: "Mohammed Al-Rashid, 03/07/1981" proti "Muhammad Alrashid, 07/03/1981": transliterace se shoduje, datum je záměna dne a měsíce a řádek se vrátí jako screeningový zásah se svou pravděpodobností, ne jako přehlédnutý.
Telefonní čísla a identifikátory: IBAN, VIN, NPI a národní identifikátory
Telefonní čísla se normalizují na E.164 a kontrolují na konzistenci země a oblasti a typ operátora. Identifikátory se před párováním validují: kontrolní součty IBAN, VIN a NPI, konzistence formátu a vydavatele, tvary národních identifikátorů. Platný identifikátor je silný důkaz; neplatný je zjištění sám o sobě, vykázané dřív, než se oskóruje jediný kandidát.
Příklad: IBAN žadatele neprojde kontrolou mod-97: řádek je označen před párováním, i s důvodem, místo aby se skóroval proti každému účtu v referenční tabulce.
Souřadnice, domácnosti, protistrany transakcí a názvy produktů
Entity se skládají. Souřadnice zařízení se zpětně geokóduje na nejbližší adresní bod; domácnost je shoda adresy plus shoda příjmení; protistrana transakce je firma nebo osoba plus účet a země; název produktu nebo léčiva se páruje podle obsažených tokenů s přebitím kódem. Skórovací kód rozdíl nezná, a proto každá z nich přichází na stejném enginu se stejným evaluačním během.
Příklad: GPS fix doručovací aplikace přistane 30 m od adresy na objednávce: shoda, s vykázanou vzdáleností. Dva zákaznické záznamy na jedné adrese se shodným příjmením: jedna domácnost, s kalibrovanou pravděpodobností na vazbě.
Ověřte adresu, e-mail, telefon a identifikátory, které vám žadatel dá, v jednom kroku, s jednou pravděpodobností na kontrolu a jednou doplňující otázkou, když je něco nejednoznačné. Matcha vyhodnotí adresu, ještě když je žadatel na stránce, a zeptá se „Milton or Morton?“ místo toho, aby kontrola selhala nebo prošla bez povšimnutí.
Porovnejte polohu IP adresy relace s uvedenou adresou, souřadnici zařízení s doručovací adresou a e-mail s osobou a získejte důkazy, podle kterých může pravidlo jednat, místo skóre z černé skříňky. Každý kandidát, kterého párovač zvažoval, se vykazuje, s pravděpodobností, že správná odpověď ve vaší tabulce vůbec není.
Prověřujte jména osob a názvy firem proti sankčním seznamům a seznamům PEP s transliterací, přezdívkami, fonetikou a záměnami v datu narození, oceněno pro screening: přehlédnutý zásah drahý, planý poplach levný. Seznam je referenční tabulka, evaluační běh oskóruje vaši míru zásahů proti známým případům a kalibrační křivka vám řekne, co na vašich datech znamená 0,9.
Rozlište firmy na žádosti, v obchodu nebo v účetní knize na jednu právnickou osobu napříč právními formami, dřívějšími názvy a identifikátory z rejstříků, aby se expozice počítala jen jednou. LEI, EIN, UEI a čísla Companies House přebíjejí názvy, když jsou k dispozici, a potvrzují je, když nejsou.
Standardizujte každou adresu podle poštovních pravidel její lokality, spárujte ji s vaší tabulkou obsluhovaných adres a zjistěte, kdy je adresa skutečná, ale mimo vaši oblast, nebo skutečná, ale ve vaší tabulce chybí. Souřadnice zařízení u dveří potvrdí místo doručení a váhy nákladů rozhodnou, kdy je špatná adresa horší než odmítnutá objednávka.
Každé rozhodnutí nese pravděpodobnost, zdůvodnění a zvažované kandidáty, v tabulkách, které si ponecháte. Nic neopustí váš stroj, pokud se nerozhodnete přidat model, report zaznamenává, které vydání dat běh použil, a stejný evaluační běh reprodukuje výsledek pro auditora i o měsíce později.
PROC MATCHA je součástí Jenneru, není to samostatný produkt ani poplatek za řádek. Na Windows a Linuxu se licence Jenneru kupuje jednou na stroj a je trvalá: verze, kterou koupíte, běží dál tak dlouho, jak ji chcete používat, s novými vydáními a podporou na rok v ceně. Jenner pro macOS je v Mac App Store a Workspace se účtuje po hodinách.
Jenner Analytics si neúčtuje nic za spárovaný řádek, zvažovaného kandidáta ani položenou otázku. Pokud zvolíte Jev, TypeSafe ho účtuje podle vstupních tokenů a vidí jen zbytek.
Jenner kvůli kompatibilitě spouští stávající kód PROC DQMATCH a PROC DQSCHEME, takže program pro kvalitu dat v SAS funguje dál. Matcha je doporučený párovač pro novou práci: používá stejnou syntaxi příkazů ve stylu SAS, ale vrací kalibrovanou pravděpodobnost a zdůvodnění každého rozhodnutí, umí položit doplňující otázku a čte i zapisuje CSV, Parquet, Avro a většinu databází přes stejnou syntaxi data=, takže nejste uzamčeni ani v jednom z nástrojů.
Ne. Engine je nativní Rust uvnitř binárky Jenneru a neprovádí žádná síťová volání; referenční data jsou tabulka, kterou mu dáte, plus balíčky znalostí nainstalované na vašem stroji. Jazykové modely jsou ve výchozím nastavení vypnuté. Lokální model přes Ollama ponechá vše na vašem hardwaru. Vzdálený model, jako je Jev, se použije jen tehdy, když ho v konfiguraci povolíte, a pak vidí jen nerozhodnuté případy s jejich kandidáty, nikdy celý soubor.
Výchozí lokalitou jsou Spojené státy, se standardizací podle USPS Publication 28 a otevřenými adresními daty z National Address Database a Census TIGER. Kanada je podporována, včetně dvojjazyčných francouzských forem a kanadských poštovních směrovacích čísel, s daty od Statistics Canada. Balíčky lokalit pro Spojené království, Francii, Japonsko, Koreu a Austrálii se připravují. Proti vlastní referenční tabulce můžete párovat v kterékoli zemi už dnes; balíčky přidávají standardizační pravidla a otevřené adresní body.
Ano. Engine nepotřebuje žádnou službu, žádný klíč ani síť. Referenční balíčky se nainstalují jednou pomocí jenner data update a obnoví se jen tehdy, když tento příkaz spustíte znovu. S lokálním modelem Ollama je i volitelný krok adjudikace offline; jen Jev je vzdálené volání, a to jen pokud ho zapnete.
Když engine nedokáže rozhodnout mezi kandidáty a vy jste ocenili kanál pro doplňující otázky, vyjdou tyto řádky jako review se seřazenými kandidáty, přesným polem, které by otázku rozhodlo (přípona, směr, jednotka), a pravděpodobnostmi. Váš proces z toho udělá otázku pro toho, kdo na ni umí odpovědět: odpověď SMS, výzvu v onboardingovém formuláři, obrazovku call centra. Na straně párování tyto řádky nikdo nečte a bez oceněného kanálu se vykazují jako nonmatch se stejnými připojenými kandidáty.
Dejte běhu soubor s pravdou, vstupy, jejichž správný záznam znáte, a Matcha oskóruje každé rozhodnutí proti němu: správně na první pokus, přesnost, chybné odpovědi, úplnost mezi pěti nejlepšími kandidáty, správná zdržení se odpovědi u vstupů mimo oblast, kalibrační křivku a očekávané náklady pro rozsah vah chyb. Zveřejněné výsledky na této stránce pocházejí ze stejného režimu běhu, na veřejných dotazech se známým výsledkem a na poškozených adresách s přesnou pravdou.
Ano, na stejném enginu. Adresy jsou k dispozici už dnes. Jména osob, názvy firem, e-mailová identita, poloha IP adresy, telefonní čísla, identifikátory s kontrolními součty a sankční seznamy či seznamy PEP jsou entity, které tentýž engine páruje, se stejnými kalibrovanými pravděpodobnostmi, rozhodováním podle nákladů, výstupy a evaluačním během. Screeningový seznam je běžná referenční tabulka s vysoko nastavenými náklady za přehlédnutou shodu. Dostupnost entity, kterou potřebujete, si vyžádejte formulářem na této stránce.
Matcha je součástí Jenneru, takže kupujete Jenner: trvalou licenci na stroj pro Windows a Linux, Jenner pro macOS v Mac App Store nebo hodinové kredity Workspace. Neplatí se nic za řádek ani za shodu. Aktuální plány a bezplatnou zkušební verzi najdete na stránce s ceníkem.
Ano. Sankční seznam nebo seznam PEP je referenční tabulka osob nebo firem a screening je párování s obrácenými náklady: přehlédnutý zásah oceněný vysoko, planý poplach nízko. Entita osoby zvládá přezdívky, transliteraci z cyrilice, arabštiny a CJK, fonetické porovnání, varianty pořadí jmen a záměny v datu narození a evaluační běh oskóruje vaši míru zásahů proti známým případům. Dostupnost si vyžádejte formulářem na této stránce.
Ano. Entita polohy IP adresy geolokuje IP adresu relace a porovná ji se souřadnicemi uvedené adresy pomocí geodetické vzdálenosti, s poloměrem geolokace jako nejistotou, a příznaky ASN, proxy a VPN bere jako důkaz proti. Výsledkem je stejná kalibrovaná pravděpodobnost a rozhodnutí jako u párování adres, takže je může přímo použít pravidlo pro odhalování podvodů nebo fronta pro review.
Ano. Firemní entita odstraňuje právní formy podle ISO 20275, váží vzácná slova, rozepisuje akronymy a nechá identifikátor z rejstříku přebít název: LEI, EIN, UEI a čísla Companies House. Data GLEIF a dřívější názvy z EDGAR jsou balíčky znalostí, takže přejmenovaná firma se stále rozliší na protistranu ve vašich knihách. To je ověřování dodavatelů, párování protistran a KYB v jednom běhu.
Jev je model System One vytvořený firmou TypeSafe (typesafe.ai). Místo generování textu odpovídá na typovanou otázku, který kandidát, pokud vůbec některý, je totéž místo jako tato adresa, volbou, kalibrovanou pravděpodobností a jistotou. Matcha jej používá, protože to je tvar rozhodnutí o shodě: když Jev řekne 0.9, má pravdu zhruba v 90% případů, a když si není jistý, řekne, že žádný z kandidátů nesedí. Volá se jen na zbytek, který motor nedokáže rozhodnout, několik tisíc volání na 100,000 řádků, a na benchmarku poškozených adres zvedá správné shody z 83.3% na 87.8% při vlastní přesnosti motoru 98.1%. Ve výchozím nastavení je vypnutý a potřebuje klíč API TypeSafe v prostředí a adjudicate provider=jev; v kroku.
Ano. Nasměrujte Matcha na lokální model, který Ollama poskytuje na vašem hardwaru, zcela offline, a stejný rozhodovací krok poběží, aniž by cokoli opustilo stroj. Měříme s qwen2.5:7b-instruct. Lokální model odpoví téměř na každý případ, který dostane, což najde nejvíce shod, 89.3% správně na benchmarku poškozených adres, a zhruba zdvojnásobí chybné odpovědi oproti Jev. Můžete také spustit oba vedle sebe a získat příznak agree pro každý řádek. Ani jeden není nutný: motor sám nepotřebuje model, klíč ani síť.
Vyzkoušejte ji na vlastních adresách
Spusťte evaluaci proti několika stům záznamů, za které můžete ručit, a získejte jedno poctivé číslo o tom, jak dobrá je na vašich datech.
Adresy jsou k dispozici už dnes. Požádejte o evaluační běh na vlastních datech, nebo si vyžádejte dostupnost některé schopnosti na stejném enginu, a odpovíme vám s termíny a tím, co nastavení obnáší.
Podívejte se na Matchu na vlastní oči
Kupte Jenner a spusťte PROC MATCHA na vlastních adresách, přečtěte si dokumentaci, nebo se podívejte na tříminutový úvod do Jenneru.