Matcha koppelt rommelige, verkeerd gespelde, half ingetypte adressen aan de records waar ze werkelijk naar verwijzen, op uw eigen machine, met een gekalibreerde kans en een reden voor elke beslissing. Persoonsnamen, bedrijfsnamen, e-mail, IP-locatie en identificaties draaien op dezelfde engine. Voeg voor de moeilijke gevallen Jev (typesafe.ai) of een lokaal Ollama-model toe.
Inbegrepen in Jenner. Geen externe dienst, geen API-sleutel, geen data die uw netwerk verlaat, tenzij u ervoor kiest een model toe te voegen: Jev (typesafe.ai) of een lokaal Ollama-model.
Voor wie het is
Zes taken waarin het adres de sleutel is, en de sleutel nooit twee keer hetzelfde wordt ingetypt.
KYC en klantonboarding
Een aanvrager typt zijn adres één keer in, op een telefoon, in haast. Matcha lost het op tegen uw referentietabel terwijl hij nog op de pagina is, en wanneer twee records even plausibel zijn, benoemt het het ene veld dat de knoop zou doorhakken, zodat het formulier "Milton or Morton?" kan vragen in plaats van de controle te laten mislukken of hem zomaar door te laten.
AML en sanctiescreening
Screening is matching met de kosten omgedraaid: een gemiste treffer is duur en een vals alarm is goedkoop. Matcha neemt die kosten als invoer en verschuift zijn drempels dienovereenkomstig, zodat dezelfde engine die een klant onboardt er ook een kan screenen. Adressen zijn vandaag beschikbaar; screening van persoons- en bedrijfsnamen tegen sanctie- en PEP-lijsten draait op dezelfde engine, met dezelfde beslissingen.
Fraudedetectie
Matcha rapporteert elke kandidaat die het heeft overwogen, met het bewijs per veld en de kans dat de waarheid helemaal niet in de tabel staat. Een frauderegel kan werken met wat de matcher werkelijk heeft bekeken in plaats van met één enkele score, en de IP-locatie-entiteit toetst de locatie van een sessie aan het adres dat de klant opgeeft.
Ontdubbeling voor marketing en CRM
Hetzelfde huishouden verschijnt op tien manieren in aanmeldingen, bestellingen en imports. Matcha matcht een tabel tegen zichzelf, schrijft de clusters weg en houdt op elke koppeling een gekalibreerde kans, zodat een ontdubbeling zo streng of zo soepel kan zijn als de mailing die ze voedt. Householding op adres en achternaam is een samengestelde entiteit op dezelfde engine.
Bezorging en logistiek
Een verkeerde bezorging kost een rit terug; een geweigerde bestelling kost de verkoop. Matcha standaardiseert elk adres volgens de postregels van zijn regio, matcht het aan uw tabel van bezorgbare adressen en vertelt u wanneer een adres echt is maar buiten uw gebied ligt, of echt is maar in uw tabel ontbreekt, zodat de correctie op de juiste plek terechtkomt.
Overheid en civic tech
Een gemeentelijke perceelopzoekdienst liet inwoners een adres sms'en en hun perceel terugkrijgen. Op de moeilijkste gevallen, de spelfouten en dicteerfouten die de vorige matcher elke keer verkeerd had, beantwoordde de Matcha-engine alleen al 81% correct bij de eerste poging, en een model op het restant bracht dat naar 91%.
Hoe het werkt
Native Rust binnen het Jenner-binary. Eén stap, één tabel met beslissingen en een reden voor elk ervan.
1
Parsen en standaardiseren
Elk adres wordt gesplitst in huisnummer, windrichting, straat, suffix, unit, plaats en postcode, en genormaliseerd volgens de postregels van zijn regio (USPS Publication 28 voor de VS, Canada Post voor Canada). Waar de tekst dubbelzinnig is, bewaart de parser elke lezing en laat hij de referentie beslissen.
2
Kandidaten vinden in uw tabel
De engine bouwt een stratenvocabulaire op uit uw eigen referentietabel en koppelt de getypte straat daaraan op spelling, klank en officiële aliassen. Kandidaten worden gevonden op huisnummer, postcode en straat, dus een verkeerde ZIP is niet fataal.
3
Elk veld scoren, het resultaat kalibreren
Huisnummer, straat, suffix, windrichting, unit en postcode worden afzonderlijk vergeleken, en het bewijs wordt gecombineerd tot een gekalibreerde kans. Een ontbrekend suffix kost niets wanneer de referentie één straat met die naam heeft, en roept een vraag op wanneer ze er twee heeft.
4
Beslissen op kosten
U geeft aan wat een verkeerde match, een gemiste match en een vervolgvraag in uw proces kosten. De engine kiest de beslissing met de laagste verwachte kosten, dus hij matcht alleen wanneer hij zeker genoeg is voor uw cijfers en wanneer dat niet zo is, geeft hij geen match terug in plaats van een verkeerde.
5
Alles rapporteren wat hij heeft bekeken
Eén rij per invoer met de beslissing, de kans en de reden; één rij per kandidaat met het bewijs per veld; een metriekentabel die zegt waarom invoer niet is gematcht. Niets wordt stilzwijgend weggelaten.
6
Alleen het restant naar een model sturen
Optioneel gaan de gevallen die de engine niet kan beslechten met hun kandidaten naar een taalmodel, binnen dezelfde stap. Het model kiest één kandidaat of zegt dat geen van hen past; het herschrijft het adres nooit.
Zes beslissingen, elk met een bijbehorende kans
match
Eén kandidaat is met hoge waarschijnlijkheid het juiste record. Gebruik het.
likely
De meest waarschijnlijke kandidaat, gerapporteerd met zijn werkelijke kans wanneer die onder de match-drempel ligt. Nooit een willekeurige keuze.
nonmatch
Geen plausibele kandidaat. Behandel als niet gevonden; de overwogen kandidaten worden nog steeds gerapporteerd.
review
De engine kon niet beslissen en uw proces kan het navragen. Alleen uitgegeven wanneer u een vervolgkanaal een prijs geeft.
not_in_table
Een echt adres dat uw referentie niet bevat. Corrigeer de referentie, niet de invoer.
out_of_area
De postcode of plaats ligt buiten het gebied van de referentie. Stuur het ergens anders heen.
De vervolglijst: precies de juiste vraag stellen
De meeste matchers geven hun moeilijke gevallen door aan een handmatige beoordelingswachtrij die niemand bemant. Wanneer Matcha niet tussen kandidaten kan kiezen, weet het waarom: de invoer zei 1200 Milton Street en de referentie heeft een 1200 Milton St en een 1200 Morton St, twee straatnamen die op elkaar lijken en hetzelfde klinken. Dat is een vraag met een antwoord van één woord.
Dus wanneer u een vervolgkanaal een prijs geeft, komen de onbesliste rijen eruit als review met de gerangschikte kandidaten, het exacte veld dat de knoop zou doorhakken (ask about street, ask about unit) en de kansen die uw proces nodig heeft om te beslissen of de vraag de moeite waard is. Een sms-dienst antwoordt "Milton or Morton?". Een onboardingformulier toont de twee adressen. Een callcenterscherm toont de medewerker de kandidaten in plaats van een leeg veld. Zonder geprijsd kanaal is er geen review-beslissing: die rijen zijn nonmatch, met dezelfde kandidaten en reden erbij.
Begin met een evaluatierun
Geef Matcha een waarheidsbestand, een paar honderd invoerregels waarvan u voor het juiste record kunt instaan, en één run scoort elke beslissing daartegen: correct bij de eerste poging, precisie van de gemaakte matches, verkeerde antwoorden, recall binnen de vijf beste kandidaten, een kalibratiecurve en de verwachte kosten van elk foutgewicht, zodat u het uwe uit de curve kunt kiezen in plaats van te gokken.
Gemeten resultaten
Twee tests, één op wat het publiek werkelijk intypt en één op opzettelijk verminkte adressen in zes Amerikaanse gebieden. Cijfers zoals gepubliceerd in de documentatie.
Echte opzoekingen, ingetypt door het publiek
Ongeveer 2.400 adressen die inwoners intypten in een gemeentelijke perceelopzoekdienst, tegen een register van ongeveer 378.000 percelen, waarbij het juiste perceel bekend is uit wat er daarna gebeurde. Op de 223 moeilijkste gevallen, echte spelfouten, dicteerartefacten en ontbrekende suffixen, had de vorige matcher van de gemeente het bij de eerste poging elke keer fout.
0% tot 81%
moeilijke gevallen correct gematcht bij de eerste poging, alleen de engine
91%
met een lokaal model of Jev op het restant
89% tot 97%
overeenstemming met de makkelijke gevallen, van alleen engine tot engine plus model
Opzettelijk verminkte adressen, landelijk
3.000 echte adressen uit zes willekeurig gekozen ZIP-gebieden, afkomstig uit de National Address Database en verminkt met de foutenmix die uit echte data is gemeten: spelfouten, weggelaten windrichtingen en suffixen, afkortingen, aan elkaar geplakte tokens en verwisselde cijfers. De waarheid is exact bekend, en elke invoer eindigt als match of niet-match zonder dat er iets voor een mens apart wordt gezet.
83,3%
correcte match bij de eerste poging, alleen de engine
98,1%
precisie van de gemaakte matches
1,6%
verkeerde antwoorden, ongeveer één op zestig
87,8% tot 89,3%
correct bij de eerste poging met Jev of een lokaal model op het restant
Een similariteitsscore op zichzelf is gevaarlijk: met fuzzy straatmatching ingeschakeld en niets erboven kwam één op de vier adressen verkeerd terug. De alternatieven, aliassen en gebouwresolutie doen het meeste werk, en de beslissingslaag brengt de verkeerde antwoorden daarna van 3,6% naar 0,7% terug door geen match terug te geven in plaats van een verkeerde wanneer hij niet zeker genoeg is. Met de kostengewichten kunt u die afweging in beide richtingen verschuiven.
Winst per stap: wat elke laag toevoegt
Dezelfde 3.000 verminkte adressen, gematcht met telkens één laag ingeschakeld. Stappen 1 tot 5 zijn cumulatief; de laatste twee zijn alternatieven op het restant van de volledige engine.
Exacte tekstmatch heeft 34,6% goed en niets fout. Parsen en standaardiseren brengt de correcte matches naar 48,8%, maar de verkeerde naar 20,8%. Fuzzy straatmatching brengt correct naar 64,5% en verkeerd naar 25,0%. Alternatieven, aliassen en units brengen correct naar 89,3% en verkeerd omlaag naar 3,6%. Kostenbewuste beslissingen, de volledige engine, geven 84,1% correct en 0,7% verkeerd. Op het restant van die engine haalt een lokaal Ollama-model 90,0% correct met 2,1% verkeerd, en Jev 88,5% correct met 0,8% verkeerd.
Aandeel van 3.000 verminkte adressen dat correct, verkeerd of niet is gematcht, per stap. De laatste twee rijen zijn alternatieven die aftakken van stap 5, geen reeks.
Stap
Correcte match
Verkeerde match
Gemist
stap 1: Exacte match
34.6%
0.0%
65.4%
stap 2: Parsen en standaardiseren
48.8%
20.8%
30.4%
stap 3: Fuzzy straat
64.5%
25.0%
10.5%
stap 4: Alternatieven en units
89.3%
3.6%
7.1%
stap 5: Kostenbewuste beslissingen
84.1%
0.7%
15.2%
+ AI op het restant: Lokale AI (Ollama)
90.0%
2.1%
7.8%
+ AI op het restant: Jev (TypeSafe)
88.5%
0.8%
10.7%
Bron: 3.000 echte Amerikaanse adressen uit zes willekeurig gekozen ZIP-gebieden, afkomstig uit de National Address Database en verminkt met de foutenmix die uit echte data is gemeten, zodat de waarheid exact bekend is. Cijfers zoals gepubliceerd in de PROC MATCHA-documentatie.
Fuzzy matching alleen is gevaarlijk. Met fuzzy straatmatching ingeschakeld en niets erboven komt één op de vier adressen verkeerd terug, en niets in een similariteitsscore vertelt u welke.
De alternatievenlaag doet het zware werk. Officiële straataliassen, alternatieve spellingen en unit- en gebouwresolutie brengen de correcte matches van 64,5% naar 89,3% en de verkeerde van 25,0% naar 3,6%.
De beslissingslaag brengt de verkeerde antwoorden onder de 1%. Door een verkeerde match tegen een gemiste te prijzen, geeft de engine geen match terug in plaats van een verkeerde wanneer hij niet zeker genoeg is: 0,7% verkeerd, met de onbesliste gevallen gerapporteerd, niet weggelaten.
AI op het restant tilt de correcte matches naar ongeveer 90%. Een lokaal model vindt de meeste matches en verdrievoudigt de verkeerde antwoorden ruwweg; Jev voegt matches toe met de eigen precisie van de engine, 0,8% verkeerd.
Draai het op uw eigen adressen
Matcha is inbegrepen in elke Jenner-licentie. Koop Jenner, lees de PROC MATCHA-documentatie, of vertel ons over uw matchingprobleem en wij helpen u een evaluatierun op te zetten.
Taalmodellen zijn duur per rij en traag per rij. Matcha gebruikt ze zoals een goede analist dat zou doen: alleen voor de gevallen die beoordeling vereisen.
Ollama met qwen2.5:7b-instruct, volledig offline
Draai een lokaal model via Ollama op uw eigen hardware, volledig offline, zodat niets de machine verlaat. Wij benchmarken met qwen2.5:7b-instruct. Lokale modellen zijn gratis per rij en beantwoorden bijna elke vraag die ze te zien krijgen, wat de meeste matches vindt en de foute antwoorden ruwweg verdubbelt.
Jev, een System One-model van TypeSafe (typesafe.ai)
In plaats van tekst te genereren beantwoordt Jev een getypeerde vraag, welke kandidaat, als er een is, dezelfde plek is als dit adres, en geeft het een keuze terug met een gekalibreerde kans. Wanneer het 0,9 zegt, heeft het het ongeveer 90% van de tijd goed, en wanneer het onzeker is, zegt het dat geen van de kandidaten past, in plaats van te gokken. Dat is precies de vorm die een kostenbewuste matcher nodig heeft, en het is de reden dat Jev matches toevoegt met de eigen precisie van de engine.
In gemeten runs is de onbesliste band 2% tot 8% van de invoer, dus een opdracht van 100.000 adressen doet een paar duizend modelaanroepen, geen honderdduizend.
Beide zijn optioneel en beide staan standaard uit. De engine heeft geen van beide nodig, en een extern model kan pas worden gebruikt nadat u allow_remote in de configuratie hebt ingesteld.
Jev van typesafe.ai: System One-modellen voor de moeilijke gevallen
Jev wordt gemaakt door TypeSafe (typesafe.ai). Matcha roept het alleen aan voor het restant dat de engine niet zelf kan beslissen.
Jev is het System One-model van TypeSafe. In plaats van tekst te genereren beantwoordt het een getypeerde vraag, welke kandidaat, als er al een is, dezelfde plek is als dit adres, en geeft het een keuze, een gekalibreerde kans en een betrouwbaarheid terug. System One-modellen zijn gebouwd voor beslissingen van die vorm, niet voor conversatie.
Die vorm is precies wat een kostenbewuste matcher nodig heeft. Gekalibreerd betekent dat wanneer Jev 0.9 zegt, het in ongeveer 90% van de gevallen gelijk heeft, zodat de engine zijn antwoord kan afwegen tegen de prijs van een foute match, en wanneer Jev twijfelt, zegt het dat geen van de kandidaten past in plaats van te gokken.
Matcha gebruikt Jev alleen op het restant, de gevallen die de engine niet zelf kan beslissen, zodat een job van 100,000 adressen enkele duizenden Jev-aanroepen doet, geen honderdduizend. Zet uw TypeSafe-API-sleutel in de omgeving, voeg adjudicate provider=jev; toe aan de PROC MATCHA-stap en laat allow_remote uit totdat u hebt besloten dat die gevallen uw machine mogen verlaten.
Jev inschakelen
export TYPESAFE_API_KEY=... # never in a file
adjudicate provider=jev; # inside the PROC MATCHA step
Gemeten op de benchmark met verminkte adressen tilt Jev de correcte matches van 83.3% naar 87.8% bij de eigen precisie van de engine van 98.1%, met 0.8% foute antwoorden in de stapsgewijze ablatie. Op de echte, door het publiek getypte opzoekingen loste het de moeilijke gevallen even vaak op als het lokale model, en wanneer geen kandidaat de juiste was, zei het dat in plaats van er een te kiezen.
Open referentiedata, alleen bijgewerkt wanneer u dat zegt
De engine matcht tegen de tabel die u hem geeft, geholpen door open kennispakketten: Amerikaanse adrespunten uit de National Address Database, straataliassen uit Census TIGER en Canadese adressen van Statistics Canada, allemaal publiek domein of open gelicentieerd. Jenner Analytics bouwt de pakketten opnieuw wanneer hun bronnen publiceren, valideert ze tegen de vorige release, ondertekent ze en publiceert ze naar een datakanaal.
Niets op uw machine verandert totdat u de update zelf uitvoert. Elk pakket wordt geverifieerd tegen een ondertekend manifest voordat er een byte wordt uitgepakt, en atomair verwisseld, zodat een lopende opdracht het oude pakket of het nieuwe ziet en nooit een gedeeltelijk pakket. PROC MATCHA downloadt nooit iets, en het rapport legt vast welke datarelease een run heeft gebruikt.
Controleer, en werk dan bij, op uw eigen schema
jenner data update --check # what would change; writes nothing
jenner data update # install or refresh every pack
jenner data update --pin 2026.9.28
Regio's
De VS is de standaard en Canada wordt ondersteund, inclusief tweetalige vormen. Regiopakketten voor het VK, Frankrijk, Japan, Korea en Australië zijn in ontwikkeling. Elk ervan is data, geen code, dus een land toevoegen is een pakket toevoegen.
Eén matching-engine voor KYC, AML, fraude, kredietrisico, bezorging en compliance
Adressen zijn vandaag beschikbaar. Elke andere match in de KYC-familie draait op dezelfde engine: dezelfde gekalibreerde kansen, dezelfde kostengewogen beslissingen, dezelfde uitvoer en dezelfde evaluatierun.
Een nieuw soort match is een entiteitsdefinitie, geen nieuw product: de rollen die een record heeft, de comparator voor elke rol, de blocking-strategie en de kennispakketten die hij mag raadplegen. De scoring, de beslissingen, de vervolglijst en de evaluatie zijn gedeelde code, dus een persoonsnaammatch wordt precies zo geëvalueerd en geprijsd als een adresmatch.
Mogelijkheden op dezelfde engine
IP-adres naar postadres: geolocatieafstand en VPN-signalen
Matcha vergelijkt waar het IP-adres van een sessie geolokaliseert met het adres dat de klant opgeeft, via de geodetische afstand met de geolocatiestraal als onzekerheid. ASN-, proxy- en VPN-vlaggen tellen als bewijs tegen, nooit als oordeel op zichzelf. Het resultaat is dezelfde gekalibreerde kans en kostengewogen beslissing als bij een adresmatch, zodat een frauderegel erop kan handelen of het naar review kan sturen.
Voorbeeld: Een kaartaanvrager geeft een adres in Denver op vanaf een IP dat 40 km verderop geolokaliseert, zonder VPN-vlag: overeenstemming binnen de straal. Hetzelfde adres vanaf een datacenter-IP in een ander land: conflict, en de rij wordt geprijsd voor review.
E-mail naar persoon en bedrijf: lokaal deel, domein en wegwerpsignalen
De e-mailidentiteitsentiteit toetst of een adres toebehoort aan de persoon en de organisatie die bij de onboarding zijn opgegeven. Het lokale deel wordt vergeleken met de naamtokens, inclusief voornaam.achternaam, initialen en bijnamen; het domein wordt vergeleken met de geregistreerde domeinen van de organisatie; lijsten van gratis-mail- en wegwerpdomeinen en de aanwezigheid van MX-records zijn bewijs. Elk signaal is een comparator, en de engine zegt hoe sterk ze overeenstemmen.
Voorbeeld:[email protected] tegenover Jane Okafor bij Northwind Actuarial: het lokale deel stemt overeen met de naam en het domein met het bedrijf. [email protected] tegenover hetzelfde record: wegwerpdomein, en de kans zegt dat ook.
Bedrijfsnaammatching: rechtsvormen, acroniemen en registeridentificaties
De bedrijfsentiteit verwijdert rechtsvormen volgens ISO 20275, weegt zeldzame woorden, breidt acroniemen uit en laat een registeridentificatie de naam overstemmen: LEI, EIN, UEI en Companies House-nummers. De GLEIF Level 1-data en de vroegere namen uit EDGAR zijn kennispakketten, dus een bedrijf dat zichzelf heeft hernoemd matcht nog steeds met de tegenpartij in uw boeken. Leveranciersvalidatie, tegenpartijmatching en KYB gebruiken dezelfde run.
Voorbeeld: "INTL BUSINESS MACHINES CORP" tegenover "International Business Machines Corporation" met een overeenkomende LEI: match, de registeridentificatie geeft de doorslag. "IBM Credit LLC" tegenover het moederbedrijf: nonmatch, met het bewijs uit rechtsvorm en zeldzame woorden gerapporteerd.
Persoonsnaammatching: bijnamen, transliteratie, fonetiek en geboortedatum
De persoonsentiteit vergelijkt voor-, tussen- en achternamen met bijnaampakketten, transliteratie uit Cyrillisch, Arabisch en CJK, fonetische vergelijking en varianten in naamvolgorde, en behandelt een verwisselde geboortedatum of een nationaal ID met geldige controlesom als het bewijs dat het is. Een sanctie- of PEP-lijst is een gewone referentietabel waarbij de kosten van een gemiste match hoog zijn ingesteld, dus screening en klantontdubbeling zijn dezelfde engine met andere prijzen.
Voorbeeld: "Mohammed Al-Rashid, 03/07/1981" tegenover "Muhammad Alrashid, 07/03/1981": de transliteratie stemt overeen, de datum is een dag-maandverwisseling, en de rij komt terug als screeningtreffer met zijn kans in plaats van als gemiste treffer.
Telefoonnummers en identificaties: IBAN, VIN, NPI en nationale ID's
Telefoonnummers worden genormaliseerd naar E.164 en gecontroleerd op consistentie van land en netnummer en op het type aanbieder. Identificaties worden gevalideerd voordat ze worden gematcht: IBAN-, VIN- en NPI-controlesommen, consistentie van formaat en uitgever, de vorm van nationale ID's. Een geldige identificatie is sterk bewijs; een ongeldige is een bevinding op zichzelf, gerapporteerd voordat er ook maar één kandidaat wordt gescoord.
Voorbeeld: De IBAN van een aanvrager zakt voor de mod-97-controle: de rij wordt vóór het matchen gemarkeerd, met de reden, in plaats van tegen elke rekening in de referentietabel te worden gescoord.
Coördinaten, huishoudens, transactietegenpartijen en productnamen
Entiteiten laten zich samenstellen. Een apparaatcoördinaat wordt omgekeerd gegeocodeerd naar het dichtstbijzijnde adrespunt; een huishouden is een adresmatch plus overeenstemming van achternaam; een transactietegenpartij is een bedrijf of persoon plus een rekening en een land; een product- of geneesmiddelnaam matcht op tokeninsluiting met een code die de doorslag geeft. De scoringcode kent het verschil niet, en daarom komt elk ervan op dezelfde engine terecht met dezelfde evaluatierun.
Voorbeeld: De GPS-positie van een bezorgapp landt 30 m van het adres op de bestelling: overeenstemming, met de afstand gerapporteerd. Twee klantrecords op één adres met overeenstemmende achternaam: één huishouden, met een gekalibreerde kans op de koppeling.
Verifieer het adres, de e-mail, het telefoonnummer en de identificaties die een aanvrager u geeft in één stap, met één kans per controle en één vervolgvraag wanneer iets dubbelzinnig is. Matcha lost het adres op terwijl de aanvrager nog op de pagina is en vraagt "Milton or Morton?" in plaats van de controle te laten mislukken of hem zomaar door te laten.
Vergelijk de IP-locatie van de sessie met het opgegeven adres, de apparaatcoördinaat met het bezorgadres en de e-mail met de persoon, en krijg bewijs waarop een regel kan handelen in plaats van een black-boxscore. Elke kandidaat die de matcher heeft overwogen wordt gerapporteerd, met de kans dat de waarheid helemaal niet in uw tabel staat.
Screen persoons- en bedrijfsnamen tegen sanctie- en PEP-lijsten met transliteratie, bijnamen, fonetiek en geboortedatumverwisselingen, geprijsd voor screening: een gemiste treffer duur, een vals alarm goedkoop. De lijst is een referentietabel, de evaluatierun scoort uw trefferpercentage tegen bekende gevallen, en de kalibratiecurve vertelt u wat een 0,9 betekent op uw data.
Herleid de bedrijven op een aanvraag, een transactie of een grootboek tot één rechtspersoon, over rechtsvormen, vroegere namen en registeridentificaties heen, zodat de blootstelling één keer wordt geteld. LEI, EIN, UEI en Companies House-nummers overstemmen namen wanneer ze aanwezig zijn en bevestigen ze wanneer dat niet zo is.
Standaardiseer elk adres volgens de postregels van zijn regio, match het aan uw tabel van bezorgbare adressen en ontdek wanneer een adres echt is maar buiten uw gebied ligt, of echt is maar in uw tabel ontbreekt. Een apparaatcoördinaat aan de deur bevestigt het bezorgpunt, en de kostengewichten bepalen wanneer een verkeerd adres erger is dan een geweigerde bestelling.
Elke beslissing draagt een kans, een reden en de overwogen kandidaten, in tabellen die u zelf bewaart. Niets verlaat uw machine tenzij u ervoor kiest een model toe te voegen, het rapport legt vast welke datarelease een run heeft gebruikt, en dezelfde evaluatierun reproduceert maanden later een resultaat voor een auditor.
PROC MATCHA is onderdeel van Jenner, geen apart product en geen tarief per rij. Op Windows en Linux wordt een Jenner-licentie eenmalig per machine gekocht en is ze eeuwigdurend: de versie die u koopt blijft draaien zolang u haar wilt gebruiken, met een jaar lang nieuwe releases en ondersteuning inbegrepen. Jenner voor macOS staat in de Mac App Store, en de Workspace wordt per uur gefactureerd.
Jenner Analytics rekent niets voor een gematchte rij, een overwogen kandidaat of een gestelde vraag. Als u voor Jev kiest, rekent TypeSafe het per invoertoken af, en het ziet alleen het restant.
Jenner draait bestaande PROC DQMATCH- en PROC DQSCHEME-code voor compatibiliteit, dus een SAS-datakwaliteitsprogramma blijft werken. Matcha is de aanbevolen matcher voor nieuw werk: het gebruikt dezelfde statementsyntaxis in SAS-stijl, maar geeft een gekalibreerde kans en een reden voor elke beslissing terug, kan een vervolgvraag stellen, en leest en schrijft CSV, Parquet, Avro en de meeste databases via dezelfde data=-syntaxis, zodat u aan geen van beide tools vastzit.
Nee. De engine is native Rust binnen het Jenner-binary en doet geen netwerkaanroepen; de referentiedata is de tabel die u hem geeft plus de kennispakketten die op uw machine zijn geïnstalleerd. Taalmodellen staan standaard uit. Een lokaal model via Ollama houdt alles op uw hardware. Een extern model zoals Jev wordt alleen gebruikt als u het in de configuratie inschakelt, en dan ziet het alleen de onbesliste gevallen met hun kandidaten, nooit het hele bestand.
De Verenigde Staten zijn de standaardregio, met standaardisatie volgens USPS Publication 28 en open adresdata uit de National Address Database en Census TIGER. Canada wordt ondersteund, inclusief tweetalige Franse vormen en Canadese postcodes, met data van Statistics Canada. Regiopakketten voor het VK, Frankrijk, Japan, Korea en Australië zijn in ontwikkeling. U kunt vandaag al matchen tegen uw eigen referentietabel in elk land; de pakketten voegen standaardisatieregels en open adrespunten toe.
Ja. De engine heeft geen dienst, geen sleutel en geen netwerk nodig. Referentiepakketten worden eenmalig geïnstalleerd met jenner data update en alleen vernieuwd wanneer u dat commando opnieuw uitvoert. Met een lokaal Ollama-model is ook de optionele beoordelingsstap offline; alleen Jev is een externe aanroep, en alleen als u die inschakelt.
Wanneer de engine niet tussen kandidaten kan kiezen en u een vervolgkanaal een prijs hebt gegeven, komen die rijen eruit als review met de gerangschikte kandidaten, het exacte veld dat de vraag zou beslechten (suffix, windrichting, unit) en de kansen. Uw proces maakt daar een vraag van aan wie het kan beantwoorden: een sms-antwoord, een melding op een onboardingformulier, een callcenterscherm. Niemand aan de matchingkant leest die rijen, en zonder geprijsd kanaal worden ze gerapporteerd als nonmatch met dezelfde kandidaten erbij.
Geef een run een waarheidsbestand met invoer waarvan u het juiste record kent, en Matcha scoort elke beslissing daartegen: correct bij de eerste poging, precisie, verkeerde antwoorden, recall binnen de vijf beste kandidaten, correcte onthoudingen op invoer buiten het gebied, een kalibratiecurve en de verwachte kosten bij een reeks foutgewichten. De gepubliceerde resultaten op deze pagina komen uit dezelfde runmodus, op publieke opzoekingen met bekende uitkomsten en op verminkte adressen met exacte waarheid.
Ja, op dezelfde engine. Adressen zijn vandaag beschikbaar. Persoonsnamen, bedrijfsnamen, e-mailidentiteit, IP-locatie, telefoonnummers, identificaties met controlesom en sanctie- of PEP-lijsten zijn entiteiten die dezelfde engine matcht, met dezelfde gekalibreerde kansen, kostengewogen beslissingen, uitvoer en evaluatierun. Een screeninglijst is een gewone referentietabel waarbij de kosten van een gemiste match hoog zijn ingesteld. Gebruik het formulier op deze pagina om de beschikbaarheid aan te vragen van de entiteit die u nodig hebt.
Matcha is inbegrepen in Jenner, dus u koopt Jenner: een eeuwigdurende licentie per machine voor Windows en Linux, Jenner voor macOS in de Mac App Store, of Workspace-tegoed per uur. Er zijn geen kosten per rij of per match. De prijzenpagina heeft de actuele plannen en de gratis proefversie.
Ja. Een sanctie- of PEP-lijst is een persoons- of bedrijfsreferentietabel, en screening is matching met de kosten omgedraaid: een gemiste treffer hoog geprijsd, een vals alarm laag. De persoonsentiteit verwerkt bijnamen, transliteratie uit Cyrillisch, Arabisch en CJK, fonetische vergelijking, varianten in naamvolgorde en geboortedatumverwisselingen, en de evaluatierun scoort uw trefferpercentage tegen bekende gevallen. Vraag de beschikbaarheid aan via het formulier op deze pagina.
Ja. De IP-locatie-entiteit geolokaliseert het IP-adres van de sessie en vergelijkt het via de geodetische afstand met de coördinaten van het opgegeven adres, met de geolocatiestraal als onzekerheid, en behandelt ASN-, proxy- en VPN-vlaggen als bewijs tegen. Het resultaat is dezelfde gekalibreerde kans en beslissing als bij een adresmatch, zodat een frauderegel of een reviewwachtrij het rechtstreeks kan gebruiken.
Ja. De bedrijfsentiteit verwijdert rechtsvormen volgens ISO 20275, weegt zeldzame woorden, breidt acroniemen uit en laat een registeridentificatie de naam overstemmen: LEI, EIN, UEI en Companies House-nummers. GLEIF-data en vroegere namen uit EDGAR zijn kennispakketten, dus een hernoemd bedrijf wordt nog steeds herleid tot de tegenpartij in uw boeken. Dat is leveranciersvalidatie, tegenpartijmatching en KYB in één run.
Jev is een System One-model van TypeSafe (typesafe.ai). In plaats van tekst te genereren beantwoordt het een getypeerde vraag, welke kandidaat, als er al een is, dezelfde plek is als dit adres, met een keuze, een gekalibreerde kans en een betrouwbaarheid. Matcha gebruikt het omdat dat de vorm van een matchingbeslissing is: wanneer Jev 0.9 zegt, heeft het in ongeveer 90% van de gevallen gelijk, en wanneer het twijfelt, zegt het dat geen van de kandidaten past. Het wordt alleen aangeroepen voor het restant dat de engine niet kan beslissen, enkele duizenden aanroepen per 100,000 rijen, en op de benchmark met verminkte adressen tilt het de correcte matches van 83.3% naar 87.8% bij de eigen precisie van de engine van 98.1%. Het staat standaard uit en heeft een TypeSafe-API-sleutel in de omgeving en adjudicate provider=jev; in de stap nodig.
Ja. Wijs Matcha naar een lokaal model dat Ollama op uw eigen hardware serveert, volledig offline, en dezelfde adjudicatiestap draait zonder dat iets de machine verlaat. Wij benchmarken met qwen2.5:7b-instruct. Een lokaal model beantwoordt bijna elk geval dat het te zien krijgt, wat de meeste matches vindt, 89.3% correct op de benchmark met verminkte adressen, en de foute antwoorden ruwweg verdubbelt ten opzichte van Jev. U kunt ook beide naast elkaar draaien en per rij een agree-vlag krijgen. Geen van beide is verplicht: de engine alleen heeft geen model, geen sleutel en geen netwerk nodig.
Probeer het op uw eigen adressen
Draai een evaluatie tegen een paar honderd records waarvoor u kunt instaan, en krijg één eerlijk getal voor hoe goed het is op uw data.
Adressen zijn vandaag beschikbaar. Vraag een evaluatierun op uw eigen data aan, of vraag de beschikbaarheid aan van een mogelijkheid op dezelfde engine, en wij antwoorden met datums en wat er nodig is om het op te zetten.
Zie Matcha zelf aan het werk
Koop Jenner en draai PROC MATCHA op uw eigen adressen, lees de documentatie, of bekijk de introductie van drie minuten tot Jenner.