PROC MATCHA

Match personer og adresser

Matcha kæder rodede, fejlstavede, halvt indtastede adresser sammen med de poster, de faktisk henviser til, på din egen maskine, med en kalibreret sandsynlighed og en begrundelse for hver beslutning. Personnavne, virksomhedsnavne, e-mail, IP-placering og identifikatorer kører på samme motor. Til de svære sager tilføjer du Jev (typesafe.ai) eller en lokal Ollama-model.

Inkluderet i Jenner. Ingen ekstern tjeneste, ingen API-nøgle, ingen data forlader dit netværk, medmindre du vælger at tilføje en model: Jev (typesafe.ai) eller en lokal Ollama-model.

Pen-og-blæk-tegning af en matchaskål med skummende overflade og en bambuspisker, der læner sig op ad den

Hvem det er til

Seks opgaver, hvor adressen er nøglen, og nøglen aldrig tastes på samme måde to gange.

KYC og kunde-onboarding

En ansøger taster sin adresse én gang, på en telefon, i en fart. Matcha slår den op mod din referencetabel, mens de stadig er på siden, og når to poster er lige plausible, udpeger den det ene felt, der ville afgøre sagen, så formularen kan spørge "Milton or Morton?" i stedet for at afvise kontrollen eller vinke den igennem.

AML og sanktionsscreening

Screening er matching med omkostningerne vendt om: et overset hit er dyrt, og en falsk alarm er billig. Matcha tager disse omkostninger som input og flytter sine tærskler derefter, så den samme motor, der onboarder en kunde, også kan screene en. Adresser leveres i dag; screening af person- og virksomhedsnavne mod sanktions- og PEP-lister kører på samme motor, med de samme beslutninger.

Svindeldetektion

Matcha rapporterer hver kandidat, den har overvejet, med evidens pr. felt og sandsynligheden for, at sandheden slet ikke findes i tabellen. En svindelregel kan arbejde ud fra det, matcheren faktisk har kigget på, i stedet for en enkelt score, og IP-placeringsentiteten kontrollerer en sessions placering mod den adresse, kunden opgiver.

Marketing og CRM-deduplikering

Den samme husstand optræder på ti måder på tværs af tilmeldinger, ordrer og importer. Matcha matcher en tabel mod sig selv, skriver klyngerne og beholder en kalibreret sandsynlighed på hvert link, så en deduplikering kan være lige så streng eller lige så tilgivende som den udsendelse, den fodrer. Husstandssamling efter adresse og efternavn er en sammensat entitet på samme motor.

Levering og logistik

En forkert levering koster en ekstra tur; en afvist ordre koster salget. Matcha standardiserer hver adresse efter postreglerne i dens lokalitet, matcher den mod din tabel over adresser, der kan betjenes, og fortæller dig, når en adresse er ægte, men uden for dit område, eller ægte, men mangler i din tabel, så rettelsen havner det rigtige sted.

Offentlig sektor og civic tech

En kommunal opslagstjeneste for matrikler lod borgere sms'e en adresse og få deres matrikel tilbage. På de sværeste sager, de stavefejl og dikteringsfejl, som dens tidligere matcher fik forkert hver gang, svarede Matcha-motoren alene rigtigt på 81 % i første forsøg, og en model på resten løftede det til 91 %.

Sådan virker det

Native Rust inde i Jenner-binærfilen. Ét trin, én tabel med beslutninger og en begrundelse for hver.

1

Parse og standardiser

Hver adresse opdeles i husnummer, retning, gade, suffiks, enhed, by og postnummer og normaliseres efter postreglerne i dens lokalitet (USPS Publication 28 for USA, Canada Post for Canada). Hvor teksten er tvetydig, beholder parseren alle læsninger og lader referencen afgøre.

2

Find kandidater i din tabel

Motoren bygger et gadevokabular ud fra din egen referencetabel og snapper den indtastede gade til det efter stavning, lyd og officielle aliasser. Kandidater findes ud fra husnummer, postnummer og gade, så et forkert ZIP er ikke fatalt.

3

Scor hvert felt, kalibrer resultatet

Husnummer, gade, suffiks, retning, enhed og postnummer sammenlignes hver for sig, og evidensen samles til en kalibreret sandsynlighed. Et manglende suffiks koster intet, når referencen har én gade med det navn, og rejser et spørgsmål, når den har to.

4

Beslut efter omkostning

Du angiver, hvad et forkert match, et overset match og et opfølgende spørgsmål koster i din proces. Motoren vælger beslutningen med den laveste forventede omkostning, så den kun matcher, når den er sikker nok til dine tal, og når den ikke er det, returnerer den intet match i stedet for et forkert.

5

Rapportér alt, den har kigget på

Én række pr. input med beslutning, sandsynlighed og begrundelse; én række pr. kandidat med evidens pr. felt; en metriktabel, der fortæller, hvorfor input ikke matchede. Intet droppes i stilhed.

6

Send kun resten til en model

Valgfrit kan de sager, motoren ikke kan afgøre, sendes til en sprogmodel sammen med deres kandidater, inden for samme trin. Modellen vælger én kandidat eller siger, at ingen af dem passer; den omskriver aldrig adressen.

Seks beslutninger, hver med en sandsynlighed knyttet til

matchÉn kandidat er den rigtige post med høj sandsynlighed. Brug den.
likelyDen mest sandsynlige kandidat, rapporteret med sin reelle sandsynlighed, når den ligger under match-tærsklen. Aldrig et tilfældigt valg.
nonmatchIngen plausibel kandidat. Behandl som ikke fundet; de overvejede kandidater rapporteres stadig.
reviewMotoren kunne ikke afgøre det, og din proces kan spørge. Udsendes kun, når du har sat en pris på en opfølgningskanal.
not_in_tableEn ægte adresse, som din reference ikke indeholder. Ret referencen, ikke inputtet.
out_of_areaPostnummeret eller stedet ligger uden for referencens område. Send den et andet sted hen.

Opfølgningslisten: stil præcis det rigtige spørgsmål

De fleste matchere sender deres svære sager til en manuel gennemgangskø, som ingen bemander. Når Matcha ikke kan vælge mellem kandidater, ved den hvorfor: inputtet sagde 1200 Milton Street, og referencen har både 1200 Milton St og 1200 Morton St, to gadenavne, der ligner hinanden og lyder ens. Det er et spørgsmål med et svar på ét ord.

Så når du sætter en pris på en opfølgningskanal, kommer de uafgjorte rækker ud som review med de rangordnede kandidater, det præcise felt, der ville afgøre sagen (ask about street, ask about unit), og de sandsynligheder, din proces har brug for til at beslutte, om spørgsmålet er værd at stille. En sms-tjeneste svarer "Milton or Morton?". En onboarding-formular viser de to adresser. En callcenter-skærm viser medarbejderen kandidaterne i stedet for et tomt felt. Uden en prissat kanal findes der ingen review-beslutning: de rækker er nonmatch, med de samme kandidater og den samme begrundelse knyttet til.

Start med en evalueringskørsel

Giv Matcha en facitfil, nogle få hundrede input, hvis korrekte post du kan stå inde for, og én kørsel scorer hver beslutning mod den: korrekt i første forsøg, præcision af de foretagne match, forkerte svar, recall blandt de fem bedste kandidater, en kalibreringskurve og den forventede omkostning ved hver fejlvægt, så du kan vælge din ud fra kurven i stedet for at gætte.

Målte resultater

To tests, én på borgernes egne indtastninger og én på bevidst forvanskede adresser på tværs af seks amerikanske områder. Tallene som offentliggjort i dokumentationen.

Rigtige opslag tastet af borgerne

Omkring 2.400 adresser, som borgere tastede ind i en kommunal opslagstjeneste for matrikler, mod et register på omkring 378.000 matrikler, hvor den korrekte matrikel var kendt ud fra, hvad der skete bagefter. På de 223 sværeste sager, rigtige stavefejl, dikteringsartefakter og manglende suffikser, tog kommunens tidligere matcher fejl i første forsøg hver gang.

0 % til 81 %

svære sager matchet korrekt i første forsøg, motoren alene

91 %

med en lokal model eller Jev på resten

89 % til 97 %

enighed på de lette sager, fra motoren alene til motor plus model

Bevidst forvanskede adresser, landsdækkende

3.000 rigtige adresser fra seks tilfældigt valgte ZIP-områder, hentet fra National Address Database og forvansket med den fejlblanding, der er målt på rigtige data: stavefejl, udeladte retninger og suffikser, forkortelser, sammenklistrede tokens og ciffer-fejl. Sandheden er kendt præcist, og hvert input ender som et match eller et ikke-match, uden at noget lægges til side til en person.

83,3 %

korrekt match i første forsøg, motoren alene

98,1 %

præcision af de foretagne match

1,6 %

forkerte svar, omkring ét ud af tres

87,8 % til 89,3 %

korrekt i første forsøg med Jev eller en lokal model på resten

En lighedsscore alene er farlig: med fuzzy gadematching slået til og intet ovenpå kom hver fjerde adresse forkert tilbage. Alternativerne, aliasserne og bygningsopløsningen gør det meste af arbejdet, og beslutningslaget skærer derefter forkerte svar fra 3,6 % til 0,7 % ved at returnere intet match i stedet for et forkert, når det ikke er sikkert nok. Omkostningsvægtene lader dig flytte den afvejning i begge retninger.

Løft pr. trin: hvad hvert lag tilføjer

De samme 3.000 forvanskede adresser, matchet med ét lag slået til ad gangen. Trin 1 til 5 er kumulative; de to sidste er alternativer på den fulde motors rest.

0%25%50%75%100%34.6%0.0%Eksakt matchtrin 148.8%20.8%Parse ogstandardisertrin 264.5%25.0%Fuzzy gadetrin 389.3%3.6%Alternativer ogenhedertrin 484.1%0.7%Omkostningsbevidstebeslutningertrin 590.0% Lokal AI (Ollama)2.1% Lokal AI (Ollama)88.5% Jev (TypeSafe)0.8% Jev (TypeSafe)+ AI på restenKorrekt matchForkert match

Eksakt strengmatch får 34,6 % rigtige og ingen forkerte. Parsing og standardisering hæver korrekte match til 48,8 %, men forkerte til 20,8 %. Fuzzy gadematching hæver korrekte til 64,5 % og forkerte til 25,0 %. Alternativer, aliasser og enheder bringer korrekte op på 89,3 % og forkerte ned på 3,6 %. Omkostningsbevidste beslutninger, den fulde motor, giver 84,1 % korrekte og 0,7 % forkerte. På den motors rest når en lokal Ollama-model 90,0 % korrekte med 2,1 % forkerte, og Jev når 88,5 % korrekte med 0,8 % forkerte.

Andel af 3.000 forvanskede adresser matchet korrekt, matchet forkert eller overset, pr. trin. De to sidste rækker er alternativer forgrenet fra trin 5, ikke en rækkefølge.
TrinKorrekt matchForkert matchOverset
trin 1: Eksakt match34.6%0.0%65.4%
trin 2: Parse og standardiser48.8%20.8%30.4%
trin 3: Fuzzy gade64.5%25.0%10.5%
trin 4: Alternativer og enheder89.3%3.6%7.1%
trin 5: Omkostningsbevidste beslutninger84.1%0.7%15.2%
+ AI på resten: Lokal AI (Ollama)90.0%2.1%7.8%
+ AI på resten: Jev (TypeSafe)88.5%0.8%10.7%

Kilde: 3.000 rigtige amerikanske adresser fra seks tilfældigt valgte ZIP-områder, hentet fra National Address Database og forvansket med den fejlblanding, der er målt på rigtige data, så sandheden er kendt præcist. Tallene som offentliggjort i PROC MATCHA-dokumentationen.

  • Fuzzy matching alene er farlig. Med fuzzy gadematching slået til og intet ovenpå kommer hver fjerde adresse forkert tilbage, og intet i en lighedsscore fortæller dig hvilken.
  • Alternativlaget gør det tunge arbejde. Officielle gadealiasser, alternative stavemåder samt enheds- og bygningsopløsning løfter korrekte match fra 64,5 % til 89,3 % og skærer forkerte fra 25,0 % til 3,6 %.
  • Beslutningslaget skærer forkerte svar ned til under 1 %. Ved at prissætte et forkert match mod et overset returnerer motoren intet match i stedet for et forkert, når den ikke er sikker nok: 0,7 % forkerte, og de uafgjorte sager rapporteres, ikke droppes.
  • AI på resten løfter korrekte match til omkring 90 %. En lokal model finder flest match og omtrent tredobler de forkerte svar; Jev tilføjer match med motorens egen præcision, 0,8 % forkerte.

Kør den på dine egne adresser

Matcha er inkluderet i hver Jenner-licens. Køb Jenner, læs PROC MATCHA-dokumentationen, eller fortæl os om dit matchingproblem, så hjælper vi dig med at sætte en evalueringskørsel op.

Teblad

Medbring din egen model

Sprogmodeller er dyre pr. række og langsomme pr. række. Matcha bruger dem, som en god analytiker ville: kun på de sager, der kræver dømmekraft.

Ollama med qwen2.5:7b-instruct, helt offline

Kør en lokal model gennem Ollama på din egen hardware, helt offline, så intet forlader maskinen. Vi måler med qwen2.5:7b-instruct. Lokale modeller er gratis pr. række og svarer på næsten alle spørgsmål, de får vist, hvilket finder flest match og omtrent fordobler de forkerte svar.

Jev, en System One-model fra TypeSafe (typesafe.ai)

I stedet for at generere tekst besvarer Jev et typet spørgsmål, hvilken kandidat, om nogen, er det samme sted som denne adresse, og returnerer et valg med en kalibreret sandsynlighed. Når den siger 0,9, har den ret omkring 90 % af tiden, og når den er usikker, siger den, at ingen af kandidaterne passer, i stedet for at gætte. Det er præcis den form, en omkostningsbevidst matcher har brug for, og det er derfor, Jev tilføjer match med motorens egen præcision.

Sådan bruger Matcha Jev →

I målte kørsler udgør det uafgjorte bånd 2 % til 8 % af inputtene, så et job med 100.000 adresser giver nogle få tusinde modelkald, ikke hundrede tusinde.

Begge er valgfrie, og begge er slået fra som standard. Motoren har ikke brug for nogen af dem, og en ekstern model kan kun bruges, når du har sat allow_remote i konfigurationen.

Bambuspisker til te

Jev fra typesafe.ai: System One-modeller til de svære sager

Jev udvikles af TypeSafe (typesafe.ai). Matcha kalder den kun på den rest, som motoren ikke selv kan afgøre.

Jev er TypeSafes System One-model. I stedet for at generere tekst besvarer den et typet spørgsmål, hvilken kandidat, om nogen, der er samme sted som denne adresse, og returnerer et valg, en kalibreret sandsynlighed og en konfidens. System One-modeller er bygget til beslutninger af den form, ikke til samtale.

Den form er præcis, hvad en omkostningsbevidst matcher har brug for. Kalibreret betyder, at når Jev siger 0.9, har den ret omkring 90% af gangene, så motoren kan veje svaret mod prisen for et forkert match, og når Jev er usikker, siger den, at ingen af kandidaterne passer, i stedet for at gætte.

Matcha bruger kun Jev på resten, de sager motoren ikke selv kan afgøre, så et job med 100,000 adresser laver nogle få tusinde Jev-kald, ikke hundrede tusinde. Læg din TypeSafe-API-nøgle i miljøet, tilføj adjudicate provider=jev; til PROC MATCHA-trinnet, og lad allow_remote være slået fra, indtil du har besluttet, at de sager må forlade din maskine.

Slå Jev til
export TYPESAFE_API_KEY=...       # never in a file
adjudicate provider=jev;          # inside the PROC MATCHA step

Målt på benchmarken med forvanskede adresser løfter Jev de korrekte match fra 83.3% til 87.8% ved motorens egen præcision på 98.1%, med 0.8% forkerte svar i den trinvise ablation. På de rigtige opslag, som offentligheden har tastet, løste den de svære sager lige så ofte som den lokale model, og når ingen kandidat var den rigtige, sagde den det i stedet for at vælge en.

Læs indlægget fra typesafe.ai: Introducing System One models and Jev

Teblad

Åbne referencedata, kun opdateret når du siger til

Motoren matcher mod den tabel, du giver den, hjulpet af åbne videnspakker: amerikanske adressepunkter fra National Address Database, gadealiasser fra Census TIGER og canadiske adresser fra Statistics Canada, alt sammen public domain eller åbent licenseret. Jenner Analytics genopbygger pakkerne, når deres kilder udgiver, validerer dem mod den forrige udgave, signerer dem og udgiver dem til en datakanal.

Intet på din maskine ændrer sig, før du selv kører opdateringen. Hver pakke verificeres mod et signeret manifest, før en eneste byte pakkes ud, og byttes ind atomisk, så et kørende job ser den gamle pakke eller den nye og aldrig en delvis. PROC MATCHA downloader aldrig noget, og rapporten registrerer, hvilken dataudgivelse en kørsel brugte.

Tjek, og opdater derefter, efter din egen tidsplan
jenner data update --check   # what would change; writes nothing
jenner data update           # install or refresh every pack
jenner data update --pin 2026.9.28

Lokaliteter

USA er standard, og Canada understøttes, inklusive tosprogede former. Lokalitetspakker til Storbritannien, Frankrig, Japan, Korea og Australien er undervejs. Hver af dem er data, ikke kode, så at tilføje et land er at tilføje en pakke.

Én matchingmotor til KYC, AML, svindel, kreditrisiko, levering og compliance

Adresser leveres i dag. Hvert andet match i KYC-familien kører på samme motor: de samme kalibrerede sandsynligheder, de samme omkostningsvægtede beslutninger, de samme output og den samme evalueringskørsel.

En ny slags match er en entitetsdefinition, ikke et nyt produkt: de roller, en post har, komparatoren for hver rolle, blokeringsstrategien og de videnspakker, den må konsultere. Scoringen, beslutningerne, opfølgningslisten og evalueringen er delt kode, så et personnavnematch evalueres og prissættes præcis som et adressematch.

Funktioner på samme motor

IP-adresse mod postadresse: geolokaliseringsafstand og VPN-signaler

Matcha sammenligner, hvor en sessions IP-adresse geolokaliseres, med den adresse, kunden opgiver, ved hjælp af geodætisk afstand med geolokaliseringsradius som usikkerhed. ASN-, proxy- og VPN-flag tæller som evidens imod, aldrig som en dom i sig selv. Resultatet er den samme kalibrerede sandsynlighed og omkostningsvægtede beslutning som et adressematch, så en svindelregel kan handle på det eller sende det til review.

Eksempel: En kortansøger opgiver en Denver-adresse fra en IP, der geolokaliseres 40 km væk uden VPN-flag: enighed inden for radius. Den samme adresse fra en datacenter-IP i et andet land: konflikt, og rækken prissættes til review.

Forespørg om tilgængelighed

E-mail mod person og virksomhed: lokal del, domæne og engangssignaler

E-mail-identitetsentiteten tester, om en adresse tilhører den person og den organisation, der er opgivet ved onboarding. Den lokale del sammenlignes med navnetokens, inklusive fornavn.efternavn, initialer og kaldenavne; domænet sammenlignes med organisationens registrerede domæner; lister over gratis-mail og engangsdomæner samt tilstedeværelsen af MX er evidens. Hvert signal er en komparator, og motoren fortæller, hvor stærkt de stemmer overens.

Eksempel: [email protected] mod Jane Okafor hos Northwind Actuarial: den lokale del stemmer med navnet, og domænet stemmer med virksomheden. [email protected] mod den samme post: engangsdomæne, og det siger sandsynligheden.

Forespørg om tilgængelighed

Matching af virksomhedsnavne: juridiske former, akronymer og registeridentifikatorer

Virksomhedsentiteten fjerner juridiske former efter ISO 20275, vægter sjældne ord, udfolder akronymer og lader en registeridentifikator overtrumfe navnet: LEI, EIN, UEI og Companies House-numre. GLEIF Level 1-data og tidligere navne fra EDGAR er videnspakker, så en virksomhed, der har skiftet navn, stadig matcher modparten i dine bøger. Leverandørvalidering, modpartsmatching og KYB bruger den samme kørsel.

Eksempel: "INTL BUSINESS MACHINES CORP" mod "International Business Machines Corporation" med et matchende LEI: match, registeridentifikatoren overtrumfer. "IBM Credit LLC" mod moderselskabet: nonmatch, med evidens for juridisk form og sjældne ord rapporteret.

Forespørg om tilgængelighed

Matching af personnavne: kaldenavne, translitteration, fonetik og fødselsdato

Personentiteten sammenligner for-, mellem- og efternavne med kaldenavnspakker, translitteration fra kyrillisk, arabisk og CJK, fonetisk sammenligning og varianter i navnerækkefølge, og behandler en ombyttet fødselsdato eller et nationalt ID med gyldigt kontrolciffer som den evidens, det er. En sanktions- eller PEP-liste er en almindelig referencetabel, hvor omkostningen ved et overset match er sat højt, så screening og kundededuplikering er den samme motor med forskellige priser.

Eksempel: "Mohammed Al-Rashid, 03/07/1981" mod "Muhammad Alrashid, 07/03/1981": translitterationen stemmer, datoen er en ombytning af dag og måned, og rækken kommer tilbage som et screeningshit med sin sandsynlighed i stedet for et overset.

Forespørg om tilgængelighed

Telefonnumre og identifikatorer: IBAN, VIN, NPI og nationale ID'er

Telefonnumre normaliseres til E.164 og kontrolleres for konsistens i land og område samt operatørtype. Identifikatorer valideres, før de matches: IBAN-, VIN- og NPI-kontrolcifre, format- og udstederkonsistens, formater for nationale ID'er. En gyldig identifikator er stærk evidens; en ugyldig er et fund i sig selv, rapporteret før en eneste kandidat scores.

Eksempel: En ansøgers IBAN fejler sin mod-97-kontrol: rækken markeres før matching, med begrundelsen, i stedet for at blive scoret mod hver konto i referencetabellen.

Forespørg om tilgængelighed

Koordinater, husstande, transaktionsmodparter og produktnavne

Entiteter kan sammensættes. En enhedskoordinat reverse-geokodes til det nærmeste adressepunkt; en husstand er et adressematch plus enighed om efternavn; en transaktionsmodpart er en virksomhed eller person plus en konto og et land; et produkt- eller lægemiddelnavn matcher ved tokenindeholdelse med en kodeovertrumfning. Scoringskoden kender ikke forskel, og derfor lander hver af dem på samme motor med den samme evalueringskørsel.

Eksempel: En leveringsapps GPS-position lander 30 m fra adressen på ordren: enighed, med afstanden rapporteret. To kundeposter på én adresse med enighed om efternavnet: én husstand, med en kalibreret sandsynlighed på linket.

Forespørg om tilgængelighed

Bygget til de teams, der bærer risikoen

KYC-onboarding og identitetsverificering

Verificér adressen, e-mailen, telefonnummeret og de identifikatorer, en ansøger giver dig, i ét trin, med én sandsynlighed pr. kontrol og ét opfølgende spørgsmål, når noget er tvetydigt. Matcha slår adressen op, mens ansøgeren stadig er på siden, og spørger "Milton or Morton?" i stedet for at afvise kontrollen eller vinke den igennem.

Forespørg om tilgængelighed →

Svindeldetektion og sessionsrisiko

Sammenlign sessionens IP-placering med den opgivne adresse, enhedskoordinaten med leveringsadressen og e-mailen med personen, og få evidens, en regel kan handle på, i stedet for en black-box-score. Hver kandidat, matcheren har overvejet, rapporteres, med sandsynligheden for, at sandheden slet ikke findes i din tabel.

Forespørg om tilgængelighed →

AML og sanktionsscreening

Screen person- og virksomhedsnavne mod sanktions- og PEP-lister med translitteration, kaldenavne, fonetik og ombyttede fødselsdatoer, prissat til screening: et overset hit dyrt, en falsk alarm billig. Listen er en referencetabel, evalueringskørslen scorer din hitrate mod kendte sager, og kalibreringskurven fortæller dig, hvad 0,9 betyder på dine data.

Forespørg om tilgængelighed →

Kreditrisiko og modpartsopløsning

Opløs virksomhederne på en ansøgning, en handel eller en hovedbog til én juridisk enhed på tværs af juridiske former, tidligere navne og registeridentifikatorer, så eksponeringen tælles én gang. LEI, EIN, UEI og Companies House-numre overtrumfer navne, når de findes, og bekræfter dem, når de ikke gør.

Forespørg om tilgængelighed →

Levering, logistik og adressevalidering

Standardiser hver adresse efter postreglerne i dens lokalitet, match den mod din tabel over adresser, der kan betjenes, og få at vide, når en adresse er ægte, men uden for dit område, eller ægte, men mangler i din tabel. En enhedskoordinat ved døren bekræfter leveringspunktet, og omkostningsvægtene afgør, hvornår en forkert adresse er værre end en afvist ordre.

Forespørg om tilgængelighed →

Compliance, revision og datagovernance

Hver beslutning bærer en sandsynlighed, en begrundelse og de overvejede kandidater, i tabeller, du beholder. Intet forlader din maskine, medmindre du vælger at tilføje en model, rapporten registrerer, hvilken dataudgivelse en kørsel brugte, og den samme evalueringskørsel genskaber et resultat for en revisor måneder senere.

Forespørg om tilgængelighed →

Inkluderet i Jenner

PROC MATCHA er en del af Jenner, ikke et separat produkt og ikke et gebyr pr. række. På Windows og Linux købes en Jenner-licens én gang pr. maskine og er permanent: den version, du køber, bliver ved med at køre, så længe du vil bruge den, med nye udgivelser og support inkluderet i et år. Jenner til macOS findes i Mac App Store, og Workspace faktureres pr. time.

Der opkræves intet af Jenner Analytics for en matchet række, en overvejet kandidat eller et stillet spørgsmål. Hvis du vælger Jev, prissætter TypeSafe den pr. input-token, og den ser kun resten.

Køb Jenner

Se priser

Ofte stillede spørgsmål

Jenner kører eksisterende PROC DQMATCH- og PROC DQSCHEME-kode af hensyn til kompatibilitet, så et SAS-datakvalitetsprogram bliver ved med at virke. Matcha er den anbefalede matcher til nyt arbejde: den bruger den samme statement-syntaks i SAS-stil, men returnerer en kalibreret sandsynlighed og en begrundelse for hver beslutning, kan stille et opfølgende spørgsmål og læser og skriver CSV, Parquet, Avro og de fleste databaser gennem den samme data=-syntaks, så du er ikke låst fast til nogen af værktøjerne.

Nej. Motoren er native Rust inde i Jenner-binærfilen og foretager ingen netværkskald; referencedataene er den tabel, du giver den, plus videnspakker installeret på din maskine. Sprogmodeller er slået fra som standard. En lokal model gennem Ollama holder alt på din hardware. En ekstern model som Jev bruges kun, hvis du aktiverer den i konfigurationen, og så ser den kun de uafgjorte sager med deres kandidater, aldrig hele filen.

USA er standardlokaliteten, med standardisering efter USPS Publication 28 og åbne adressedata fra National Address Database og Census TIGER. Canada understøttes, inklusive tosprogede franske former og canadiske postnumre, med data fra Statistics Canada. Lokalitetspakker til Storbritannien, Frankrig, Japan, Korea og Australien er undervejs. Du kan matche mod din egen referencetabel i ethvert land allerede i dag; pakkerne tilføjer standardiseringsregler og åbne adressepunkter.

Ja. Motoren har ikke brug for nogen tjeneste, nøgle eller netværk. Referencepakker installeres én gang med jenner data update og opdateres kun, når du kører den kommando igen. Med en lokal Ollama-model er det valgfrie afgørelsestrin også offline; kun Jev er et eksternt kald, og kun hvis du slår den til.

Når motoren ikke kan vælge mellem kandidater, og du har sat en pris på en opfølgningskanal, kommer de rækker ud som review med de rangordnede kandidater, det præcise felt, der ville afgøre spørgsmålet (suffiks, retning, enhed), og sandsynlighederne. Din proces omsætter det til et spørgsmål til den, der kan svare: et sms-svar, en prompt i en onboarding-formular, en callcenter-skærm. Ingen på matchingsiden læser de rækker, og uden en prissat kanal rapporteres de som nonmatch med de samme kandidater knyttet til.

Giv en kørsel en facitfil med input, hvis korrekte post du kender, og Matcha scorer hver beslutning mod den: korrekt i første forsøg, præcision, forkerte svar, recall blandt de fem bedste kandidater, korrekte afståelser på input uden for området, en kalibreringskurve og den forventede omkostning ved en række fejlvægte. De offentliggjorte resultater på denne side kommer fra den samme kørselstilstand, på offentlige opslag med kendte udfald og på forvanskede adresser med præcis facit.

Ja, på samme motor. Adresser leveres i dag. Personnavne, virksomhedsnavne, e-mail-identitet, IP-placering, telefonnumre, identifikatorer med kontrolcifre og sanktions- eller PEP-lister er entiteter, den samme motor matcher, med de samme kalibrerede sandsynligheder, omkostningsvægtede beslutninger, output og evalueringskørsel. En screeningsliste er en almindelig referencetabel, hvor omkostningen ved et overset match er sat højt. Brug formularen på denne side til at forespørge om tilgængelighed for den entitet, du har brug for.

Matcha er inkluderet i Jenner, så du køber Jenner: en permanent licens pr. maskine til Windows og Linux, Jenner til macOS i Mac App Store eller Workspace-kredit pr. time. Der er intet gebyr pr. række eller pr. match. Prissiden har de aktuelle planer og den gratis prøveperiode.

Ja. En sanktions- eller PEP-liste er en person- eller virksomhedsreferencetabel, og screening er matching med omkostningerne vendt om: et overset hit prissat højt, en falsk alarm prissat lavt. Personentiteten håndterer kaldenavne, translitteration fra kyrillisk, arabisk og CJK, fonetisk sammenligning, varianter i navnerækkefølge og ombyttede fødselsdatoer, og evalueringskørslen scorer din hitrate mod kendte sager. Forespørg om tilgængelighed via formularen på denne side.

Ja. IP-placeringsentiteten geolokaliserer sessionens IP-adresse og sammenligner den med koordinaterne for den opgivne adresse ved geodætisk afstand, med geolokaliseringsradius som usikkerhed, og behandler ASN-, proxy- og VPN-flag som evidens imod. Resultatet er den samme kalibrerede sandsynlighed og beslutning som et adressematch, så en svindelregel eller en review-kø kan bruge det direkte.

Ja. Virksomhedsentiteten fjerner juridiske former efter ISO 20275, vægter sjældne ord, udfolder akronymer og lader en registeridentifikator overtrumfe navnet: LEI, EIN, UEI og Companies House-numre. GLEIF-data og tidligere navne fra EDGAR er videnspakker, så en virksomhed, der har skiftet navn, stadig opløses til modparten i dine bøger. Det er leverandørvalidering, modpartsmatching og KYB i én kørsel.

Jev er en System One-model fra TypeSafe (typesafe.ai). I stedet for at generere tekst besvarer den et typet spørgsmål, hvilken kandidat, om nogen, der er samme sted som denne adresse, med et valg, en kalibreret sandsynlighed og en konfidens. Matcha bruger den, fordi det er formen på en matchbeslutning: når Jev siger 0.9, har den ret omkring 90% af gangene, og når den er usikker, siger den, at ingen af kandidaterne passer. Den kaldes kun på den rest, motoren ikke kan afgøre, nogle få tusinde kald pr. 100,000 rækker, og på benchmarken med forvanskede adresser løfter den de korrekte match fra 83.3% til 87.8% ved motorens egen præcision på 98.1%. Den er slået fra som standard og kræver en TypeSafe-API-nøgle i miljøet samt adjudicate provider=jev; i trinnet.

Ja. Peg Matcha på en lokal model, som Ollama serverer på din egen hardware, helt offline, og det samme afgørelsestrin kører, uden at noget forlader maskinen. Vi måler med qwen2.5:7b-instruct. En lokal model svarer på næsten alle sager, den får vist, hvilket finder flest match, 89.3% korrekte på benchmarken med forvanskede adresser, og omtrent fordobler de forkerte svar sammenlignet med Jev. Du kan også køre begge side om side og få et agree-flag pr. række. Ingen af dem er påkrævet: motoren alene har hverken brug for model, nøgle eller netværk.

Prøv den på dine egne adresser

Kør en evaluering mod nogle få hundrede poster, du kan stå inde for, og få ét ærligt tal for, hvor god den er på dine data.

Anvendelser

Fortæl os om dit matchingproblem

Adresser leveres i dag. Bed om en evalueringskørsel på dine egne data, eller forespørg om tilgængelighed af en funktion på samme motor, så svarer vi med datoer og hvad der skal til for at sætte det op.

Se Matcha selv

Køb Jenner og kør PROC MATCHA på dine egne adresser, læs dokumentationen, eller se den tre minutter lange introduktion til Jenner.

Se introduktionen på 3 minutter