PROC MATCHA

Dopasowuj osoby i adresy

Matcha łączy niechlujne, błędnie napisane, wpisane do połowy adresy z rekordami, do których naprawdę się odnoszą, na Twojej własnej maszynie, ze skalibrowanym prawdopodobieństwem i uzasadnieniem każdej decyzji. Nazwiska osób, nazwy firm, e-mail, lokalizacja IP i identyfikatory działają na tym samym silniku. Do trudnych przypadków dodaj Jev (typesafe.ai) lub lokalny model Ollama.

W cenie Jennera. Bez zewnętrznej usługi, bez klucza API, żadne dane nie opuszczają Twojej sieci, chyba że zdecydujesz się dodać model: Jev (typesafe.ai) lub lokalny model Ollama.

Rysunek piórkiem i tuszem przedstawiający czarkę matchy ze spienioną powierzchnią i opartą o nią bambusową trzepaczką

Dla kogo jest przeznaczona

Sześć zadań, w których adres jest kluczem, a klucz nigdy nie jest wpisywany dwa razy tak samo.

KYC i onboarding klientów

Wnioskodawca wpisuje swój adres raz, na telefonie, w pośpiechu. Matcha rozstrzyga go względem Twojej tabeli referencyjnej, gdy on wciąż jest na stronie, a gdy dwa rekordy są równie prawdopodobne, wskazuje to jedno pole, które by to rozstrzygnęło, więc formularz może zapytać „Milton or Morton?”, zamiast oblać sprawdzenie albo przepuścić je machnięciem ręki.

AML i screening sankcyjny

Screening to dopasowywanie z odwróconymi kosztami: przeoczone trafienie jest drogie, a fałszywy alarm tani. Matcha przyjmuje te koszty jako dane wejściowe i odpowiednio przesuwa swoje progi, więc ten sam silnik, który onboarduje klienta, może go też prześwietlić. Adresy są dostępne już dziś; screening nazwisk osób i nazw firm względem list sankcyjnych i PEP działa na tym samym silniku, z tymi samymi decyzjami.

Wykrywanie oszustw

Matcha raportuje każdego rozważanego kandydata, wraz z dowodami dla poszczególnych pól i prawdopodobieństwem, że prawdy w ogóle nie ma w tabeli. Reguła antyfraudowa może pracować na tym, na co dopasowywacz faktycznie patrzył, a nie na pojedynczym wyniku, a encja lokalizacji IP sprawdza lokalizację sesji względem adresu deklarowanego przez klienta.

Marketing i deduplikacja CRM

To samo gospodarstwo domowe pojawia się na dziesięć sposobów w rejestracjach, zamówieniach i importach. Matcha dopasowuje tabelę do niej samej, zapisuje klastry i zachowuje skalibrowane prawdopodobieństwo na każdym powiązaniu, więc deduplikacja może być tak surowa lub tak łagodna, jak wymaga tego wysyłka, którą zasila. Householding według adresu i nazwiska to encja złożona na tym samym silniku.

Dostawy i logistyka

Błędna dostawa kosztuje kurs powrotny; odrzucone zamówienie kosztuje sprzedaż. Matcha standaryzuje każdy adres według reguł pocztowych jego lokalizacji, dopasowuje go do Twojej tabeli obsługiwanych adresów i mówi Ci, kiedy adres jest prawdziwy, ale poza Twoim obszarem, albo prawdziwy, ale nieobecny w Twojej tabeli, więc poprawka trafia we właściwe miejsce.

Sektor publiczny i civic tech

Miejska usługa wyszukiwania działek pozwalała mieszkańcom wysłać adres SMS-em i otrzymać w odpowiedzi swoją działkę. W najtrudniejszych przypadkach, literówkach i błędach dyktowania, które jej poprzedni dopasowywacz za każdym razem rozstrzygał źle, sam silnik Matcha odpowiedział poprawnie za pierwszym razem w 81% przypadków, a model na reszcie podniósł ten wynik do 91%.

Jak to działa

Natywny Rust wewnątrz pliku binarnego Jenner. Jeden krok, jedna tabela decyzji i uzasadnienie każdej z nich.

1

Parsowanie i standaryzacja

Każdy adres jest dzielony na numer domu, kierunek, ulicę, sufiks, lokal, miasto i kod pocztowy oraz normalizowany według reguł pocztowych jego lokalizacji (USPS Publication 28 dla USA, Canada Post dla Kanady). Tam, gdzie tekst jest niejednoznaczny, parser zachowuje każdą interpretację i pozwala rozstrzygnąć tabeli referencyjnej.

2

Wyszukiwanie kandydatów w Twojej tabeli

Silnik buduje słownik ulic z Twojej własnej tabeli referencyjnej i przypina do niego wpisaną ulicę według pisowni, brzmienia i oficjalnych aliasów. Kandydaci są wyszukiwani według numeru domu, kodu pocztowego i ulicy, więc błędny ZIP nie jest fatalny w skutkach.

3

Ocena każdego pola, kalibracja wyniku

Numer domu, ulica, sufiks, kierunek, lokal i kod pocztowy są porównywane osobno, a dowody składają się na skalibrowane prawdopodobieństwo. Brakujący sufiks nic nie kosztuje, gdy tabela referencyjna ma jedną ulicę o tej nazwie, i rodzi pytanie, gdy ma dwie.

4

Decyzja według kosztu

Ty mówisz, ile w Twoim procesie kosztują błędne dopasowanie, przeoczone dopasowanie i pytanie uzupełniające. Silnik wybiera decyzję o najniższym oczekiwanym koszcie, więc dopasowuje tylko wtedy, gdy jest wystarczająco pewny jak na Twoje liczby, a gdy nie jest, zwraca brak dopasowania zamiast błędnego.

5

Raport ze wszystkiego, na co patrzył

Jeden wiersz na wejście z decyzją, prawdopodobieństwem i uzasadnieniem; jeden wiersz na kandydata z dowodami dla poszczególnych pól; tabela metryk, która mówi, dlaczego wejścia nie zostały dopasowane. Nic nie jest po cichu pomijane.

6

Do modelu trafia tylko reszta

Opcjonalnie przypadki, których silnik nie potrafi rozstrzygnąć, trafiają wraz ze swoimi kandydatami do modelu językowego, w ramach tego samego kroku. Model wybiera jednego kandydata albo mówi, że żaden nie pasuje; nigdy nie przepisuje adresu.

Sześć decyzji, każda z dołączonym prawdopodobieństwem

matchJeden kandydat jest właściwym rekordem z wysokim prawdopodobieństwem. Użyj go.
likelyNajbardziej prawdopodobny kandydat, raportowany ze swoim rzeczywistym prawdopodobieństwem, gdy jest ono poniżej progu match. Nigdy losowy wybór.
nonmatchBrak wiarygodnego kandydata. Traktuj jako nieznalezione; rozważani kandydaci są nadal raportowani.
reviewSilnik nie mógł zdecydować, a Twój proces może zapytać. Emitowane tylko wtedy, gdy wycenisz kanał pytań uzupełniających.
not_in_tablePrawdziwy adres, którego Twoja tabela referencyjna nie zawiera. Popraw tabelę referencyjną, nie wejście.
out_of_areaKod pocztowy lub miejscowość leży poza obszarem tabeli referencyjnej. Skieruj go gdzie indziej.

Lista pytań uzupełniających: zadaj dokładnie właściwe pytanie

Większość dopasowywaczy przekazuje swoje trudne przypadki do kolejki ręcznej weryfikacji, której nikt nie obsługuje. Gdy Matcha nie potrafi zdecydować między kandydatami, wie dlaczego: wejście mówiło 1200 Milton Street, a tabela referencyjna ma 1200 Milton St i 1200 Morton St, dwie nazwy ulic, które wyglądają i brzmią podobnie. To pytanie z odpowiedzią na jedno słowo.

Gdy więc wycenisz kanał pytań uzupełniających, nierozstrzygnięte wiersze wychodzą jako review z uszeregowanymi kandydatami, dokładnym polem, które by to rozstrzygnęło (ask about street, ask about unit), i prawdopodobieństwami, których Twój proces potrzebuje, by zdecydować, czy pytanie jest warte zadania. Usługa SMS odpowiada „Milton or Morton?”. Formularz onboardingowy pokazuje oba adresy. Ekran call center pokazuje agentowi kandydatów zamiast pustego miejsca. Bez wycenionego kanału nie ma decyzji review: te wiersze są nonmatch, z tymi samymi kandydatami i tym samym uzasadnieniem.

Zacznij od uruchomienia ewaluacyjnego

Daj Matchy plik prawdy, kilkaset wejść, za których poprawny rekord możesz ręczyć, a jedno uruchomienie oceni względem niego każdą decyzję: poprawnie za pierwszym razem, precyzja wykonanych dopasowań, błędne odpowiedzi, pełność wśród pięciu najlepszych kandydatów, krzywa kalibracji i oczekiwany koszt dla każdej wagi błędu, tak byś mógł wybrać swoją z krzywej, zamiast zgadywać.

Zmierzone wyniki

Dwa testy, jeden na tym, co faktycznie wpisują ludzie, i jeden na celowo zniekształconych adresach z sześciu obszarów USA. Liczby takie, jak opublikowano w dokumentacji.

Prawdziwe zapytania wpisane przez mieszkańców

Około 2 400 adresów, które mieszkańcy wpisali do miejskiej usługi wyszukiwania działek, względem rejestru około 378 000 działek, przy czym poprawna działka była znana z tego, co nastąpiło potem. W 223 najtrudniejszych przypadkach, prawdziwych literówkach, artefaktach dyktowania i brakujących sufiksach, poprzedni dopasowywacz miasta za pierwszym razem mylił się za każdym razem.

0% do 81%

trudnych przypadków dopasowanych poprawnie za pierwszym razem, sam silnik

91%

z lokalnym modelem lub Jev na reszcie

89% do 97%

zgodność w łatwych przypadkach, od samego silnika do silnika z modelem

Celowo zniekształcone adresy, w skali kraju

3 000 prawdziwych adresów z sześciu losowo wybranych obszarów ZIP, pobranych z National Address Database i zniekształconych mieszanką błędów zmierzoną na prawdziwych danych: literówki, pominięte kierunki i sufiksy, skróty, sklejone tokeny i przestawione cyfry. Prawda jest znana dokładnie, a każde wejście kończy jako dopasowanie lub brak dopasowania, bez odkładania czegokolwiek dla człowieka.

83,3%

poprawne dopasowanie za pierwszym razem, sam silnik

98,1%

precyzja wykonanych dopasowań

1,6%

błędnych odpowiedzi, około jedna na sześćdziesiąt

87,8% do 89,3%

poprawnie za pierwszym razem z Jev lub lokalnym modelem na reszcie

Sam wynik podobieństwa jest niebezpieczny: z włączonym rozmytym dopasowywaniem ulic i niczym ponad nim co czwarty adres wracał błędny. Większość pracy wykonują warianty, aliasy i rozstrzyganie budynków, a warstwa decyzyjna obniża następnie liczbę błędnych odpowiedzi z 3,6% do 0,7%, zwracając brak dopasowania zamiast błędnego, gdy nie jest wystarczająco pewna. Wagi kosztów pozwalają Ci przesunąć ten kompromis w dowolną stronę.

Przyrost etapami: co dodaje każda warstwa

Te same 3 000 zniekształconych adresów, dopasowywane z włączaną po kolei jedną warstwą naraz. Etapy 1 do 5 są kumulatywne; dwa ostatnie to alternatywy na reszcie po pełnym silniku.

0%25%50%75%100%34.6%0.0%Dokładnedopasowanieetap 148.8%20.8%Parsowanie istandaryzacjaetap 264.5%25.0%Rozmyte uliceetap 389.3%3.6%Warianty ilokaleetap 484.1%0.7%Decyzje świadomekosztuetap 590.0% Lokalna AI (Ollama)2.1% Lokalna AI (Ollama)88.5% Jev (TypeSafe)0.8% Jev (TypeSafe)+ AI na reszciePoprawne dopasowanieBłędne dopasowanie

Dokładne dopasowanie ciągów daje 34,6% poprawnych i zero błędnych. Parsowanie i standaryzacja podnoszą poprawne dopasowania do 48,8%, ale błędne do 20,8%. Rozmyte dopasowywanie ulic podnosi poprawne do 64,5%, a błędne do 25,0%. Warianty, aliasy i lokale podnoszą poprawne do 89,3%, a błędne obniżają do 3,6%. Decyzje świadome kosztu, czyli pełny silnik, dają 84,1% poprawnych i 0,7% błędnych. Na reszcie po tym silniku lokalny model Ollama osiąga 90,0% poprawnych przy 2,1% błędnych, a Jev 88,5% poprawnych przy 0,8% błędnych.

Udział 3 000 zniekształconych adresów dopasowanych poprawnie, dopasowanych błędnie lub przeoczonych, według etapu. Dwa ostatnie wiersze to alternatywy odgałęzione od etapu 5, nie sekwencja.
EtapPoprawne dopasowanieBłędne dopasowaniePrzeoczone
etap 1: Dokładne dopasowanie34.6%0.0%65.4%
etap 2: Parsowanie i standaryzacja48.8%20.8%30.4%
etap 3: Rozmyte ulice64.5%25.0%10.5%
etap 4: Warianty i lokale89.3%3.6%7.1%
etap 5: Decyzje świadome kosztu84.1%0.7%15.2%
+ AI na reszcie: Lokalna AI (Ollama)90.0%2.1%7.8%
+ AI na reszcie: Jev (TypeSafe)88.5%0.8%10.7%

Źródło: 3 000 prawdziwych adresów z USA z sześciu losowo wybranych obszarów ZIP, pobranych z National Address Database i zniekształconych mieszanką błędów zmierzoną na prawdziwych danych, więc prawda jest znana dokładnie. Liczby takie, jak opublikowano w dokumentacji PROC MATCHA.

  • Samo rozmyte dopasowywanie jest niebezpieczne. Z włączonym rozmytym dopasowywaniem ulic i niczym ponad nim co czwarty adres wraca błędny, a nic w wyniku podobieństwa nie mówi, który.
  • Warstwa wariantów wykonuje najcięższą pracę. Oficjalne aliasy ulic, alternatywne pisownie oraz rozstrzyganie lokali i budynków podnoszą poprawne dopasowania z 64,5% do 89,3% i obniżają błędne z 25,0% do 3,6%.
  • Warstwa decyzyjna obniża błędne odpowiedzi poniżej 1%. Wyceniając błędne dopasowanie względem przeoczonego, silnik zwraca brak dopasowania zamiast błędnego, gdy nie jest wystarczająco pewny: 0,7% błędnych, a nierozstrzygnięte przypadki są raportowane, nie pomijane.
  • AI na reszcie podnosi poprawne dopasowania do około 90%. Lokalny model znajduje najwięcej dopasowań i mniej więcej potraja liczbę błędnych odpowiedzi; Jev dodaje dopasowania z precyzją samego silnika, 0,8% błędnych.

Uruchom ją na własnych adresach

Matcha jest w zestawie z każdą licencją Jenner. Kup Jenner, przeczytaj dokumentację PROC MATCHA albo opowiedz nam o swoim problemie z dopasowywaniem, a pomożemy Ci przygotować uruchomienie ewaluacyjne.

Liść herbaty

Przynieś własny model

Modele językowe są drogie na wiersz i wolne na wiersz. Matcha używa ich tak, jak zrobiłby to dobry analityk: tylko w przypadkach wymagających osądu.

Ollama z qwen2.5:7b-instruct, całkowicie offline

Uruchom lokalny model przez Ollama na własnym sprzęcie, całkowicie offline, tak aby nic nie opuszczało maszyny. Mierzymy z qwen2.5:7b-instruct. Modele lokalne są darmowe na wiersz i odpowiadają na niemal każde pytanie, które im pokazano, co znajduje najwięcej dopasowań i mniej więcej podwaja błędne odpowiedzi.

Jev, model System One od TypeSafe (typesafe.ai)

Zamiast generować tekst, Jev odpowiada na typowane pytanie, który kandydat, jeśli którykolwiek, jest tym samym miejscem co ten adres, i zwraca wybór ze skalibrowanym prawdopodobieństwem. Gdy mówi 0,9, ma rację w około 90% przypadków, a gdy nie jest pewny, mówi, że żaden z kandydatów nie pasuje, zamiast zgadywać. To dokładnie taki kształt, jakiego potrzebuje dopasowywacz świadomy kosztów, i dlatego Jev dodaje dopasowania z precyzją samego silnika.

Jak Matcha używa Jev →

W zmierzonych uruchomieniach pasmo nierozstrzygniętych to 2% do 8% wejść, więc zadanie ze 100 000 adresów generuje kilka tysięcy wywołań modelu, a nie sto tysięcy.

Oba są opcjonalne i oba są domyślnie wyłączone. Silnik nie potrzebuje żadnego z nich, a zdalny model może być użyty dopiero po ustawieniu allow_remote w konfiguracji.

Bambusowa miotełka do herbaty

Jev od typesafe.ai: modele System One do trudnych przypadków

Jev tworzy TypeSafe (typesafe.ai). Matcha wywołuje go tylko dla reszty, której silnik nie potrafi rozstrzygnąć.

Jev to model System One firmy TypeSafe. Zamiast generować tekst, odpowiada na typowane pytanie, który kandydat, o ile którykolwiek, jest tym samym miejscem co ten adres, i zwraca wybór, skalibrowane prawdopodobieństwo oraz pewność. Modele System One są zbudowane do decyzji tego kształtu, nie do rozmowy.

Właśnie takiego kształtu potrzebuje dopasowywacz świadomy kosztów. Skalibrowany znaczy, że gdy Jev mówi 0.9, ma rację w około 90% przypadków, więc silnik może zważyć jego odpowiedź wobec ceny błędnego dopasowania, a gdy Jev nie jest pewny, mówi, że żaden z kandydatów nie pasuje, zamiast zgadywać.

Matcha używa Jev tylko dla reszty, przypadków, których silnik nie potrafi rozstrzygnąć sam, więc zadanie na 100,000 adresów wykonuje kilka tysięcy wywołań Jev, a nie sto tysięcy. Umieść klucz API TypeSafe w środowisku, dodaj adjudicate provider=jev; do kroku PROC MATCHA i zostaw allow_remote wyłączone, dopóki nie zdecydujesz, że te przypadki mogą opuścić Twoją maszynę.

Włączanie Jev
export TYPESAFE_API_KEY=...       # never in a file
adjudicate provider=jev;          # inside the PROC MATCHA step

Zmierzony na benchmarku zniekształconych adresów Jev podnosi poprawne dopasowania z 83.3% do 87.8% przy własnej precyzji silnika 98.1%, z 0.8% błędnych odpowiedzi w ablacji etap po etapie. W prawdziwych wyszukiwaniach wpisanych przez mieszkańców rozwiązał trudne przypadki równie często jak model lokalny, a gdy żaden kandydat nie był właściwy, mówił to, zamiast wybierać któregoś.

Przeczytaj wpis od typesafe.ai: Introducing System One models and Jev

Liść herbaty

Otwarte dane referencyjne, aktualizowane tylko wtedy, gdy zdecydujesz

Silnik dopasowuje do tabeli, którą mu dasz, wspomagany otwartymi pakietami wiedzy: punktami adresowymi USA z National Address Database, aliasami ulic z Census TIGER i adresami kanadyjskimi ze Statistics Canada, wszystko w domenie publicznej lub na otwartej licencji. Jenner Analytics przebudowuje pakiety, gdy ich źródła publikują nowe dane, waliduje je względem poprzedniego wydania, podpisuje i publikuje w kanale danych.

Nic na Twojej maszynie się nie zmienia, dopóki sam nie uruchomisz aktualizacji. Każdy pakiet jest weryfikowany względem podpisanego manifestu, zanim zostanie wyodrębniony choć jeden bajt, i podmieniany atomowo, więc działające zadanie widzi stary pakiet albo nowy, nigdy częściowy. PROC MATCHA nigdy niczego nie pobiera, a raport odnotowuje, którego wydania danych użyło uruchomienie.

Sprawdź, potem zaktualizuj, według własnego harmonogramu
jenner data update --check   # what would change; writes nothing
jenner data update           # install or refresh every pack
jenner data update --pin 2026.9.28

Lokalizacje

USA są domyślne, a Kanada jest obsługiwana, w tym formy dwujęzyczne. Pakiety lokalizacji dla Wielkiej Brytanii, Francji, Japonii, Korei i Australii są w przygotowaniu. Każdy z nich to dane, nie kod, więc dodanie kraju to dodanie pakietu.

Jeden silnik dopasowywania dla KYC, AML, fraudu, ryzyka kredytowego, dostaw i compliance

Adresy są dostępne już dziś. Każde inne dopasowanie z rodziny KYC działa na tym samym silniku: te same skalibrowane prawdopodobieństwa, te same decyzje ważone kosztem, te same wyjścia i to samo uruchomienie ewaluacyjne.

Nowy rodzaj dopasowania to definicja encji, nie nowy produkt: role, jakie ma rekord, komparator dla każdej roli, strategia blokowania i pakiety wiedzy, z których może korzystać. Ocena, decyzje, lista pytań uzupełniających i ewaluacja to wspólny kod, więc dopasowanie nazwiska jest ewaluowane i wyceniane dokładnie tak jak dopasowanie adresu.

Możliwości na tym samym silniku

Adres IP a adres pocztowy: odległość geolokalizacji i sygnały VPN

Matcha porównuje, gdzie geolokalizuje się adres IP sesji, z adresem deklarowanym przez klienta, używając odległości geodezyjnej z promieniem geolokalizacji jako niepewnością. Flagi ASN, proxy i VPN liczą się jako dowód przeciw, nigdy jako werdykt same w sobie. Wynik to to samo skalibrowane prawdopodobieństwo i ta sama decyzja ważona kosztem co przy dopasowaniu adresu, więc reguła antyfraudowa może na nim działać albo skierować go do review.

Przykład: Wnioskodawca o kartę podaje adres w Denver z IP geolokalizowanego 40 km dalej, bez flagi VPN: zgodność w granicach promienia. Ten sam adres z IP centrum danych w innym kraju: konflikt, a wiersz jest wyceniony do review.

Zapytaj o dostępność

E-mail a osoba i firma: część lokalna, domena i sygnały adresów jednorazowych

Encja tożsamości e-mail sprawdza, czy adres należy do osoby i organizacji zadeklarowanych przy onboardingu. Część lokalna jest porównywana z tokenami nazwiska, z uwzględnieniem form first.last, inicjałów i zdrobnień; domena jest porównywana z zarejestrowanymi domenami organizacji; listy domen darmowej poczty i domen jednorazowych oraz obecność rekordu MX są dowodami. Każdy sygnał to komparator, a silnik mówi, jak silnie się zgadzają.

Przykład: [email protected] względem Jane Okafor z Northwind Actuarial: część lokalna zgadza się z nazwiskiem, a domena z firmą. [email protected] względem tego samego rekordu: domena jednorazowa, i prawdopodobieństwo to pokazuje.

Zapytaj o dostępność

Dopasowywanie nazw firm: formy prawne, akronimy i identyfikatory rejestrowe

Encja firmy usuwa formy prawne według ISO 20275, waży rzadkie słowa, rozwija akronimy i pozwala identyfikatorowi rejestrowemu przeważyć nad nazwą: LEI, EIN, UEI i numery Companies House. Dane GLEIF Level 1 i dawne nazwy z EDGAR to pakiety wiedzy, więc firma, która zmieniła nazwę, nadal dopasowuje się do kontrahenta w Twoich księgach. Walidacja dostawców, dopasowywanie kontrahentów i KYB używają tego samego uruchomienia.

Przykład: "INTL BUSINESS MACHINES CORP" względem "International Business Machines Corporation" ze zgodnym LEI: match, przeważa identyfikator rejestrowy. "IBM Credit LLC" względem spółki matki: nonmatch, z raportowanymi dowodami z formy prawnej i rzadkich słów.

Zapytaj o dostępność

Dopasowywanie nazwisk osób: zdrobnienia, transliteracja, fonetyka i data urodzenia

Encja osoby porównuje imiona, drugie imiona i nazwiska z pakietami zdrobnień, transliteracją z cyrylicy, arabskiego i CJK, porównaniem fonetycznym i wariantami kolejności nazwisk, a przestawioną datę urodzenia lub numer krajowy z poprawną sumą kontrolną traktuje jako dowód, którym jest. Lista sankcyjna lub lista PEP to zwykła tabela referencyjna z wysoko ustawionym kosztem przeoczonego dopasowania, więc screening i deduplikacja klientów to ten sam silnik z innymi cenami.

Przykład: "Mohammed Al-Rashid, 03/07/1981" względem "Muhammad Alrashid, 07/03/1981": transliteracja się zgadza, data to przestawienie dnia i miesiąca, a wiersz wraca jako trafienie screeningowe ze swoim prawdopodobieństwem, a nie jako przeoczone.

Zapytaj o dostępność

Numery telefonów i identyfikatory: IBAN, VIN, NPI i numery krajowe

Numery telefonów są normalizowane do E.164 i sprawdzane pod kątem spójności kraju i strefy oraz typu operatora. Identyfikatory są walidowane przed dopasowaniem: sumy kontrolne IBAN, VIN i NPI, spójność formatu i wystawcy, kształty numerów krajowych. Poprawny identyfikator to silny dowód; niepoprawny to ustalenie samo w sobie, raportowane, zanim oceniony zostanie choć jeden kandydat.

Przykład: IBAN wnioskodawcy nie przechodzi kontroli mod-97: wiersz jest oflagowany przed dopasowaniem, z podaniem powodu, zamiast być oceniany względem każdego konta w tabeli referencyjnej.

Zapytaj o dostępność

Współrzędne, gospodarstwa domowe, kontrahenci transakcji i nazwy produktów

Encje się składają. Współrzędna urządzenia jest odwrotnie geokodowana do najbliższego punktu adresowego; gospodarstwo domowe to dopasowanie adresu plus zgodność nazwiska; kontrahent transakcji to firma lub osoba plus konto i kraj; nazwa produktu lub leku dopasowuje się przez zawieranie tokenów z nadrzędnością kodu. Kod oceniający nie zna różnicy, i dlatego każda z nich trafia na ten sam silnik z tym samym uruchomieniem ewaluacyjnym.

Przykład: Pozycja GPS aplikacji dostawczej ląduje 30 m od adresu na zamówieniu: zgodność, z raportowaną odległością. Dwa rekordy klientów pod jednym adresem ze zgodnym nazwiskiem: jedno gospodarstwo domowe, ze skalibrowanym prawdopodobieństwem na powiązaniu.

Zapytaj o dostępność

Zbudowana dla zespołów, które ponoszą ryzyko

Onboarding KYC i weryfikacja tożsamości

Zweryfikuj adres, e-mail, telefon i identyfikatory podane przez wnioskodawcę w jednym kroku, z jednym prawdopodobieństwem na sprawdzenie i jednym pytaniem uzupełniającym, gdy coś jest niejednoznaczne. Matcha rozstrzyga adres, gdy wnioskodawca wciąż jest na stronie, i pyta „Milton or Morton?”, zamiast oblać sprawdzenie albo przepuścić je machnięciem ręki.

Zapytaj o dostępność →

Wykrywanie oszustw i ryzyko sesji

Porównaj lokalizację IP sesji z deklarowanym adresem, współrzędną urządzenia z adresem dostawy i e-mail z osobą, i otrzymaj dowody, na których reguła może działać, zamiast wyniku z czarnej skrzynki. Każdy kandydat rozważany przez dopasowywacz jest raportowany, z prawdopodobieństwem, że prawdy w ogóle nie ma w Twojej tabeli.

Zapytaj o dostępność →

AML i screening sankcyjny

Prześwietlaj nazwiska osób i nazwy firm względem list sankcyjnych i PEP z transliteracją, zdrobnieniami, fonetyką i przestawieniami daty urodzenia, wycenione pod screening: przeoczone trafienie drogie, fałszywy alarm tani. Lista to tabela referencyjna, uruchomienie ewaluacyjne ocenia Twój współczynnik trafień względem znanych przypadków, a krzywa kalibracji mówi, co na Twoich danych oznacza 0,9.

Zapytaj o dostępność →

Ryzyko kredytowe i rozstrzyganie kontrahentów

Sprowadź firmy z wniosku, transakcji lub księgi do jednego podmiotu prawnego niezależnie od form prawnych, dawnych nazw i identyfikatorów rejestrowych, tak by ekspozycja była liczona raz. LEI, EIN, UEI i numery Companies House przeważają nad nazwami, gdy są obecne, i potwierdzają je, gdy ich nie ma.

Zapytaj o dostępność →

Dostawy, logistyka i walidacja adresów

Standaryzuj każdy adres według reguł pocztowych jego lokalizacji, dopasuj go do Twojej tabeli obsługiwanych adresów i dowiedz się, kiedy adres jest prawdziwy, ale poza Twoim obszarem, albo prawdziwy, ale nieobecny w Twojej tabeli. Współrzędna urządzenia pod drzwiami potwierdza punkt dostawy, a wagi kosztów decydują, kiedy błędny adres jest gorszy niż odrzucone zamówienie.

Zapytaj o dostępność →

Compliance, audyt i zarządzanie danymi

Każda decyzja niesie prawdopodobieństwo, uzasadnienie i rozważanych kandydatów, w tabelach, które zachowujesz. Nic nie opuszcza Twojej maszyny, chyba że zdecydujesz się dodać model, raport odnotowuje, którego wydania danych użyło uruchomienie, a to samo uruchomienie ewaluacyjne odtwarza wynik dla audytora miesiące później.

Zapytaj o dostępność →

W zestawie z Jennerem

PROC MATCHA jest częścią Jenner, nie osobnym produktem ani opłatą za wiersz. Na Windows i Linuksie licencję Jenner kupuje się raz na maszynę i jest ona wieczysta: wersja, którą kupujesz, działa tak długo, jak chcesz jej używać, z nowymi wydaniami i wsparciem w cenie przez rok. Jenner dla macOS jest w Mac App Store, a Workspace jest rozliczany godzinowo.

Jenner Analytics nie pobiera żadnej opłaty za dopasowany wiersz, rozważanego kandydata ani zadane pytanie. Jeśli wybierzesz Jev, TypeSafe rozlicza go za token wejściowy, a widzi on tylko resztę.

Kup Jenner

Zobacz cennik

Najczęściej zadawane pytania

Jenner uruchamia istniejący kod PROC DQMATCH i PROC DQSCHEME dla zachowania zgodności, więc program jakości danych SAS nadal działa. Matcha to zalecany dopasowywacz do nowej pracy: używa tej samej składni instrukcji w stylu SAS, ale zwraca skalibrowane prawdopodobieństwo i uzasadnienie każdej decyzji, potrafi zadać pytanie uzupełniające oraz czyta i zapisuje CSV, Parquet, Avro i większość baz danych przez tę samą składnię data=, więc nie jesteś związany z żadnym z tych narzędzi.

Nie. Silnik to natywny Rust wewnątrz pliku binarnego Jenner i nie wykonuje żadnych wywołań sieciowych; dane referencyjne to tabela, którą mu dasz, plus pakiety wiedzy zainstalowane na Twojej maszynie. Modele językowe są domyślnie wyłączone. Lokalny model przez Ollama zatrzymuje wszystko na Twoim sprzęcie. Zdalny model, taki jak Jev, jest używany tylko wtedy, gdy włączysz go w konfiguracji, i wtedy widzi tylko nierozstrzygnięte przypadki z ich kandydatami, nigdy cały plik.

Stany Zjednoczone są domyślną lokalizacją, ze standaryzacją według USPS Publication 28 i otwartymi danymi adresowymi z National Address Database i Census TIGER. Kanada jest obsługiwana, w tym dwujęzyczne formy francuskie i kanadyjskie kody pocztowe, z danymi ze Statistics Canada. Pakiety lokalizacji dla Wielkiej Brytanii, Francji, Japonii, Korei i Australii są w przygotowaniu. Już dziś możesz dopasowywać do własnej tabeli referencyjnej w dowolnym kraju; pakiety dodają reguły standaryzacji i otwarte punkty adresowe.

Tak. Silnik nie potrzebuje żadnej usługi, klucza ani sieci. Pakiety referencyjne instaluje się raz poleceniem jenner data update i odświeża tylko wtedy, gdy ponownie uruchomisz to polecenie. Z lokalnym modelem Ollama opcjonalny krok adjudykacji również działa offline; tylko Jev jest wywołaniem zdalnym, i to tylko wtedy, gdy go włączysz.

Gdy silnik nie potrafi zdecydować między kandydatami, a Ty wyceniłeś kanał pytań uzupełniających, te wiersze wychodzą jako review z uszeregowanymi kandydatami, dokładnym polem, które rozstrzygnęłoby pytanie (sufiks, kierunek, lokal), i prawdopodobieństwami. Twój proces zamienia to w pytanie do kogoś, kto potrafi na nie odpowiedzieć: odpowiedź SMS, monit w formularzu onboardingowym, ekran call center. Nikt po stronie dopasowywania nie czyta tych wierszy, a bez wycenionego kanału są one raportowane jako nonmatch z tymi samymi dołączonymi kandydatami.

Daj uruchomieniu plik prawdy z wejściami, których poprawny rekord znasz, a Matcha oceni względem niego każdą decyzję: poprawnie za pierwszym razem, precyzja, błędne odpowiedzi, pełność wśród pięciu najlepszych kandydatów, poprawne powstrzymanie się od odpowiedzi dla wejść spoza obszaru, krzywa kalibracji i oczekiwany koszt dla zakresu wag błędu. Opublikowane wyniki na tej stronie pochodzą z tego samego trybu uruchomienia, na publicznych zapytaniach ze znanym wynikiem i na zniekształconych adresach z dokładną prawdą.

Tak, na tym samym silniku. Adresy są dostępne już dziś. Nazwiska osób, nazwy firm, tożsamość e-mail, lokalizacja IP, numery telefonów, identyfikatory z sumą kontrolną oraz listy sankcyjne i PEP to encje, które dopasowuje ten sam silnik, z tymi samymi skalibrowanymi prawdopodobieństwami, decyzjami ważonymi kosztem, wyjściami i uruchomieniem ewaluacyjnym. Lista screeningowa to zwykła tabela referencyjna z wysoko ustawionym kosztem przeoczonego dopasowania. Użyj formularza na tej stronie, aby zapytać o dostępność potrzebnej Ci encji.

Matcha jest w zestawie z Jennerem, więc kupujesz Jenner: wieczystą licencję na maszynę dla Windows i Linuksa, Jenner dla macOS w Mac App Store albo godzinowe kredyty Workspace. Nie ma opłaty za wiersz ani za dopasowanie. Aktualne plany i bezpłatny okres próbny znajdziesz na stronie cennika.

Tak. Lista sankcyjna lub lista PEP to tabela referencyjna osób lub firm, a screening to dopasowywanie z odwróconymi kosztami: przeoczone trafienie wycenione wysoko, fałszywy alarm nisko. Encja osoby obsługuje zdrobnienia, transliterację z cyrylicy, arabskiego i CJK, porównanie fonetyczne, warianty kolejności nazwisk i przestawienia daty urodzenia, a uruchomienie ewaluacyjne ocenia Twój współczynnik trafień względem znanych przypadków. Zapytaj o dostępność przez formularz na tej stronie.

Tak. Encja lokalizacji IP geolokalizuje adres IP sesji i porównuje go ze współrzędnymi deklarowanego adresu według odległości geodezyjnej, używając promienia geolokalizacji jako niepewności, a flagi ASN, proxy i VPN traktuje jako dowód przeciw. Wynik to to samo skalibrowane prawdopodobieństwo i ta sama decyzja co przy dopasowaniu adresu, więc reguła antyfraudowa lub kolejka review mogą użyć go bezpośrednio.

Tak. Encja firmy usuwa formy prawne według ISO 20275, waży rzadkie słowa, rozwija akronimy i pozwala identyfikatorowi rejestrowemu przeważyć nad nazwą: LEI, EIN, UEI i numery Companies House. Dane GLEIF i dawne nazwy z EDGAR to pakiety wiedzy, więc firma po zmianie nazwy nadal rozstrzyga się do kontrahenta w Twoich księgach. To walidacja dostawców, dopasowywanie kontrahentów i KYB w jednym uruchomieniu.

Jev to model System One stworzony przez TypeSafe (typesafe.ai). Zamiast generować tekst, odpowiada na typowane pytanie, który kandydat, o ile którykolwiek, jest tym samym miejscem co ten adres, wyborem, skalibrowanym prawdopodobieństwem i pewnością. Matcha używa go, bo taki jest kształt decyzji o dopasowaniu: gdy Jev mówi 0.9, ma rację w około 90% przypadków, a gdy nie jest pewny, mówi, że żaden z kandydatów nie pasuje. Jest wywoływany tylko dla reszty, której silnik nie potrafi rozstrzygnąć, kilka tysięcy wywołań na 100,000 wierszy, a na benchmarku zniekształconych adresów podnosi poprawne dopasowania z 83.3% do 87.8% przy własnej precyzji silnika 98.1%. Domyślnie jest wyłączony i wymaga klucza API TypeSafe w środowisku oraz adjudicate provider=jev; w kroku.

Tak. Wskaż Matcha lokalny model serwowany przez Ollama na własnym sprzęcie, całkowicie offline, a ten sam krok rozstrzygania działa bez wysyłania czegokolwiek poza maszynę. Mierzymy z qwen2.5:7b-instruct. Model lokalny odpowiada na niemal każdy pokazany mu przypadek, co znajduje najwięcej dopasowań, 89.3% poprawnych na benchmarku zniekształconych adresów, i mniej więcej podwaja błędne odpowiedzi w porównaniu z Jev. Możesz też uruchomić oba obok siebie i dostać flagę agree dla każdego wiersza. Żaden nie jest wymagany: sam silnik nie potrzebuje modelu, klucza ani sieci.

Wypróbuj ją na własnych adresach

Uruchom ewaluację na kilkuset rekordach, za które możesz ręczyć, i otrzymaj jedną uczciwą liczbę mówiącą, jak dobrze radzi sobie na Twoich danych.

Zastosowania

Opowiedz nam o swoim problemie z dopasowywaniem

Adresy są dostępne już dziś. Poproś o uruchomienie ewaluacyjne na własnych danych albo zapytaj o dostępność możliwości na tym samym silniku, a odpowiemy z terminami i tym, czego wymaga konfiguracja.

Zobacz Matchę na własne oczy

Kup Jenner i uruchom PROC MATCHA na własnych adresach, przeczytaj dokumentację albo obejrzyj trzyminutowe wprowadzenie do Jenner.

Obejrzyj 3-minutowe wprowadzenie