Matcha collega indirizzi disordinati, con errori di ortografia o digitati a metà ai record a cui si riferiscono davvero, sulla sua macchina, con una probabilità calibrata e una motivazione per ogni decisione. Nomi di persone, nomi di aziende, email, posizione IP e identificativi girano sullo stesso motore. Per i casi difficili, aggiungete Jev (typesafe.ai) o un modello Ollama locale.
Incluso in Jenner. Nessun servizio esterno, nessuna chiave API, nessun dato lascia la vostra rete, a meno che non scegliate di aggiungere un modello: Jev (typesafe.ai) o un modello Ollama locale.
A chi è rivolto
Sei attività in cui l'indirizzo è la chiave, e la chiave non viene mai digitata due volte allo stesso modo.
KYC e onboarding dei clienti
Un richiedente digita il proprio indirizzo una sola volta, da telefono, di fretta. Matcha lo risolve rispetto alla sua tabella di riferimento mentre è ancora sulla pagina, e quando due record sono ugualmente plausibili indica l'unico campo che deciderebbe la questione, così il modulo può chiedere "Milton or Morton?" invece di far fallire il controllo o lasciarlo passare.
AML e screening delle sanzioni
Lo screening è un matching con i costi invertiti: una corrispondenza mancata costa cara e un falso allarme costa poco. Matcha prende quei costi come input e sposta le sue soglie di conseguenza, così lo stesso motore che fa l'onboarding di un cliente può sottoporlo a screening. Gli indirizzi sono disponibili oggi; lo screening di nomi di persone e di aziende rispetto a liste di sanzioni e PEP gira sullo stesso motore, con le stesse decisioni.
Rilevamento delle frodi
Matcha riporta ogni candidato che ha considerato, con le evidenze per campo e la probabilità che la verità non sia affatto nella tabella. Una regola antifrode può lavorare su ciò che il matcher ha effettivamente esaminato anziché su un singolo punteggio, e l'entità posizione IP confronta la posizione di una sessione con l'indirizzo dichiarato dal cliente.
Deduplicazione per marketing e CRM
Lo stesso nucleo familiare compare in dieci modi diversi tra iscrizioni, ordini e importazioni. Matcha abbina una tabella a se stessa, scrive i cluster e mantiene una probabilità calibrata su ogni collegamento, così una deduplicazione può essere rigorosa o tollerante quanto lo richiede la spedizione che alimenta. L'householding per indirizzo e cognome è un'entità composta sullo stesso motore.
Consegne e logistica
Una consegna sbagliata costa un viaggio di ritorno; un ordine rifiutato costa la vendita. Matcha standardizza ogni indirizzo secondo le regole postali della sua area, lo abbina alla sua tabella di indirizzi serviti e le dice quando un indirizzo è reale ma fuori dalla sua area, o reale ma assente dalla sua tabella, così la correzione arriva al posto giusto.
Settore pubblico e civic tech
Un servizio comunale di ricerca particelle catastali permetteva ai residenti di inviare un indirizzo via SMS e ricevere la propria particella. Sui casi più difficili, gli errori di ortografia e le sviste di dettatura che il matcher precedente sbagliava ogni volta, il solo motore Matcha ha risposto correttamente all'81% al primo tentativo, e un modello sul residuo ha portato quel valore al 91%.
Come funziona
Rust nativo dentro il binario Jenner. Un solo step, una sola tabella di decisioni e una motivazione per ciascuna.
1
Analizza e standardizza
Ogni indirizzo viene scomposto in numero civico, direzione, via, suffisso, unità, città e codice postale, e normalizzato secondo le regole postali della sua area (USPS Publication 28 per gli Stati Uniti, Canada Post per il Canada). Dove il testo è ambiguo il parser conserva ogni lettura e lascia decidere al riferimento.
2
Trova i candidati nella sua tabella
Il motore costruisce un vocabolario delle vie dalla sua tabella di riferimento e vi aggancia la via digitata per ortografia, suono e alias ufficiali. I candidati vengono trovati per numero civico, codice postale e via, così uno ZIP sbagliato non è fatale.
3
Valuta ogni campo, calibra il risultato
Numero civico, via, suffisso, direzione, unità e codice postale vengono confrontati separatamente, e le evidenze si combinano in una probabilità calibrata. Un suffisso mancante non costa nulla quando il riferimento ha una sola via con quel nome, e solleva una domanda quando ne ha due.
4
Decidi in base al costo
Lei indica quanto costano nel suo processo un abbinamento sbagliato, un abbinamento mancato e una domanda di follow-up. Il motore sceglie la decisione con il costo atteso più basso, così abbina solo quando è abbastanza sicuro per i suoi numeri e quando non lo è restituisce nessun abbinamento invece di uno sbagliato.
5
Riporta tutto ciò che ha esaminato
Una riga per ogni input con decisione, probabilità e motivazione; una riga per ogni candidato con le evidenze per campo; una tabella di metriche che spiega perché gli input non hanno trovato corrispondenza. Nulla viene scartato in silenzio.
6
Invia a un modello solo il residuo
Facoltativamente, i casi che il motore non riesce a risolvere vanno a un modello linguistico insieme ai loro candidati, all'interno dello stesso step. Il modello sceglie un candidato o dice che nessuno è adatto; non riscrive mai l'indirizzo.
Sei decisioni, ciascuna con una probabilità associata
match
Un candidato è il record giusto con alta probabilità. Lo usi.
likely
Il candidato più probabile, riportato con la sua probabilità reale quando è inferiore alla soglia di match. Mai una scelta casuale.
nonmatch
Nessun candidato plausibile. Lo tratti come non trovato; i candidati considerati vengono comunque riportati.
review
Il motore non è riuscito a decidere e il suo processo può fare una domanda. Emessa solo quando assegna un costo a un canale di follow-up.
not_in_table
Un indirizzo reale che il suo riferimento non contiene. Corregga il riferimento, non l'input.
out_of_area
Il codice postale o la località sono fuori dall'area del riferimento. Lo indirizzi altrove.
La lista di follow-up: fare esattamente la domanda giusta
La maggior parte dei matcher passa i casi difficili a una coda di revisione manuale che nessuno presidia. Quando Matcha non riesce a decidere tra i candidati sa perché: l'input diceva 1200 Milton Street e il riferimento ha un 1200 Milton St e un 1200 Morton St, due nomi di via che si somigliano alla vista e all'orecchio. È una domanda con una risposta di una parola.
Così, quando assegna un costo a un canale di follow-up, le righe indecise escono come review con i candidati ordinati, il campo esatto che risolverebbe la questione (ask about street, ask about unit) e le probabilità di cui il suo processo ha bisogno per decidere se la domanda vale la pena. Un servizio SMS risponde "Milton or Morton?". Un modulo di onboarding mostra i due indirizzi. Una schermata di call center mostra all'operatore i candidati invece di un campo vuoto. Senza un canale con un costo assegnato non esiste la decisione review: quelle righe sono nonmatch, con gli stessi candidati e la stessa motivazione allegati.
Inizi con una corsa di valutazione
Dia a Matcha un file di verità, qualche centinaio di input di cui può garantire il record corretto, e una sola corsa valuta ogni decisione rispetto a esso: corretti al primo tentativo, precisione degli abbinamenti effettuati, risposte sbagliate, recall tra i primi cinque candidati, una curva di calibrazione e il costo atteso per ciascun peso di errore, così può scegliere il suo dalla curva invece di tirare a indovinare.
Risultati misurati
Due test, uno su ciò che il pubblico digita davvero e uno su indirizzi corrotti deliberatamente in sei aree degli Stati Uniti. Numeri come pubblicati nella documentazione.
Ricerche reali digitate dal pubblico
Circa 2.400 indirizzi che i residenti hanno digitato in un servizio comunale di ricerca particelle catastali, rispetto a un registro di circa 378.000 particelle, con la particella corretta nota da ciò che è successo dopo. Sui 223 casi più difficili, veri errori di ortografia, artefatti di dettatura e suffissi mancanti, il matcher precedente del comune sbagliava al primo tentativo ogni volta.
da 0% a 81%
casi difficili abbinati correttamente al primo tentativo, solo motore
91%
con un modello locale o Jev sul residuo
da 89% a 97%
concordanza sui casi facili, dal solo motore al motore più modello
Indirizzi corrotti deliberatamente, su scala nazionale
3.000 indirizzi reali di sei aree ZIP scelte a caso, estratti dal National Address Database e corrotti con la combinazione di errori misurata su dati reali: errori di ortografia, direzioni e suffissi omessi, abbreviazioni, token incollati e cifre scambiate. La verità è nota esattamente, e ogni input termina come match o non-match senza che nulla venga messo da parte per una persona.
83,3%
abbinamento corretto al primo tentativo, solo motore
98,1%
precisione degli abbinamenti effettuati
1,6%
risposte sbagliate, circa una su sessanta
da 87,8% a 89,3%
corretti al primo tentativo con Jev o un modello locale sul residuo
Un punteggio di similarità da solo è pericoloso: con il matching fuzzy delle vie attivo e nulla sopra di esso, un indirizzo su quattro tornava sbagliato. Le alternative, gli alias e la risoluzione degli edifici fanno la maggior parte del lavoro, e il livello decisionale riduce poi le risposte sbagliate dal 3,6% allo 0,7% restituendo nessun abbinamento invece di uno sbagliato quando non è abbastanza sicuro. I pesi di costo le permettono di spostare quel compromesso in entrambe le direzioni.
Guadagno per fase: cosa aggiunge ogni livello
Gli stessi 3.000 indirizzi corrotti, abbinati attivando un livello alla volta. Le fasi da 1 a 5 sono cumulative; le ultime due sono alternative sul residuo del motore completo.
Il match esatto ne indovina il 34,6% e non ne sbaglia nessuno. Analisi e standardizzazione portano gli abbinamenti corretti al 48,8% ma quelli sbagliati al 20,8%. Il matching fuzzy delle vie porta i corretti al 64,5% e gli sbagliati al 25,0%. Alternative, alias e unità portano i corretti all'89,3% e gli sbagliati giù al 3,6%. Le decisioni attente ai costi, il motore completo, danno l'84,1% di corretti e lo 0,7% di sbagliati. Sul residuo di quel motore, un modello Ollama locale raggiunge il 90,0% di corretti con il 2,1% di sbagliati, e Jev raggiunge l'88,5% di corretti con lo 0,8% di sbagliati.
Quota di 3.000 indirizzi corrotti abbinati correttamente, abbinati in modo errato o mancati, per fase. Le ultime due righe sono alternative derivate dalla fase 5, non una sequenza.
Fase
Abbinamento corretto
Abbinamento sbagliato
Mancato
fase 1: Match esatto
34.6%
0.0%
65.4%
fase 2: Analisi e standardizzazione
48.8%
20.8%
30.4%
fase 3: Via fuzzy
64.5%
25.0%
10.5%
fase 4: Alternative e unità
89.3%
3.6%
7.1%
fase 5: Decisioni attente ai costi
84.1%
0.7%
15.2%
+ AI sul residuo: AI locale (Ollama)
90.0%
2.1%
7.8%
+ AI sul residuo: Jev (TypeSafe)
88.5%
0.8%
10.7%
Fonte: 3.000 indirizzi reali statunitensi di sei aree ZIP scelte a caso, estratti dal National Address Database e corrotti con la combinazione di errori misurata su dati reali, così la verità è nota esattamente. Numeri come pubblicati nella documentazione di PROC MATCHA.
Il matching fuzzy da solo è pericoloso. Con il matching fuzzy delle vie attivo e nulla sopra di esso, un indirizzo su quattro torna sbagliato, e nulla in un punteggio di similarità le dice quale.
Il livello delle alternative fa il grosso del lavoro. Alias ufficiali delle vie, grafie alternative, risoluzione di unità ed edifici portano gli abbinamenti corretti dal 64,5% all'89,3% e riducono quelli sbagliati dal 25,0% al 3,6%.
Il livello decisionale riduce le risposte sbagliate sotto l'1%. Assegnando un costo a un abbinamento sbagliato rispetto a uno mancato, il motore restituisce nessun abbinamento invece di uno sbagliato quando non è abbastanza sicuro: 0,7% di sbagliati, con i casi indecisi riportati, non scartati.
L'AI sul residuo porta gli abbinamenti corretti a circa il 90%. Un modello locale trova il maggior numero di abbinamenti e all'incirca triplica le risposte sbagliate; Jev aggiunge abbinamenti alla stessa precisione del motore, 0,8% di sbagliati.
Lo esegua sui suoi indirizzi
Matcha è incluso in ogni licenza Jenner. Acquisti Jenner, legga la documentazione di PROC MATCHA, oppure ci racconti il suo problema di matching e la aiuteremo a impostare una corsa di valutazione.
I modelli linguistici sono costosi per riga e lenti per riga. Matcha li usa come farebbe un buon analista: solo sui casi che richiedono giudizio.
Ollama con qwen2.5:7b-instruct, completamente offline
Eseguite un modello locale tramite Ollama sul vostro hardware, completamente offline, così nulla lascia la macchina. Misuriamo con qwen2.5:7b-instruct. I modelli locali sono gratuiti per riga e rispondono a quasi ogni domanda che vedono, il che trova il maggior numero di corrispondenze e raddoppia all'incirca le risposte sbagliate.
Jev, un modello System One di TypeSafe (typesafe.ai)
Invece di generare testo, Jev risponde a una domanda tipizzata, quale candidato, se ce n'è uno, è lo stesso luogo di questo indirizzo, e restituisce una scelta con una probabilità calibrata. Quando dice 0,9 ha ragione circa il 90% delle volte, e quando è incerto dice che nessuno dei candidati è adatto, invece di tirare a indovinare. È esattamente la forma di cui ha bisogno un matcher attento ai costi, ed è il motivo per cui Jev aggiunge abbinamenti alla stessa precisione del motore.
Nelle corse misurate la fascia di indecisione va dal 2% all'8% degli input, quindi un lavoro di 100.000 indirizzi produce qualche migliaio di chiamate al modello, non centomila.
Entrambi sono opzionali ed entrambi sono disattivati per impostazione predefinita. Il motore non ha bisogno di nessuno dei due, e un modello remoto può essere usato solo dopo aver impostato allow_remote nella configurazione.
Jev di typesafe.ai: modelli System One per i casi difficili
Jev è sviluppato da TypeSafe (typesafe.ai). Matcha lo chiama solo sul residuo che il motore non riesce a decidere.
Jev è il modello System One di TypeSafe. Invece di generare testo, risponde a una domanda tipizzata, quale candidato, se ce n'è uno, è lo stesso luogo di questo indirizzo, e restituisce una scelta, una probabilità calibrata e una confidenza. I modelli System One sono costruiti per decisioni di quella forma, non per la conversazione.
Quella forma è ciò di cui ha bisogno un matcher attento ai costi. Calibrato significa che quando Jev dice 0.9 ha ragione circa il 90% delle volte, così il motore può pesare la sua risposta contro il prezzo di una corrispondenza sbagliata, e quando Jev non è sicuro dice che nessuno dei candidati è adatto invece di tirare a indovinare.
Matcha usa Jev solo sul residuo, i casi che il motore non riesce a decidere da solo, quindi un lavoro di 100,000 indirizzi fa qualche migliaio di chiamate a Jev, non centomila. Mettete la chiave API di TypeSafe nell'ambiente, aggiungete adjudicate provider=jev; allo step PROC MATCHA e lasciate allow_remote disattivato finché non avete deciso che quei casi possono lasciare la vostra macchina.
Attivare Jev
export TYPESAFE_API_KEY=... # never in a file
adjudicate provider=jev; # inside the PROC MATCHA step
Misurato sul benchmark di indirizzi corrotti, Jev porta le corrispondenze corrette dall'83.3% all'87.8% alla precisione propria del motore del 98.1%, con lo 0.8% di risposte sbagliate nell'ablazione stadio per stadio. Sulle ricerche reali digitate dal pubblico ha risolto i casi difficili tanto spesso quanto il modello locale, e quando nessun candidato era quello giusto lo ha detto invece di sceglierne uno.
Dati di riferimento aperti, aggiornati solo quando lo decide lei
Il motore abbina rispetto alla tabella che gli fornisce, aiutato da pacchetti di conoscenza aperti: punti indirizzo statunitensi dal National Address Database, alias delle vie dal Census TIGER e indirizzi canadesi da Statistics Canada, tutti di pubblico dominio o con licenza aperta. Jenner Analytics ricostruisce i pacchetti quando le loro fonti pubblicano, li convalida rispetto alla release precedente, li firma e li pubblica su un canale dati.
Nulla sulla sua macchina cambia finché non esegue lei stesso l'aggiornamento. Ogni pacchetto viene verificato rispetto a un manifesto firmato prima che un solo byte venga estratto, e sostituito in modo atomico, così un lavoro in corso vede il vecchio pacchetto o il nuovo, mai uno parziale. PROC MATCHA non scarica mai nulla, e il report registra quale release dei dati ha usato una corsa.
Verifichi, poi aggiorni, secondo i suoi tempi
jenner data update --check # what would change; writes nothing
jenner data update # install or refresh every pack
jenner data update --pin 2026.9.28
Aree geografiche
Gli Stati Uniti sono l'impostazione predefinita e il Canada è supportato, comprese le forme bilingui. I pacchetti per Regno Unito, Francia, Giappone, Corea e Australia sono in lavorazione. Ciascuno è dati, non codice, quindi aggiungere un paese significa aggiungere un pacchetto.
Un solo motore di matching per KYC, AML, frodi, rischio di credito, consegne e compliance
Gli indirizzi sono disponibili oggi. Ogni altro matching della famiglia KYC gira sullo stesso motore: le stesse probabilità calibrate, le stesse decisioni pesate per costo, gli stessi output e la stessa corsa di valutazione.
Un nuovo tipo di matching è una definizione di entità, non un nuovo prodotto: i ruoli di un record, il comparatore per ciascun ruolo, la strategia di blocking e i pacchetti di conoscenza che può consultare. Il punteggio, le decisioni, la lista di follow-up e la valutazione sono codice condiviso, così un matching di nomi di persona viene valutato e prezzato esattamente come un matching di indirizzi.
Funzionalità sullo stesso motore
Da indirizzo IP a indirizzo postale: distanza di geolocalizzazione e segnali VPN
Matcha confronta il punto in cui viene geolocalizzato l'indirizzo IP di una sessione con l'indirizzo dichiarato dal cliente, usando la distanza geodetica con il raggio di geolocalizzazione come incertezza. I flag ASN, proxy e VPN contano come evidenze contrarie, mai come verdetto a sé. Il risultato è la stessa probabilità calibrata e la stessa decisione pesata per costo di un matching di indirizzi, così una regola antifrode può agire di conseguenza o inviarlo in review.
Esempio: Un richiedente di una carta fornisce un indirizzo di Denver da un IP geolocalizzato a 40 km di distanza senza flag VPN: concordanza entro il raggio. Lo stesso indirizzo da un IP di data center in un altro paese: conflitto, e la riga viene prezzata per la review.
Da email a persona e azienda: parte locale, dominio e segnali di indirizzi usa e getta
L'entità identità email verifica se un indirizzo appartiene alla persona e all'organizzazione dichiarate in fase di onboarding. La parte locale viene confrontata con i token del nome, inclusi nome.cognome, iniziali e soprannomi; il dominio viene confrontato con i domini registrati dell'organizzazione; le liste di domini free-mail e usa e getta e la presenza di record MX sono evidenze. Ogni segnale è un comparatore, e il motore dice quanto concordano.
Esempio:[email protected] rispetto a Jane Okafor di Northwind Actuarial: la parte locale concorda con il nome e il dominio concorda con l'azienda. [email protected] rispetto allo stesso record: dominio usa e getta, e la probabilità lo dice.
Matching di nomi di aziende: forme giuridiche, acronimi e identificativi di registro
L'entità azienda rimuove le forme giuridiche secondo ISO 20275, pesa le parole rare, espande gli acronimi e lascia che un identificativo di registro prevalga sul nome: LEI, EIN, UEI e numeri Companies House. I dati GLEIF Level 1 e i nomi precedenti EDGAR sono pacchetti di conoscenza, così un'azienda che ha cambiato nome trova comunque la controparte nei suoi registri. Validazione dei fornitori, matching delle controparti e KYB usano la stessa corsa.
Esempio: "INTL BUSINESS MACHINES CORP" rispetto a "International Business Machines Corporation" con LEI coincidente: match, prevalenza dell'identificativo di registro. "IBM Credit LLC" rispetto alla capogruppo: nonmatch, con le evidenze di forma giuridica e parole rare riportate.
Matching di nomi di persona: soprannomi, traslitterazione, fonetica e data di nascita
L'entità persona confronta nome, secondo nome e cognome con pacchetti di soprannomi, traslitterazione da cirillico, arabo e CJK, confronto fonetico e varianti nell'ordine dei nomi, e tratta una data di nascita trasposta o un documento d'identità nazionale con checksum valido come l'evidenza che sono. Una lista di sanzioni o PEP è una normale tabella di riferimento con il costo di un abbinamento mancato impostato alto, così screening e deduplicazione dei clienti sono lo stesso motore con prezzi diversi.
Esempio: "Mohammed Al-Rashid, 03/07/1981" rispetto a "Muhammad Alrashid, 07/03/1981": la traslitterazione concorda, la data è una trasposizione giorno-mese, e la riga torna come hit di screening con la sua probabilità anziché come hit mancato.
Numeri di telefono e identificativi: IBAN, VIN, NPI e documenti d'identità nazionali
I numeri di telefono vengono normalizzati in E.164 e verificati per coerenza di paese e prefisso e per tipo di operatore. Gli identificativi vengono validati prima di essere abbinati: checksum IBAN, VIN e NPI, coerenza di formato ed emittente, struttura dei documenti d'identità nazionali. Un identificativo valido è un'evidenza forte; uno non valido è un riscontro a sé, riportato prima che un solo candidato venga valutato.
Esempio: L'IBAN di un richiedente non supera il controllo mod-97: la riga viene segnalata prima del matching, con la motivazione, invece di essere valutata rispetto a ogni conto della tabella di riferimento.
Coordinate, nuclei familiari, controparti di transazioni e nomi di prodotti
Le entità si compongono. Una coordinata di dispositivo viene geocodificata al contrario fino al punto indirizzo più vicino; un nucleo familiare è un matching di indirizzi più la concordanza del cognome; una controparte di transazione è un'azienda o una persona più un conto e un paese; un nome di prodotto o di farmaco viene abbinato per contenimento di token con prevalenza del codice. Il codice di scoring non conosce la differenza, ed è per questo che ciascuna arriva sullo stesso motore con la stessa corsa di valutazione.
Esempio: Il fix GPS di un'app di consegne cade a 30 m dall'indirizzo dell'ordine: concordanza, con la distanza riportata. Due record cliente allo stesso indirizzo con cognome concordante: un solo nucleo familiare, con una probabilità calibrata sul collegamento.
Verifichi in un solo step l'indirizzo, l'email, il telefono e gli identificativi che un richiedente le fornisce, con una probabilità per ogni controllo e una domanda di follow-up quando qualcosa è ambiguo. Matcha risolve l'indirizzo mentre il richiedente è ancora sulla pagina e chiede "Milton or Morton?" invece di far fallire il controllo o lasciarlo passare.
Confronti la posizione IP della sessione con l'indirizzo dichiarato, la coordinata del dispositivo con l'indirizzo di consegna e l'email con la persona, e ottenga evidenze su cui una regola può agire anziché un punteggio opaco. Ogni candidato che il matcher ha considerato viene riportato, con la probabilità che la verità non sia affatto nella sua tabella.
Sottoponga a screening nomi di persone e di aziende rispetto a liste di sanzioni e PEP con traslitterazione, soprannomi, fonetica e trasposizioni della data di nascita, con costi tarati per lo screening: un hit mancato costa caro, un falso allarme costa poco. La lista è una tabella di riferimento, la corsa di valutazione misura il suo tasso di hit su casi noti, e la curva di calibrazione le dice cosa significa uno 0,9 sui suoi dati.
Rischio di credito e risoluzione delle controparti
Risolva le aziende presenti su una richiesta, un'operazione o un registro contabile in un'unica entità giuridica attraverso forme giuridiche, nomi precedenti e identificativi di registro, così l'esposizione viene contata una sola volta. LEI, EIN, UEI e numeri Companies House prevalgono sui nomi quando sono presenti e li corroborano quando non lo sono.
Standardizzi ogni indirizzo secondo le regole postali della sua area, lo abbini alla sua tabella di indirizzi serviti e scopra quando un indirizzo è reale ma fuori dalla sua area o reale ma assente dalla sua tabella. Una coordinata del dispositivo alla porta conferma il punto di consegna, e i pesi di costo decidono quando un indirizzo sbagliato è peggio di un ordine rifiutato.
Ogni decisione porta con sé una probabilità, una motivazione e i candidati considerati, in tabelle che restano a lei. Nulla lascia la sua macchina a meno che non scelga di aggiungere un modello, il report registra quale release dei dati ha usato una corsa, e la stessa corsa di valutazione riproduce un risultato per un auditor mesi dopo.
PROC MATCHA fa parte di Jenner, non è un prodotto separato né una tariffa per riga. Su Windows e Linux una licenza Jenner si acquista una volta per macchina ed è perpetua: la versione che acquista continua a funzionare per tutto il tempo che vuole usarla, con nuove release e supporto inclusi per un anno. Jenner per macOS è sul Mac App Store, e il Workspace è fatturato a ore.
Jenner Analytics non addebita nulla per una riga abbinata, un candidato considerato o una domanda posta. Se sceglie Jev, TypeSafe lo tariffa per token di input, e vede solo il residuo.
Jenner esegue il codice PROC DQMATCH e PROC DQSCHEME esistente per compatibilità, così un programma di data quality SAS continua a funzionare. Matcha è il matcher consigliato per i nuovi lavori: usa la stessa sintassi di istruzioni in stile SAS, ma restituisce una probabilità calibrata e una motivazione per ogni decisione, può porre una domanda di follow-up e legge e scrive CSV, Parquet, Avro e la maggior parte dei database attraverso la stessa sintassi data=, così non è vincolato a nessuno dei due strumenti.
No. Il motore è Rust nativo dentro il binario Jenner e non effettua chiamate di rete; i dati di riferimento sono la tabella che gli fornisce più i pacchetti di conoscenza installati sulla sua macchina. I modelli linguistici sono disattivati per impostazione predefinita. Un modello locale tramite Ollama mantiene tutto sul suo hardware. Un modello remoto come Jev viene usato solo se lo abilita nella configurazione, e in quel caso vede solo i casi indecisi con i loro candidati, mai l'intero file.
Gli Stati Uniti sono l'area predefinita, con standardizzazione secondo USPS Publication 28 e dati di indirizzo aperti dal National Address Database e dal Census TIGER. Il Canada è supportato, comprese le forme bilingui in francese e i codici postali canadesi, con dati di Statistics Canada. I pacchetti per Regno Unito, Francia, Giappone, Corea e Australia sono in lavorazione. Può abbinare rispetto alla sua tabella di riferimento in qualsiasi paese già oggi; i pacchetti aggiungono regole di standardizzazione e punti indirizzo aperti.
Sì. Il motore non ha bisogno di alcun servizio, chiave o rete. I pacchetti di riferimento si installano una volta con jenner data update e si aggiornano solo quando esegue di nuovo quel comando. Con un modello Ollama locale anche il passaggio opzionale di adjudication è offline; solo Jev è una chiamata remota, e solo se lo attiva.
Quando il motore non riesce a decidere tra i candidati e lei ha assegnato un costo a un canale di follow-up, quelle righe escono come review con i candidati ordinati, il campo esatto che risolverebbe la questione (suffisso, direzione, unità) e le probabilità. Il suo processo lo trasforma in una domanda a chi può rispondere: una risposta via SMS, una richiesta su un modulo di onboarding, una schermata di call center. Nessuno sul lato del matching legge quelle righe, e senza un canale con un costo assegnato vengono riportate come nonmatch con gli stessi candidati allegati.
Fornisca a una corsa un file di verità con input di cui conosce il record corretto e Matcha valuta ogni decisione rispetto a esso: corretti al primo tentativo, precisione, risposte sbagliate, recall tra i primi cinque candidati, astensioni corrette sugli input fuori area, una curva di calibrazione e il costo atteso per una gamma di pesi di errore. I risultati pubblicati in questa pagina provengono dalla stessa modalità di corsa, su ricerche pubbliche con esiti noti e su indirizzi corrotti con verità esatta.
Sì, sullo stesso motore. Gli indirizzi sono disponibili oggi. Nomi di persone, nomi di aziende, identità email, posizione IP, numeri di telefono, identificativi con checksum e liste di sanzioni o PEP sono entità che lo stesso motore abbina, con le stesse probabilità calibrate, decisioni pesate per costo, output e corsa di valutazione. Una lista di screening è una normale tabella di riferimento con il costo di un abbinamento mancato impostato alto. Usi il modulo in questa pagina per richiedere la disponibilità dell'entità di cui ha bisogno.
Matcha è incluso in Jenner, quindi acquista Jenner: una licenza perpetua per macchina per Windows e Linux, Jenner per macOS sul Mac App Store, oppure crediti Workspace a ore. Non c'è alcun addebito per riga o per abbinamento. La pagina dei prezzi riporta i piani attuali e la prova gratuita.
Sì. Una lista di sanzioni o PEP è una tabella di riferimento di persone o aziende, e lo screening è un matching con i costi invertiti: un hit mancato prezzato alto, un falso allarme prezzato basso. L'entità persona gestisce soprannomi, traslitterazione da cirillico, arabo e CJK, confronto fonetico, varianti nell'ordine dei nomi e trasposizioni della data di nascita, e la corsa di valutazione misura il suo tasso di hit su casi noti. Richieda la disponibilità dal modulo in questa pagina.
Sì. L'entità posizione IP geolocalizza l'indirizzo IP della sessione e lo confronta con le coordinate dell'indirizzo dichiarato per distanza geodetica, usando il raggio di geolocalizzazione come incertezza, e tratta i flag ASN, proxy e VPN come evidenze contrarie. Il risultato è la stessa probabilità calibrata e la stessa decisione di un matching di indirizzi, così una regola antifrode o una coda di review può usarlo direttamente.
Sì. L'entità azienda rimuove le forme giuridiche secondo ISO 20275, pesa le parole rare, espande gli acronimi e lascia che un identificativo di registro prevalga sul nome: LEI, EIN, UEI e numeri Companies House. I dati GLEIF e i nomi precedenti EDGAR sono pacchetti di conoscenza, così un'azienda che ha cambiato nome viene comunque risolta nella controparte nei suoi registri. Validazione dei fornitori, matching delle controparti e KYB in una sola corsa.
Jev è un modello System One realizzato da TypeSafe (typesafe.ai). Invece di generare testo, risponde a una domanda tipizzata, quale candidato, se ce n'è uno, è lo stesso luogo di questo indirizzo, con una scelta, una probabilità calibrata e una confidenza. Matcha lo usa perché quella è la forma di una decisione di matching: quando Jev dice 0.9 ha ragione circa il 90% delle volte, e quando non è sicuro dice che nessuno dei candidati è adatto. Viene chiamato solo sul residuo che il motore non riesce a decidere, qualche migliaio di chiamate ogni 100,000 righe, e sul benchmark di indirizzi corrotti porta le corrispondenze corrette dall'83.3% all'87.8% alla precisione propria del motore del 98.1%. È disattivato per impostazione predefinita e richiede una chiave API di TypeSafe nell'ambiente e adjudicate provider=jev; nello step.
Sì. Puntate Matcha a un modello locale servito da Ollama sul vostro hardware, completamente offline, e lo stesso step di adjudicazione gira senza che nulla lasci la macchina. Misuriamo con qwen2.5:7b-instruct. Un modello locale risponde a quasi ogni caso che vede, il che trova il maggior numero di corrispondenze, 89.3% corrette sul benchmark di indirizzi corrotti, e raddoppia all'incirca le risposte sbagliate rispetto a Jev. Potete anche eseguirli entrambi fianco a fianco e ottenere un flag agree per riga. Nessuno dei due è obbligatorio: il motore da solo non ha bisogno di modello, chiave o rete.
Lo provi sui suoi indirizzi
Esegua una valutazione su qualche centinaio di record di cui può garantire la correttezza, e ottenga un solo numero onesto su quanto è buono sui suoi dati.
Gli indirizzi sono disponibili oggi. Chieda una corsa di valutazione sui suoi dati, oppure richieda la disponibilità di una funzionalità sullo stesso motore, e le risponderemo con le date e con quanto serve per l'impostazione.
Veda Matcha con i suoi occhi
Acquisti Jenner ed esegua PROC MATCHA sui suoi indirizzi, legga la documentazione, oppure guardi l'introduzione a Jenner di tre minuti.