PROC MATCHA

Rapprochez personnes et adresses

Matcha relie des adresses approximatives, mal orthographiées ou saisies à moitié aux enregistrements qu'elles désignent réellement, sur votre propre machine, avec une probabilité calibrée et une raison pour chaque décision. Noms de personnes, noms d'entreprises, e-mail, localisation IP et identifiants tournent sur le même moteur. Pour les cas difficiles, ajoutez Jev (typesafe.ai) ou un modèle Ollama local.

Inclus dans Jenner. Aucun service externe, aucune clé API, aucune donnée ne quitte votre réseau, sauf si vous choisissez d'ajouter un modèle : Jev (typesafe.ai) ou un modèle Ollama local.

Dessin à la plume et à l'encre d'un bol de matcha à la surface mousseuse, avec un fouet en bambou appuyé contre lui

À qui cela s'adresse

Six métiers où l'adresse est la clé, et où la clé n'est jamais saisie deux fois de la même façon.

KYC et entrée en relation

Un demandeur saisit son adresse une seule fois, sur un téléphone, pressé. Matcha la résout contre votre table de référence pendant qu'il est encore sur la page, et lorsque deux enregistrements sont aussi plausibles l'un que l'autre, il nomme le champ unique qui trancherait, pour que le formulaire puisse demander « Milton or Morton? » au lieu de faire échouer le contrôle ou de le laisser passer.

AML et filtrage des sanctions

Le filtrage, c'est du rapprochement avec les coûts inversés : un hit manqué coûte cher, une fausse alerte coûte peu. Matcha prend ces coûts en entrée et déplace ses seuils en conséquence, de sorte que le moteur qui fait entrer un client en relation peut aussi le filtrer. Les adresses sont disponibles aujourd'hui ; le filtrage des noms de personnes et d'entreprises contre les listes de sanctions et de PEP tourne sur le même moteur, avec les mêmes décisions.

Détection de la fraude

Matcha rapporte chaque candidat qu'il a examiné, avec les preuves champ par champ et la probabilité que la vérité ne figure pas du tout dans la table. Une règle de fraude peut s'appuyer sur ce que le moteur a réellement regardé plutôt que sur un score unique, et l'entité localisation IP confronte la position d'une session à l'adresse que le client déclare.

Dédoublonnage marketing et CRM

Le même foyer apparaît de dix façons entre inscriptions, commandes et imports. Matcha rapproche une table avec elle-même, écrit les grappes et conserve une probabilité calibrée sur chaque lien, pour qu'une déduplication soit aussi stricte ou aussi tolérante que le mailing qu'elle alimente. Le regroupement par foyer, sur adresse et nom de famille, est une entité composée sur le même moteur.

Livraison et logistique

Une mauvaise livraison coûte un aller-retour ; une commande refusée coûte la vente. Matcha normalise chaque adresse selon les règles postales de sa région, la rapproche de votre table d'adresses desservies, et vous dit quand une adresse est réelle mais hors de votre zone, ou réelle mais absente de votre table, pour que la correction aille au bon endroit.

Secteur public et civic tech

Un service municipal de recherche de parcelles permettait aux habitants d'envoyer une adresse par SMS et de recevoir leur parcelle en retour. Sur les cas les plus difficiles, les fautes d'orthographe et les erreurs de dictée que son ancien rapprocheur ratait à chaque fois, le moteur Matcha seul a répondu correctement à 81 % du premier coup, et un modèle sur le résidu a porté ce chiffre à 91 %.

Comment ça marche

Du Rust natif dans le binaire Jenner. Une étape, une table de décisions, et une raison pour chacune.

1

Analyser et normaliser

Chaque adresse est découpée en numéro, direction, rue, suffixe, unité, ville et code postal, puis normalisée selon les règles postales de sa région (USPS Publication 28 pour les États-Unis, Canada Post pour le Canada). Lorsque le texte est ambigu, l'analyseur conserve chaque lecture et laisse la référence trancher.

2

Trouver des candidats dans votre table

Le moteur construit un vocabulaire de rues à partir de votre propre table de référence et y rattache la rue saisie par l'orthographe, la sonorité et les alias officiels. Les candidats sont trouvés par numéro, code postal et rue, de sorte qu'un mauvais ZIP n'est pas fatal.

3

Noter chaque champ, calibrer le résultat

Numéro, rue, suffixe, direction, unité et code postal sont comparés séparément, et les indices se combinent en une probabilité calibrée. Un suffixe manquant ne coûte rien lorsque la référence n'a qu'une rue de ce nom, et soulève une question lorsqu'elle en a deux.

4

Décider selon le coût

Vous indiquez ce que coûtent, dans votre processus, une mauvaise correspondance, une correspondance manquée et une question de suivi. Le moteur choisit la décision au coût attendu le plus bas : il ne rapproche que lorsqu'il est assez sûr pour vos chiffres et, sinon, renvoie aucune correspondance plutôt qu'une mauvaise.

5

Rapporter tout ce qu'il a examiné

Une ligne par entrée avec la décision, la probabilité et la raison ; une ligne par candidat avec les indices champ par champ ; une table de métriques qui explique pourquoi des entrées n'ont pas été rapprochées. Rien n'est écarté en silence.

6

N'envoyer que le résidu à un modèle

En option, les cas que le moteur ne peut pas trancher sont transmis à un modèle de langage avec leurs candidats, dans la même étape. Le modèle choisit un candidat ou indique qu'aucun ne convient ; il ne réécrit jamais l'adresse.

Six décisions, chacune assortie d'une probabilité

matchUn candidat est le bon enregistrement avec une forte probabilité. Utilisez-le.
likelyLe candidat le plus probable, rapporté avec sa probabilité réelle lorsque celle-ci est sous le seuil de match. Jamais un choix au hasard.
nonmatchAucun candidat plausible. À traiter comme introuvable ; les candidats examinés sont tout de même rapportés.
reviewLe moteur n'a pas pu décider et votre processus peut poser la question. Émis uniquement lorsque vous avez donné un coût à un canal de suivi.
not_in_tableUne adresse réelle que votre référence ne contient pas. Corrigez la référence, pas l'entrée.
out_of_areaLe code postal ou la localité se situe hors de la zone de la référence. Orientez-la ailleurs.

La liste de suivi : poser exactement la bonne question

La plupart des rapprocheurs envoient leurs cas difficiles vers une file de revue manuelle que personne ne traite. Lorsque Matcha ne peut pas départager des candidats, il sait pourquoi : l'entrée disait 1200 Milton Street et la référence a un 1200 Milton St et un 1200 Morton St, deux noms de rue qui se ressemblent à l'œil comme à l'oreille. C'est une question dont la réponse tient en un mot.

Ainsi, lorsque vous donnez un coût à un canal de suivi, les lignes indécises ressortent en review avec les candidats classés, le champ exact qui trancherait (ask about street, ask about unit) et les probabilités dont votre processus a besoin pour décider si la question vaut la peine d'être posée. Un service SMS répond « Milton or Morton? ». Un formulaire d'entrée en relation affiche les deux adresses. Un écran de centre d'appels montre les candidats à l'agent au lieu d'un vide. Sans canal auquel un coût a été donné, il n'y a pas de décision review : ces lignes sont nonmatch, avec les mêmes candidats et la même raison attachés.

Commencez par une exécution d'évaluation

Donnez à Matcha un fichier de vérité, quelques centaines d'entrées dont vous pouvez garantir le bon enregistrement, et une seule exécution note chaque décision par rapport à lui : bonne réponse du premier coup, précision des correspondances établies, mauvaises réponses, rappel parmi les cinq premiers candidats, une courbe de calibration, et le coût attendu pour chaque pondération d'erreur afin que vous choisissiez la vôtre sur la courbe plutôt que de deviner.

Résultats mesurés

Deux tests, l'un sur des saisies du grand public et l'autre sur des adresses délibérément corrompues dans six zones des États-Unis. Chiffres tels que publiés dans la documentation.

Vraies recherches saisies par le public

Environ 2 400 adresses que des habitants ont saisies dans un service municipal de recherche de parcelles, contre un registre d'environ 378 000 parcelles, la bonne parcelle étant connue d'après ce qui s'est passé ensuite. Sur les 223 cas les plus difficiles, vraies fautes d'orthographe, artefacts de dictée et suffixes manquants, l'ancien rapprocheur de la ville se trompait du premier coup à chaque fois.

0 % à 81 %

cas difficiles rapprochés correctement du premier coup, moteur seul

91 %

avec un modèle local ou Jev sur le résidu

89 % à 97 %

accord sur les cas faciles, du moteur seul au moteur plus modèle

Adresses délibérément corrompues, à l'échelle nationale

3 000 adresses réelles issues de six zones ZIP choisies au hasard, tirées de la National Address Database et corrompues avec le mélange d'erreurs mesuré sur des données réelles : fautes d'orthographe, directions et suffixes omis, abréviations, jetons collés et chiffres inversés. La vérité est connue exactement, et chaque entrée finit en correspondance ou en non-correspondance, sans rien mettre de côté pour une personne.

83,3 %

bonne correspondance du premier coup, moteur seul

98,1 %

précision des correspondances établies

1,6 %

mauvaises réponses, environ une sur soixante

87,8 % à 89,3 %

bonne réponse du premier coup avec Jev ou un modèle local sur le résidu

Un score de similarité seul est dangereux : avec le rapprochement flou des rues activé et rien au-dessus, une adresse sur quatre revenait fausse. Les variantes, les alias et la résolution des bâtiments font l'essentiel du travail, et la couche de décision réduit ensuite les mauvaises réponses de 3,6 % à 0,7 % en renvoyant aucune correspondance plutôt qu'une mauvaise lorsqu'elle n'est pas assez sûre. Les pondérations de coût vous permettent de déplacer ce compromis dans un sens ou dans l'autre.

Gain par étape : ce que chaque couche apporte

Les mêmes 3 000 adresses corrompues, rapprochées en activant une couche à la fois. Les étapes 1 à 5 sont cumulatives ; les deux dernières sont des alternatives sur le résidu du moteur complet.

0%25%50%75%100%34.6%0.0%Correspondanceexacteétape 148.8%20.8%Analyse etstandardisationétape 264.5%25.0%Rue floueétape 389.3%3.6%Variantes etunitésétape 484.1%0.7%Décisionssensibles aux coûtsétape 590.0% IA locale (Ollama)2.1% IA locale (Ollama)88.5% Jev (TypeSafe)0.8% Jev (TypeSafe)+ IA sur lerésiduBonne correspondanceMauvaise correspondance

La correspondance exacte de chaînes obtient 34,6 % de bonnes réponses et aucune mauvaise. L'analyse et la standardisation portent les bonnes correspondances à 48,8 % mais les mauvaises à 20,8 %. Le rapprochement flou des rues porte les bonnes à 64,5 % et les mauvaises à 25,0 %. Les variantes, alias et unités montent les bonnes à 89,3 % et ramènent les mauvaises à 3,6 %. Les décisions sensibles aux coûts, le moteur complet, donnent 84,1 % de bonnes et 0,7 % de mauvaises. Sur le résidu de ce moteur, un modèle Ollama local atteint 90,0 % de bonnes avec 2,1 % de mauvaises, et Jev atteint 88,5 % de bonnes avec 0,8 % de mauvaises.

Part de 3 000 adresses corrompues correctement rapprochées, incorrectement rapprochées ou manquées, par étape. Les deux dernières lignes sont des alternatives issues de l'étape 5, pas une séquence.
ÉtapeBonne correspondanceMauvaise correspondanceManquée
étape 1: Correspondance exacte34.6%0.0%65.4%
étape 2: Analyse et standardisation48.8%20.8%30.4%
étape 3: Rue floue64.5%25.0%10.5%
étape 4: Variantes et unités89.3%3.6%7.1%
étape 5: Décisions sensibles aux coûts84.1%0.7%15.2%
+ IA sur le résidu: IA locale (Ollama)90.0%2.1%7.8%
+ IA sur le résidu: Jev (TypeSafe)88.5%0.8%10.7%

Source : 3 000 adresses américaines réelles issues de six zones ZIP choisies au hasard, tirées de la National Address Database et corrompues avec le mélange d'erreurs mesuré sur des données réelles, de sorte que la vérité est connue exactement. Chiffres tels que publiés dans la documentation de PROC MATCHA.

  • Le rapprochement flou seul est dangereux. Avec le rapprochement flou des rues activé et rien au-dessus, une adresse sur quatre revient fausse, et rien dans un score de similarité ne vous dit laquelle.
  • La couche des variantes fait le gros du travail. Alias officiels de rues, orthographes alternatives, résolution des unités et des bâtiments portent les bonnes correspondances de 64,5 % à 89,3 % et réduisent les mauvaises de 25,0 % à 3,6 %.
  • La couche de décision ramène les mauvaises réponses sous 1 %. En donnant un prix à une mauvaise correspondance face à une correspondance manquée, le moteur renvoie aucune correspondance plutôt qu'une mauvaise lorsqu'il n'est pas assez sûr : 0,7 % de mauvaises, avec les cas indécis rapportés, pas écartés.
  • L'IA sur le résidu porte les bonnes correspondances à environ 90 %. Un modèle local trouve le plus de correspondances et triple à peu près les mauvaises réponses ; Jev ajoute des correspondances à la précision du moteur lui-même, 0,8 % de mauvaises.

Exécutez-le sur vos propres adresses

Matcha est inclus dans chaque licence Jenner. Achetez Jenner, lisez la documentation de PROC MATCHA, ou parlez-nous de votre problème de rapprochement et nous vous aiderons à mettre en place une exécution d'évaluation.

Feuille de thé

Apportez votre propre modèle

Les modèles de langage coûtent cher par ligne et sont lents par ligne. Matcha les utilise comme le ferait un bon analyste : uniquement sur les cas qui demandent du jugement.

Ollama avec qwen2.5:7b-instruct, entièrement hors ligne

Exécutez un modèle local via Ollama sur votre propre matériel, entièrement hors ligne, pour que rien ne quitte la machine. Nos mesures utilisent qwen2.5:7b-instruct. Les modèles locaux sont gratuits par ligne et répondent à presque toutes les questions qu'on leur pose, ce qui trouve le plus de correspondances et double à peu près les mauvaises réponses.

Jev, un modèle System One de TypeSafe (typesafe.ai)

Au lieu de générer du texte, Jev répond à une question typée, quel candidat, s'il y en a un, est le même lieu que cette adresse, et renvoie un choix avec une probabilité calibrée. Quand il dit 0,9, il a raison environ 90 % du temps, et quand il n'est pas sûr, il indique qu'aucun des candidats ne convient, au lieu de deviner. C'est exactement la forme dont a besoin un rapprocheur attentif aux coûts, et c'est pourquoi Jev ajoute des correspondances avec la précision du moteur lui-même.

Comment Matcha utilise Jev →

Dans les exécutions mesurées, la bande indécise représente 2 % à 8 % des entrées : un traitement de 100 000 adresses génère donc quelques milliers d'appels au modèle, pas cent mille.

Les deux sont facultatifs et désactivés par défaut. Le moteur n'a besoin ni de l'un ni de l'autre, et un modèle distant ne peut être utilisé qu'une fois allow_remote défini dans la configuration.

Fouet à thé en bambou

Jev de typesafe.ai : des modèles System One pour les cas difficiles

Jev est conçu par TypeSafe (typesafe.ai). Matcha ne l'appelle que sur le résidu que le moteur ne parvient pas à trancher.

Jev est le modèle System One de TypeSafe. Au lieu de générer du texte, il répond à une question typée, quel candidat, s'il y en a un, désigne le même lieu que cette adresse, et renvoie un choix, une probabilité calibrée et une confiance. Les modèles System One sont conçus pour des décisions de cette forme, pas pour la conversation.

C'est exactement la forme dont un rapprocheur sensible aux coûts a besoin. Calibré signifie que lorsque Jev dit 0.9, il a raison environ 90% du temps, ce qui permet au moteur de peser sa réponse contre le prix d'une mauvaise correspondance, et lorsque Jev n'est pas sûr, il indique qu'aucun des candidats ne convient au lieu de deviner.

Matcha n'utilise Jev que sur le résidu, les cas que le moteur ne peut pas trancher seul, si bien qu'un traitement de 100,000 adresses fait quelques milliers d'appels à Jev, pas cent mille. Placez votre clé API TypeSafe dans l'environnement, ajoutez adjudicate provider=jev; à l'étape PROC MATCHA et laissez allow_remote désactivé tant que vous n'avez pas décidé que ces cas peuvent quitter votre machine.

Activer Jev
export TYPESAFE_API_KEY=...       # never in a file
adjudicate provider=jev;          # inside the PROC MATCHA step

Mesuré sur le banc d'adresses corrompues, Jev fait passer les correspondances correctes de 83.3% à 87.8% à la précision propre du moteur de 98.1%, avec 0.8% de mauvaises réponses dans l'ablation étape par étape. Sur les recherches réelles saisies par le public, il a résolu les cas difficiles aussi souvent que le modèle local, et quand aucun candidat n'était le bon, il l'a dit au lieu d'en choisir un.

Lisez le billet de typesafe.ai : Introducing System One models and Jev

Feuille de thé

Des données de référence ouvertes, mises à jour seulement quand vous le décidez

Le moteur rapproche contre la table que vous lui donnez, aidé par des paquets de connaissances ouverts : points d'adresse américains issus de la National Address Database, alias de rues issus de Census TIGER, et adresses canadiennes de Statistics Canada, tous dans le domaine public ou sous licence ouverte. Jenner Analytics reconstruit les paquets lorsque leurs sources publient, les valide par rapport à la version précédente, les signe et les publie sur un canal de données.

Rien ne change sur votre machine tant que vous n'exécutez pas la mise à jour vous-même. Chaque paquet est vérifié par rapport à un manifeste signé avant qu'un seul octet ne soit extrait, puis remplacé de façon atomique, de sorte qu'un traitement en cours voit l'ancien paquet ou le nouveau, jamais un paquet partiel. PROC MATCHA ne télécharge jamais rien, et le rapport consigne la version des données utilisée par une exécution.

Vérifier, puis mettre à jour, à votre rythme
jenner data update --check   # what would change; writes nothing
jenner data update           # install or refresh every pack
jenner data update --pin 2026.9.28

Régions

Les États-Unis sont la région par défaut et le Canada est pris en charge, y compris les formes bilingues. Les paquets régionaux pour le Royaume-Uni, la France, le Japon, la Corée et l'Australie sont en cours. Chacun est constitué de données, pas de code, de sorte qu'ajouter un pays revient à ajouter un paquet.

Un seul moteur de rapprochement pour KYC, AML, fraude, risque de crédit, livraison et conformité

Les adresses sont disponibles aujourd'hui. Chaque autre rapprochement de la famille KYC tourne sur le même moteur : les mêmes probabilités calibrées, les mêmes décisions pondérées par les coûts, les mêmes sorties et la même exécution d'évaluation.

Un nouveau type de rapprochement est une définition d'entité, pas un nouveau produit : les rôles d'un enregistrement, le comparateur de chaque rôle, la stratégie de blocage et les paquets de connaissances qu'il peut consulter. Le scoring, les décisions, la liste de suivi et l'évaluation sont du code partagé, si bien qu'un rapprochement de noms de personnes est évalué et tarifé exactement comme un rapprochement d'adresses.

Capacités sur le même moteur

Adresse IP vers adresse postale : distance de géolocalisation et signaux VPN

Matcha compare l'endroit où l'adresse IP d'une session se géolocalise avec l'adresse que le client déclare, par distance géodésique, en prenant le rayon de géolocalisation comme incertitude. Les indicateurs ASN, proxy et VPN comptent comme preuves à charge, jamais comme verdict à eux seuls. Le résultat est la même probabilité calibrée et la même décision pondérée par les coûts qu'un rapprochement d'adresses, pour qu'une règle de fraude puisse agir dessus ou l'envoyer en revue.

Exemple: Un demandeur de carte donne une adresse à Denver depuis une IP géolocalisée à 40 km, sans indicateur VPN : accord dans le rayon. La même adresse depuis une IP de centre de données dans un autre pays : conflit, et la ligne est tarifée pour revue.

Demander la disponibilité

E-mail vers personne et entreprise : partie locale, domaine et signaux jetables

L'entité identité e-mail teste si une adresse appartient bien à la personne et à l'organisation déclarées lors de l'entrée en relation. La partie locale est comparée aux composantes du nom, first.last, initiales et surnoms compris ; le domaine est comparé aux domaines enregistrés de l'organisation ; les listes de messageries gratuites et de domaines jetables et la présence d'un MX sont des preuves. Chaque signal est un comparateur, et le moteur dit à quel point ils concordent.

Exemple: [email protected] contre Jane Okafor chez Northwind Actuarial : la partie locale concorde avec le nom et le domaine avec l'entreprise. [email protected] contre le même enregistrement : domaine jetable, et la probabilité le dit.

Demander la disponibilité

Rapprochement de noms d'entreprises : formes juridiques, acronymes et identifiants de registre

L'entité entreprise retire les formes juridiques selon ISO 20275, pondère les mots rares, développe les acronymes et laisse un identifiant de registre primer sur le nom : LEI, EIN, UEI et numéros Companies House. Les données GLEIF de niveau 1 et les anciens noms d'EDGAR sont des paquets de connaissances, si bien qu'une société qui a changé de nom correspond toujours à la contrepartie dans vos livres. Validation des fournisseurs, rapprochement des contreparties et KYB utilisent la même exécution.

Exemple: "INTL BUSINESS MACHINES CORP" contre "International Business Machines Corporation" avec un LEI concordant : match, l'identifiant de registre prime. "IBM Credit LLC" contre la maison mère : nonmatch, avec les preuves de forme juridique et de mots rares rapportées.

Demander la disponibilité

Rapprochement de noms de personnes : surnoms, translittération, phonétique et date de naissance

L'entité personne compare prénoms, deuxièmes prénoms et noms de famille avec des paquets de surnoms, la translittération depuis le cyrillique, l'arabe et les écritures CJK, la comparaison phonétique et les variantes d'ordre des noms, et traite une date de naissance transposée ou un identifiant national à somme de contrôle valide comme la preuve qu'ils sont. Une liste de sanctions ou de PEP est une table de référence ordinaire dont le coût d'une correspondance manquée est fixé haut, de sorte que le filtrage et la déduplication de clients sont le même moteur avec des prix différents.

Exemple: "Mohammed Al-Rashid, 03/07/1981" contre "Muhammad Alrashid, 07/03/1981" : la translittération concorde, la date est une transposition jour-mois, et la ligne revient comme un hit de filtrage avec sa probabilité plutôt que comme un hit manqué.

Demander la disponibilité

Numéros de téléphone et identifiants : IBAN, VIN, NPI et identifiants nationaux

Les numéros de téléphone sont normalisés en E.164 et vérifiés pour la cohérence du pays et de l'indicatif et le type d'opérateur. Les identifiants sont validés avant d'être rapprochés : sommes de contrôle IBAN, VIN et NPI, cohérence du format et de l'émetteur, formes des identifiants nationaux. Un identifiant valide est une preuve forte ; un identifiant invalide est un constat à part entière, rapporté avant qu'un seul candidat ne soit noté.

Exemple: L'IBAN d'un demandeur échoue à son contrôle mod-97 : la ligne est signalée avant le rapprochement, avec la raison, au lieu d'être notée contre chaque compte de la table de référence.

Demander la disponibilité

Coordonnées, foyers, contreparties de transaction et noms de produits

Les entités se composent. Une coordonnée d'appareil est géocodée en sens inverse vers le point d'adresse le plus proche ; un foyer est un rapprochement d'adresses plus un accord sur le nom de famille ; une contrepartie de transaction est une entreprise ou une personne plus un compte et un pays ; un nom de produit ou de médicament se rapproche par inclusion de jetons avec primauté du code. Le code de scoring ne fait pas la différence, et c'est pourquoi chacune arrive sur le même moteur avec la même exécution d'évaluation.

Exemple: Le relevé GPS d'une application de livraison tombe à 30 m de l'adresse de la commande : accord, avec la distance rapportée. Deux fiches clients à une même adresse avec le nom de famille concordant : un seul foyer, avec une probabilité calibrée sur le lien.

Demander la disponibilité

Conçu pour les équipes qui portent le risque

Entrée en relation KYC et vérification d'identité

Vérifiez l'adresse, l'e-mail, le téléphone et les identifiants qu'un demandeur vous donne en une seule étape, avec une probabilité par contrôle et une question de suivi quand quelque chose est ambigu. Matcha résout l'adresse pendant que le demandeur est encore sur la page et demande « Milton or Morton? » au lieu de faire échouer le contrôle ou de le laisser passer.

Demander la disponibilité →

Détection de fraude et risque de session

Comparez la localisation IP de la session avec l'adresse déclarée, la coordonnée de l'appareil avec l'adresse de livraison et l'e-mail avec la personne, et obtenez des preuves sur lesquelles une règle peut agir plutôt qu'un score opaque. Chaque candidat examiné par le moteur est rapporté, avec la probabilité que la vérité ne figure pas du tout dans votre table.

Demander la disponibilité →

AML et filtrage des sanctions

Filtrez les noms de personnes et d'entreprises contre les listes de sanctions et de PEP avec translittération, surnoms, phonétique et transpositions de date de naissance, tarifés pour le filtrage : hit manqué cher, fausse alerte bon marché. La liste est une table de référence, l'exécution d'évaluation note votre taux de détection contre des cas connus, et la courbe de calibration vous dit ce qu'un 0,9 signifie sur vos données.

Demander la disponibilité →

Risque de crédit et résolution des contreparties

Résolvez les entreprises d'une demande, d'une transaction ou d'un grand livre en une seule entité juridique à travers formes juridiques, anciens noms et identifiants de registre, pour que l'exposition soit comptée une seule fois. LEI, EIN, UEI et numéros Companies House priment sur les noms quand ils sont présents et les corroborent quand ils ne le sont pas.

Demander la disponibilité →

Livraison, logistique et validation d'adresses

Standardisez chaque adresse selon les règles postales de sa locale, rapprochez-la de votre table d'adresses desservables, et sachez quand une adresse est réelle mais hors de votre zone ou réelle mais absente de votre table. Une coordonnée d'appareil à la porte confirme le point de livraison, et les pondérations de coût décident quand une mauvaise adresse est pire qu'une commande refusée.

Demander la disponibilité →

Conformité, audit et gouvernance des données

Chaque décision porte une probabilité, une raison et les candidats examinés, dans des tables que vous conservez. Rien ne quitte votre machine sauf si vous choisissez d'ajouter un modèle, le rapport enregistre quelle version des données une exécution a utilisée, et la même exécution d'évaluation reproduit un résultat pour un auditeur des mois plus tard.

Demander la disponibilité →

Inclus dans Jenner

PROC MATCHA fait partie de Jenner ; ce n'est ni un produit séparé ni une facturation à la ligne. Sous Windows et Linux, une licence Jenner s'achète une fois par machine et est perpétuelle : la version que vous achetez continue de fonctionner aussi longtemps que vous voulez l'utiliser, avec les nouvelles versions et le support inclus pendant un an. Jenner pour macOS est sur le Mac App Store, et le Workspace est facturé à l'heure.

Jenner Analytics ne facture rien pour une ligne rapprochée, un candidat examiné ou une question posée. Si vous choisissez Jev, TypeSafe le facture au jeton d'entrée, et il ne voit que le résidu.

Acheter Jenner

Voir les tarifs

Questions fréquentes

Jenner exécute le code PROC DQMATCH et PROC DQSCHEME existant pour la compatibilité, de sorte qu'un programme de qualité des données SAS continue de fonctionner. Matcha est le rapprocheur recommandé pour les nouveaux travaux : il utilise la même syntaxe d'instructions de style SAS, mais renvoie une probabilité calibrée et une raison pour chaque décision, peut poser une question de suivi, et lit et écrit CSV, Parquet, Avro et la plupart des bases de données via la même syntaxe data=, de sorte que vous n'êtes enfermé dans aucun des deux outils.

Non. Le moteur est du Rust natif dans le binaire Jenner et ne fait aucun appel réseau ; les données de référence sont la table que vous lui donnez plus les paquets de connaissances installés sur votre machine. Les modèles de langage sont désactivés par défaut. Un modèle local via Ollama garde tout sur votre matériel. Un modèle distant tel que Jev n'est utilisé que si vous l'activez dans la configuration, et il ne voit alors que les cas indécis avec leurs candidats, jamais le fichier entier.

Les États-Unis sont la région par défaut, avec une normalisation selon USPS Publication 28 et des données d'adresses ouvertes issues de la National Address Database et de Census TIGER. Le Canada est pris en charge, y compris les formes bilingues en français et les codes postaux canadiens, avec les données de Statistics Canada. Les paquets régionaux pour le Royaume-Uni, la France, le Japon, la Corée et l'Australie sont en cours. Vous pouvez dès aujourd'hui rapprocher contre votre propre table de référence dans n'importe quel pays ; les paquets ajoutent des règles de normalisation et des points d'adresse ouverts.

Oui. Le moteur n'a besoin d'aucun service, d'aucune clé et d'aucun réseau. Les paquets de référence s'installent une fois avec jenner data update et ne sont rafraîchis que lorsque vous relancez cette commande. Avec un modèle Ollama local, l'étape d'arbitrage facultative est elle aussi hors ligne ; seul Jev est un appel distant, et seulement si vous l'activez.

Lorsque le moteur ne peut pas départager des candidats et que vous avez donné un coût à un canal de suivi, ces lignes ressortent en review avec les candidats classés, le champ exact qui trancherait la question (suffixe, direction, unité) et les probabilités. Votre processus en fait une question à qui peut y répondre : une réponse par SMS, une invite sur un formulaire d'entrée en relation, un écran de centre d'appels. Personne du côté du rapprochement ne lit ces lignes, et sans canal auquel un coût a été donné, elles sont rapportées en nonmatch avec les mêmes candidats attachés.

Donnez à une exécution un fichier de vérité contenant des entrées dont vous connaissez le bon enregistrement, et Matcha note chaque décision par rapport à lui : bonne réponse du premier coup, précision, mauvaises réponses, rappel parmi les cinq premiers candidats, abstentions correctes sur les entrées hors zone, une courbe de calibration, et le coût attendu pour une gamme de pondérations d'erreur. Les résultats publiés sur cette page proviennent du même mode d'exécution, sur des recherches publiques à l'issue connue et sur des adresses corrompues à la vérité exacte.

Oui, sur le même moteur. Les adresses sont disponibles aujourd'hui. Les noms de personnes, les noms d'entreprises, l'identité e-mail, la localisation IP, les numéros de téléphone, les identifiants à somme de contrôle et les listes de sanctions ou de PEP sont des entités que le même moteur rapproche, avec les mêmes probabilités calibrées, les mêmes décisions pondérées par les coûts, les mêmes sorties et la même exécution d'évaluation. Une liste de filtrage est une table de référence ordinaire dont le coût d'une correspondance manquée est fixé haut. Utilisez le formulaire de cette page pour demander la disponibilité de l'entité dont vous avez besoin.

Matcha est inclus dans Jenner, vous achetez donc Jenner : une licence perpétuelle par machine pour Windows et Linux, Jenner pour macOS sur le Mac App Store, ou des crédits Workspace à l'heure. Il n'y a aucune facturation à la ligne ni à la correspondance. La page des tarifs présente les offres actuelles et l'essai gratuit.

Oui. Une liste de sanctions ou de PEP est une table de référence de personnes ou d'entreprises, et le filtrage est du rapprochement avec les coûts inversés : un hit manqué tarifé haut, une fausse alerte tarifée bas. L'entité personne gère les surnoms, la translittération depuis le cyrillique, l'arabe et les écritures CJK, la comparaison phonétique, les variantes d'ordre des noms et les transpositions de date de naissance, et l'exécution d'évaluation note votre taux de détection contre des cas connus. Demandez la disponibilité depuis le formulaire de cette page.

Oui. L'entité localisation IP géolocalise l'adresse IP de la session et la compare aux coordonnées de l'adresse déclarée par distance géodésique, en prenant le rayon de géolocalisation comme incertitude, et traite les indicateurs ASN, proxy et VPN comme des preuves à charge. Le résultat est la même probabilité calibrée et la même décision qu'un rapprochement d'adresses, pour qu'une règle de fraude ou une file de revue puisse l'utiliser directement.

Oui. L'entité entreprise retire les formes juridiques selon ISO 20275, pondère les mots rares, développe les acronymes et laisse un identifiant de registre primer sur le nom : LEI, EIN, UEI et numéros Companies House. Les données GLEIF et les anciens noms d'EDGAR sont des paquets de connaissances, si bien qu'une société renommée se résout toujours vers la contrepartie dans vos livres. C'est la validation des fournisseurs, le rapprochement des contreparties et le KYB en une seule exécution.

Jev est un modèle System One conçu par TypeSafe (typesafe.ai). Plutôt que de générer du texte, il répond à une question typée, quel candidat, s'il y en a un, désigne le même lieu que cette adresse, avec un choix, une probabilité calibrée et une confiance. Matcha l'utilise parce que c'est la forme d'une décision de rapprochement : lorsque Jev dit 0.9, il a raison environ 90% du temps, et lorsqu'il n'est pas sûr, il indique qu'aucun des candidats ne convient. Il n'est appelé que sur le résidu que le moteur ne peut pas trancher, quelques milliers d'appels pour 100,000 lignes, et sur le banc d'adresses corrompues il fait passer les correspondances correctes de 83.3% à 87.8% à la précision propre du moteur de 98.1%. Il est désactivé par défaut et nécessite une clé API TypeSafe dans l'environnement et adjudicate provider=jev; dans l'étape.

Oui. Dirigez Matcha vers un modèle local servi par Ollama sur votre propre matériel, entièrement hors ligne, et la même étape d'adjudication s'exécute sans que rien ne quitte la machine. Nos mesures utilisent qwen2.5:7b-instruct. Un modèle local répond à presque tous les cas qu'on lui montre, ce qui trouve le plus de correspondances, 89.3% de résultats corrects sur le banc d'adresses corrompues, et double à peu près les mauvaises réponses par rapport à Jev. Vous pouvez aussi exécuter les deux côte à côte et obtenir un indicateur agree par ligne. Aucun des deux n'est requis : le moteur seul n'a besoin ni de modèle, ni de clé, ni de réseau.

Essayez-le sur vos propres adresses

Lancez une évaluation sur quelques centaines d'enregistrements dont vous pouvez répondre, et obtenez un chiffre honnête de sa qualité sur vos données.

Applications

Parlez-nous de votre problème de rapprochement

Les adresses sont disponibles aujourd'hui. Demandez une exécution d'évaluation sur vos propres données, ou la disponibilité d'une capacité sur le même moteur, et nous vous répondrons avec des dates et ce qu'il faut pour la mettre en place.

Voyez Matcha par vous-même

Achetez Jenner et exécutez PROC MATCHA sur vos propres adresses, lisez la documentation, ou regardez l'introduction de trois minutes à Jenner.

Regarder la présentation de 3 minutes