Matcha vincula direcciones desordenadas, mal escritas o tecleadas a medias con los registros a los que realmente se refieren, en su propia máquina, con una probabilidad calibrada y una razón para cada decisión. Nombres de personas, nombres de empresas, correo electrónico, ubicación IP e identificadores funcionan sobre el mismo motor. Para los casos difíciles, añada Jev (typesafe.ai) o un modelo Ollama local.
Incluido en Jenner. Sin servicio externo, sin clave API y sin que ningún dato salga de su red, salvo que decida añadir un modelo: Jev (typesafe.ai) o un modelo Ollama local.
Para quién es
Seis tareas en las que la dirección es la clave, y la clave nunca se teclea dos veces igual.
KYC e incorporación de clientes
Un solicitante teclea su dirección una vez, en un teléfono, con prisa. Matcha la resuelve contra su tabla de referencia mientras todavía está en la página y, cuando dos registros son igual de plausibles, señala el único campo que lo resolvería, para que el formulario pueda preguntar «Milton or Morton?» en lugar de hacer fallar la comprobación o darla por buena.
AML y filtrado de sanciones
El filtrado es cotejo con los costes invertidos: una coincidencia perdida es cara y una falsa alarma es barata. Matcha toma esos costes como entradas y mueve sus umbrales en consecuencia, de modo que el mismo motor que incorpora a un cliente puede filtrarlo. Las direcciones están disponibles hoy; el filtrado de nombres de personas y empresas contra listas de sanciones y PEP funciona sobre el mismo motor, con las mismas decisiones.
Detección de fraude
Matcha informa de cada candidato que consideró, con la evidencia por campo y la probabilidad de que la verdad no esté en la tabla en absoluto. Una regla de fraude puede trabajar con lo que el motor realmente examinó en lugar de con una sola puntuación, y la entidad de ubicación IP comprueba la ubicación de una sesión contra la dirección que el cliente declara.
Deduplicación para marketing y CRM
El mismo hogar aparece de diez maneras entre altas, pedidos e importaciones. Matcha coteja una tabla contra sí misma, escribe los grupos y mantiene una probabilidad calibrada en cada vínculo, para que una deduplicación sea tan estricta o tan permisiva como el envío que alimenta. La agrupación por hogar, por dirección y apellido, es una entidad compuesta sobre el mismo motor.
Reparto y logística
Una entrega equivocada cuesta un viaje de vuelta; un pedido rechazado cuesta la venta. Matcha estandariza cada dirección según las reglas postales de su región, la coteja con su tabla de direcciones con servicio y le dice cuándo una dirección es real pero está fuera de su zona, o es real pero falta en su tabla, para que la corrección vaya al lugar correcto.
Sector público y tecnología cívica
Un servicio municipal de consulta de parcelas permitía a los vecinos enviar una dirección por SMS y recibir su parcela. En los casos más difíciles, las faltas de ortografía y los errores de dictado que su cotejador anterior fallaba siempre, el motor de Matcha por sí solo respondió correctamente el 81 % al primer intento, y un modelo sobre el resto lo elevó al 91 %.
Cómo funciona
Rust nativo dentro del binario de Jenner. Un paso, una tabla de decisiones y una razón para cada una.
1
Analizar y estandarizar
Cada dirección se descompone en número, orientación, calle, sufijo, unidad, ciudad y código postal, y se normaliza según las reglas postales de su región (USPS Publication 28 para Estados Unidos, Canada Post para Canadá). Cuando el texto es ambiguo, el analizador conserva todas las lecturas y deja que la referencia decida.
2
Encontrar candidatos en su tabla
El motor construye un vocabulario de calles a partir de su propia tabla de referencia y ajusta a él la calle tecleada por ortografía, sonido y alias oficiales. Los candidatos se localizan por número, código postal y calle, así que un ZIP equivocado no es fatal.
3
Puntuar cada campo, calibrar el resultado
Número, calle, sufijo, orientación, unidad y código postal se comparan por separado, y la evidencia se combina en una probabilidad calibrada. Un sufijo ausente no cuesta nada cuando la referencia tiene una sola calle con ese nombre, y plantea una pregunta cuando tiene dos.
4
Decidir por coste
Usted indica lo que cuestan en su proceso una coincidencia errónea, una coincidencia perdida y una pregunta de seguimiento. El motor elige la decisión con el menor coste esperado, de modo que solo declara coincidencia cuando está lo bastante seguro para sus cifras y, cuando no lo está, devuelve ninguna coincidencia en lugar de una errónea.
5
Informar de todo lo que examinó
Una fila por entrada con la decisión, la probabilidad y la razón; una fila por candidato con la evidencia campo por campo; una tabla de métricas que dice por qué las entradas no coincidieron. Nada se descarta en silencio.
6
Enviar solo el resto a un modelo
Opcionalmente, los casos que el motor no puede resolver pasan a un modelo de lenguaje con sus candidatos, dentro del mismo paso. El modelo elige un candidato o dice que ninguno encaja; nunca reescribe la dirección.
Seis decisiones, cada una con una probabilidad asociada
match
Un candidato es el registro correcto con alta probabilidad. Úselo.
likely
El candidato más probable, informado con su probabilidad real cuando está por debajo del umbral de match. Nunca una elección al azar.
nonmatch
Ningún candidato plausible. Trátelo como no encontrado; los candidatos considerados se informan igualmente.
review
El motor no pudo decidir y su proceso puede preguntar. Se emite solo cuando ha puesto precio a un canal de seguimiento.
not_in_table
Una dirección real que su referencia no contiene. Corrija la referencia, no la entrada.
out_of_area
El código postal o la localidad quedan fuera del área de la referencia. Derívela a otro lugar.
La lista de seguimiento: hacer exactamente la pregunta correcta
La mayoría de los cotejadores mandan sus casos difíciles a una cola de revisión manual que nadie atiende. Cuando Matcha no puede decidir entre candidatos sabe por qué: la entrada decía 1200 Milton Street y la referencia tiene 1200 Milton St y 1200 Morton St, dos nombres de calle que se parecen a la vista y al oído. Es una pregunta con una respuesta de una palabra.
Así que, cuando pone precio a un canal de seguimiento, las filas sin decidir salen como review con los candidatos ordenados, el campo exacto que lo resolvería (ask about street, ask about unit) y las probabilidades que su proceso necesita para decidir si merece la pena hacer la pregunta. Un servicio de SMS responde «Milton or Morton?». Un formulario de incorporación muestra las dos direcciones. Una pantalla de centro de llamadas muestra al agente los candidatos en lugar de un espacio en blanco. Sin un canal con precio no hay decisión review: esas filas son nonmatch, con los mismos candidatos y la misma razón adjuntos.
Empiece con una ejecución de evaluación
Dé a Matcha un archivo de verdad, unos cientos de entradas cuyo registro correcto pueda garantizar, y una sola ejecución puntúa cada decisión contra él: acierto al primer intento, precisión de las coincidencias declaradas, respuestas erróneas, exhaustividad entre los cinco primeros candidatos, una curva de calibración y el coste esperado para cada ponderación de error, para que elija la suya a partir de la curva en lugar de adivinar.
Resultados medidos
Dos pruebas, una con lo que teclea el público y otra con direcciones corrompidas a propósito en seis áreas de Estados Unidos. Cifras tal como se publican en la documentación.
Consultas reales tecleadas por el público
Unas 2400 direcciones que los vecinos teclearon en un servicio municipal de consulta de parcelas, contra un registro de unas 378 000 parcelas, con la parcela correcta conocida por lo que ocurrió después. En los 223 casos más difíciles, faltas de ortografía reales, artefactos de dictado y sufijos ausentes, el cotejador anterior del ayuntamiento se equivocaba al primer intento todas las veces.
0 % a 81 %
casos difíciles cotejados correctamente al primer intento, solo el motor
91 %
con un modelo local o Jev sobre el resto
89 % a 97 %
concordancia en los casos fáciles, de solo el motor a motor más modelo
Direcciones corrompidas a propósito, en todo el país
3000 direcciones reales de seis áreas ZIP elegidas al azar, extraídas de la National Address Database y corrompidas con la mezcla de errores medida en datos reales: faltas de ortografía, orientaciones y sufijos omitidos, abreviaturas, tokens pegados y bailes de cifras. La verdad se conoce con exactitud, y cada entrada acaba como coincidencia o no coincidencia, sin apartar nada para una persona.
83,3 %
coincidencia correcta al primer intento, solo el motor
98,1 %
precisión de las coincidencias declaradas
1,6 %
respuestas erróneas, aproximadamente una de cada sesenta
87,8 % a 89,3 %
acierto al primer intento con Jev o un modelo local sobre el resto
Una puntuación de similitud por sí sola es peligrosa: con el cotejo difuso de calles activado y nada por encima, una de cada cuatro direcciones volvía equivocada. Las alternativas, los alias y la resolución de edificios hacen la mayor parte del trabajo, y la capa de decisión reduce después las respuestas erróneas del 3,6 % al 0,7 % devolviendo ninguna coincidencia en lugar de una errónea cuando no está lo bastante segura. Las ponderaciones de coste le permiten mover ese equilibrio en cualquiera de los dos sentidos.
Ganancia por etapa: lo que aporta cada capa
Las mismas 3000 direcciones corrompidas, cotejadas activando una capa cada vez. Las etapas 1 a 5 son acumulativas; las dos últimas son alternativas sobre el resto del motor completo.
La coincidencia exacta de cadenas acierta el 34,6 % y no falla ninguna. El análisis y la estandarización elevan los aciertos al 48,8 %, pero los errores al 20,8 %. El cotejo difuso de calles eleva los aciertos al 64,5 % y los errores al 25,0 %. Las alternativas, los alias y las unidades llevan los aciertos al 89,3 % y bajan los errores al 3,6 %. Las decisiones conscientes del coste, el motor completo, dan un 84,1 % de aciertos y un 0,7 % de errores. Sobre el resto de ese motor, un modelo Ollama local alcanza el 90,0 % de aciertos con un 2,1 % de errores, y Jev alcanza el 88,5 % de aciertos con un 0,8 % de errores.
Proporción de 3000 direcciones corrompidas cotejadas correctamente, cotejadas erróneamente o perdidas, por etapa. Las dos últimas filas son alternativas que parten de la etapa 5, no una secuencia.
Etapa
Coincidencia correcta
Coincidencia errónea
Perdida
etapa 1: Coincidencia exacta
34.6%
0.0%
65.4%
etapa 2: Análisis y estandarización
48.8%
20.8%
30.4%
etapa 3: Calle difusa
64.5%
25.0%
10.5%
etapa 4: Alternativas y unidades
89.3%
3.6%
7.1%
etapa 5: Decisiones conscientes del coste
84.1%
0.7%
15.2%
+ IA sobre el resto: IA local (Ollama)
90.0%
2.1%
7.8%
+ IA sobre el resto: Jev (TypeSafe)
88.5%
0.8%
10.7%
Fuente: 3000 direcciones reales de EE. UU. de seis áreas ZIP elegidas al azar, extraídas de la National Address Database y corrompidas con la mezcla de errores medida en datos reales, de modo que la verdad se conoce con exactitud. Cifras tal como se publican en la documentación de PROC MATCHA.
El cotejo difuso por sí solo es peligroso. Con el cotejo difuso de calles activado y nada por encima, una de cada cuatro direcciones vuelve equivocada, y nada en una puntuación de similitud le dice cuál.
La capa de alternativas hace el trabajo pesado. Los alias oficiales de calles, las grafías alternativas y la resolución de unidades y edificios llevan los aciertos del 64,5 % al 89,3 % y recortan los errores del 25,0 % al 3,6 %.
La capa de decisión reduce las respuestas erróneas por debajo del 1 %. Al poner precio a una coincidencia errónea frente a una perdida, el motor devuelve ninguna coincidencia en lugar de una errónea cuando no está lo bastante seguro: 0,7 % de errores, con los casos sin decidir informados, no descartados.
La IA sobre el resto eleva los aciertos hasta cerca del 90 %. Un modelo local encuentra más coincidencias y aproximadamente triplica las respuestas erróneas; Jev añade coincidencias con la precisión del propio motor, 0,8 % de errores.
Ejecútelo con sus propias direcciones
Matcha está incluido en cada licencia de Jenner. Compre Jenner, lea la documentación de PROC MATCHA o cuéntenos su problema de cotejo y le ayudaremos a preparar una ejecución de evaluación.
Los modelos de lenguaje son caros por fila y lentos por fila. Matcha los usa como lo haría un buen analista: solo en los casos que requieren criterio.
Ollama con qwen2.5:7b-instruct, totalmente sin conexión
Ejecute un modelo local a través de Ollama en su propio hardware, totalmente sin conexión, para que nada salga de la máquina. Medimos con qwen2.5:7b-instruct. Los modelos locales son gratuitos por fila y responden a casi todas las preguntas que se les muestran, lo que encuentra más coincidencias y aproximadamente duplica las respuestas erróneas.
Jev, un modelo System One de TypeSafe (typesafe.ai)
En lugar de generar texto, Jev responde a una pregunta tipada, qué candidato, si alguno, es el mismo lugar que esta dirección, y devuelve una elección con una probabilidad calibrada. Cuando dice 0,9 acierta en torno al 90 % de las veces, y cuando no está seguro dice que ninguno de los candidatos encaja, en lugar de adivinar. Es exactamente la forma que necesita un cotejador consciente de los costes, y por eso Jev añade coincidencias con la misma precisión que el motor.
En las ejecuciones medidas, la franja sin decidir es del 2 % al 8 % de las entradas, así que un trabajo de 100 000 direcciones hace unos pocos miles de llamadas al modelo, no cien mil.
Ambos son opcionales y ambos están desactivados por defecto. El motor no necesita ninguno, y un modelo remoto solo puede usarse una vez que establezca allow_remote en la configuración.
Jev de typesafe.ai: modelos System One para los casos difíciles
Jev lo desarrolla TypeSafe (typesafe.ai). Matcha solo lo llama sobre el residuo que el motor no puede resolver.
Jev es el modelo System One de TypeSafe. En lugar de generar texto, responde a una pregunta tipada, qué candidato, si alguno, es el mismo lugar que esta dirección, y devuelve una elección, una probabilidad calibrada y una confianza. Los modelos System One están hechos para decisiones de esa forma, no para conversar.
Esa forma es la que necesita un cotejador consciente del coste. Calibrado significa que cuando Jev dice 0.9 acierta alrededor del 90% de las veces, de modo que el motor puede sopesar su respuesta frente al precio de una coincidencia errónea, y cuando Jev no está seguro, dice que ninguno de los candidatos encaja en lugar de adivinar.
Matcha usa Jev solo sobre el residuo, los casos que el motor no puede resolver por sí solo, así que un trabajo de 100,000 direcciones hace unos pocos miles de llamadas a Jev, no cien mil. Ponga su clave API de TypeSafe en el entorno, añada adjudicate provider=jev; al paso PROC MATCHA y deje allow_remote desactivado hasta que haya decidido que esos casos pueden salir de su máquina.
Activar Jev
export TYPESAFE_API_KEY=... # never in a file
adjudicate provider=jev; # inside the PROC MATCHA step
Medido en el banco de direcciones corrompidas, Jev eleva las coincidencias correctas del 83.3% al 87.8% con la precisión propia del motor del 98.1%, con un 0.8% de respuestas erróneas en la ablación etapa por etapa. En las búsquedas reales tecleadas por el público resolvió los casos difíciles tan a menudo como el modelo local, y cuando ningún candidato era el correcto lo dijo en lugar de elegir uno.
Datos de referencia abiertos, actualizados solo cuando usted lo decide
El motor coteja contra la tabla que usted le da, con la ayuda de paquetes de conocimiento abiertos: puntos de dirección de Estados Unidos de la National Address Database, alias de calles de Census TIGER y direcciones canadienses de Statistics Canada, todos de dominio público o con licencia abierta. Jenner Analytics reconstruye los paquetes cuando sus fuentes publican, los valida contra la versión anterior, los firma y los publica en un canal de datos.
Nada cambia en su máquina hasta que usted mismo ejecuta la actualización. Cada paquete se verifica contra un manifiesto firmado antes de extraer un solo byte y se sustituye de forma atómica, de modo que un trabajo en ejecución ve el paquete antiguo o el nuevo, nunca uno parcial. PROC MATCHA nunca descarga nada, y el informe registra qué versión de datos usó una ejecución.
Comprobar y después actualizar, cuando usted decida
jenner data update --check # what would change; writes nothing
jenner data update # install or refresh every pack
jenner data update --pin 2026.9.28
Regiones
Estados Unidos es la región por defecto y Canadá está soportado, incluidas las formas bilingües. Los paquetes regionales para el Reino Unido, Francia, Japón, Corea y Australia están en desarrollo. Cada uno es datos, no código, así que añadir un país es añadir un paquete.
Un solo motor de cotejo para KYC, AML, fraude, riesgo de crédito, entregas y cumplimiento
Las direcciones están disponibles hoy. Todos los demás cotejos de la familia KYC funcionan sobre el mismo motor: las mismas probabilidades calibradas, las mismas decisiones ponderadas por coste, las mismas salidas y la misma ejecución de evaluación.
Un nuevo tipo de cotejo es una definición de entidad, no un producto nuevo: los roles que tiene un registro, el comparador de cada rol, la estrategia de bloqueo y los paquetes de conocimiento que puede consultar. La puntuación, las decisiones, la lista de seguimiento y la evaluación son código compartido, así que un cotejo de nombres de personas se evalúa y se tarifica exactamente igual que un cotejo de direcciones.
Capacidades sobre el mismo motor
Dirección IP a dirección postal: distancia de geolocalización y señales de VPN
Matcha compara dónde se geolocaliza la dirección IP de una sesión con la dirección que el cliente declara, usando la distancia geodésica con el radio de geolocalización como incertidumbre. Los indicadores de ASN, proxy y VPN cuentan como evidencia en contra, nunca como veredicto por sí solos. El resultado es la misma probabilidad calibrada y la misma decisión ponderada por coste que un cotejo de direcciones, de modo que una regla de fraude puede actuar sobre él o enviarlo a revisión.
Ejemplo: Un solicitante de tarjeta da una dirección de Denver desde una IP que se geolocaliza a 40 km, sin indicador de VPN: concuerda dentro del radio. La misma dirección desde una IP de centro de datos en otro país: conflicto, y la fila se tarifica para revisión.
Correo electrónico a persona y empresa: parte local, dominio y señales de correo desechable
La entidad de identidad de correo electrónico comprueba si una dirección pertenece a la persona y a la organización declaradas en la incorporación. La parte local se compara con los componentes del nombre, incluidos first.last, iniciales y apodos; el dominio se compara con los dominios registrados de la organización; las listas de correo gratuito y de dominios desechables y la presencia de MX son evidencia. Cada señal es un comparador, y el motor dice con qué fuerza concuerdan.
Ejemplo:[email protected] contra Jane Okafor en Northwind Actuarial: la parte local concuerda con el nombre y el dominio con la empresa. [email protected] contra el mismo registro: dominio desechable, y la probabilidad lo dice.
Cotejo de nombres de empresas: formas jurídicas, acrónimos e identificadores de registro
La entidad de empresa elimina las formas jurídicas según ISO 20275, pondera las palabras raras, expande los acrónimos y deja que un identificador de registro prevalezca sobre el nombre: LEI, EIN, UEI y números de Companies House. Los datos de nivel 1 de GLEIF y los nombres anteriores de EDGAR son paquetes de conocimiento, así que una empresa que cambió de nombre sigue coincidiendo con la contraparte de sus libros. La validación de proveedores, el cotejo de contrapartes y el KYB usan la misma ejecución.
Ejemplo: "INTL BUSINESS MACHINES CORP" contra "International Business Machines Corporation" con un LEI coincidente: match, prevalece el identificador de registro. "IBM Credit LLC" contra la matriz: nonmatch, con la evidencia de forma jurídica y palabras raras informada.
Cotejo de nombres de personas: apodos, transliteración, fonética y fecha de nacimiento
La entidad de persona compara nombres, segundos nombres y apellidos con paquetes de apodos, transliteración desde cirílico, árabe y CJK, comparación fonética y variantes de orden de nombres, y trata una fecha de nacimiento transpuesta o un identificador nacional con suma de comprobación válida como la evidencia que son. Una lista de sanciones o PEP es una tabla de referencia ordinaria con el coste de una coincidencia perdida fijado alto, así que el filtrado y la deduplicación de clientes son el mismo motor con precios distintos.
Ejemplo: "Mohammed Al-Rashid, 03/07/1981" contra "Muhammad Alrashid, 07/03/1981": la transliteración concuerda, la fecha es una transposición de día y mes, y la fila vuelve como coincidencia de filtrado con su probabilidad en lugar de como una perdida.
Números de teléfono e identificadores: IBAN, VIN, NPI e identificadores nacionales
Los números de teléfono se normalizan a E.164 y se comprueba la coherencia de país y prefijo y el tipo de operador. Los identificadores se validan antes de cotejarlos: sumas de comprobación de IBAN, VIN y NPI, coherencia de formato y emisor, formas de los identificadores nacionales. Un identificador válido es evidencia fuerte; uno inválido es un hallazgo por derecho propio, informado antes de puntuar un solo candidato.
Ejemplo: El IBAN de un solicitante no supera su comprobación mod-97: la fila se marca antes del cotejo, con la razón, en lugar de puntuarse contra cada cuenta de la tabla de referencia.
Coordenadas, hogares, contrapartes de transacciones y nombres de productos
Las entidades se componen. Una coordenada de dispositivo se geocodifica de forma inversa al punto de dirección más cercano; un hogar es un cotejo de direcciones más concordancia de apellido; una contraparte de transacción es una empresa o persona más una cuenta y un país; un nombre de producto o de medicamento se coteja por contención de tokens con prevalencia del código. El código de puntuación no conoce la diferencia, y por eso cada una llega sobre el mismo motor con la misma ejecución de evaluación.
Ejemplo: La posición GPS de una app de reparto cae a 30 m de la dirección del pedido: concuerda, con la distancia informada. Dos registros de cliente en una misma dirección con el apellido concordante: un solo hogar, con una probabilidad calibrada en el vínculo.
Verifique la dirección, el correo electrónico, el teléfono y los identificadores que le da un solicitante en un solo paso, con una probabilidad por comprobación y una pregunta de seguimiento cuando algo es ambiguo. Matcha resuelve la dirección mientras el solicitante todavía está en la página y pregunta «Milton or Morton?» en lugar de hacer fallar la comprobación o darla por buena.
Compare la ubicación IP de la sesión con la dirección declarada, la coordenada del dispositivo con la dirección de entrega y el correo electrónico con la persona, y obtenga evidencia sobre la que una regla puede actuar en lugar de una puntuación opaca. Se informa de cada candidato que el motor consideró, con la probabilidad de que la verdad no esté en su tabla en absoluto.
Filtre nombres de personas y empresas contra listas de sanciones y PEP con transliteración, apodos, fonética y transposiciones de fecha de nacimiento, tarificado para el filtrado: coincidencia perdida cara, falsa alarma barata. La lista es una tabla de referencia, la ejecución de evaluación puntúa su tasa de detección contra casos conocidos, y la curva de calibración le dice qué significa un 0,9 en sus datos.
Resuelva las empresas de una solicitud, una operación o un libro mayor en una sola entidad jurídica a través de formas jurídicas, nombres anteriores e identificadores de registro, para que la exposición se cuente una sola vez. LEI, EIN, UEI y los números de Companies House prevalecen sobre los nombres cuando están presentes y los corroboran cuando no lo están.
Estandarice cada dirección según las reglas postales de su región, cotéjela con su tabla de direcciones atendibles y sepa cuándo una dirección es real pero está fuera de su zona, o real pero falta en su tabla. Una coordenada del dispositivo en la puerta confirma el punto de entrega, y las ponderaciones de coste deciden cuándo una dirección errónea es peor que un pedido rechazado.
Cada decisión lleva una probabilidad, una razón y los candidatos considerados, en tablas que usted conserva. Nada sale de su máquina salvo que decida añadir un modelo, el informe registra qué versión de datos usó una ejecución, y la misma ejecución de evaluación reproduce un resultado para un auditor meses después.
PROC MATCHA forma parte de Jenner: no es un producto aparte ni una tarifa por fila. En Windows y Linux, una licencia de Jenner se compra una vez por máquina y es perpetua: la versión que compra sigue funcionando mientras quiera usarla, con nuevas versiones y soporte incluidos durante un año. Jenner para macOS está en la Mac App Store, y el Workspace se factura por horas.
Jenner Analytics no cobra nada por una fila cotejada, un candidato considerado o una pregunta formulada. Si elige Jev, TypeSafe lo cobra por token de entrada, y solo ve el resto.
Jenner ejecuta el código PROC DQMATCH y PROC DQSCHEME existente por compatibilidad, así que un programa de calidad de datos de SAS sigue funcionando. Matcha es el cotejador recomendado para el trabajo nuevo: usa la misma sintaxis de sentencias al estilo SAS, pero devuelve una probabilidad calibrada y una razón para cada decisión, puede hacer una pregunta de seguimiento, y lee y escribe CSV, Parquet, Avro y la mayoría de las bases de datos con la misma sintaxis data=, de modo que no queda atado a ninguna de las dos herramientas.
No. El motor es Rust nativo dentro del binario de Jenner y no hace llamadas de red; los datos de referencia son la tabla que usted le da más los paquetes de conocimiento instalados en su máquina. Los modelos de lenguaje están desactivados por defecto. Un modelo local a través de Ollama lo mantiene todo en su hardware. Un modelo remoto como Jev se usa solo si lo activa en la configuración, y entonces ve únicamente los casos sin decidir con sus candidatos, nunca el archivo completo.
Estados Unidos es la región por defecto, con estandarización según USPS Publication 28 y datos de direcciones abiertos de la National Address Database y Census TIGER. Canadá está soportado, incluidas las formas bilingües en francés y los códigos postales canadienses, con datos de Statistics Canada. Los paquetes regionales para el Reino Unido, Francia, Japón, Corea y Australia están en desarrollo. Hoy ya puede cotejar contra su propia tabla de referencia en cualquier país; los paquetes añaden reglas de estandarización y puntos de dirección abiertos.
Sí. El motor no necesita servicio, clave ni red. Los paquetes de referencia se instalan una vez con jenner data update y se renuevan solo cuando vuelve a ejecutar ese comando. Con un modelo local de Ollama, el paso opcional de adjudicación también funciona sin conexión; solo Jev es una llamada remota, y solo si lo activa.
Cuando el motor no puede decidir entre candidatos y usted ha puesto precio a un canal de seguimiento, esas filas salen como review con los candidatos ordenados, el campo exacto que resolvería la pregunta (sufijo, orientación, unidad) y las probabilidades. Su proceso lo convierte en una pregunta para quien pueda responderla: una respuesta por SMS, un aviso en un formulario de incorporación, una pantalla de centro de llamadas. Nadie del lado del cotejo lee esas filas, y sin un canal con precio se informan como nonmatch con los mismos candidatos adjuntos.
Dé a una ejecución un archivo de verdad con entradas cuyo registro correcto conoce y Matcha puntúa cada decisión contra él: acierto al primer intento, precisión, respuestas erróneas, exhaustividad entre los cinco primeros candidatos, abstenciones correctas en entradas fuera de área, una curva de calibración y el coste esperado en un rango de ponderaciones de error. Los resultados publicados en esta página proceden del mismo modo de ejecución, sobre consultas públicas con resultado conocido y sobre direcciones corrompidas con verdad exacta.
Sí, sobre el mismo motor. Las direcciones están disponibles hoy. Los nombres de personas, los nombres de empresas, la identidad de correo electrónico, la ubicación IP, los números de teléfono, los identificadores con suma de comprobación y las listas de sanciones o PEP son entidades que el mismo motor coteja, con las mismas probabilidades calibradas, decisiones ponderadas por coste, salidas y ejecución de evaluación. Una lista de filtrado es una tabla de referencia ordinaria con el coste de una coincidencia perdida fijado alto. Use el formulario de esta página para solicitar la disponibilidad de la entidad que necesita.
Matcha está incluido en Jenner, así que compra Jenner: una licencia perpetua por máquina para Windows y Linux, Jenner para macOS en la Mac App Store, o créditos de Workspace por horas. No hay cargo por fila ni por coincidencia. La página de precios tiene los planes actuales y la prueba gratuita.
Sí. Una lista de sanciones o PEP es una tabla de referencia de personas o empresas, y el filtrado es cotejo con los costes invertidos: una coincidencia perdida con precio alto, una falsa alarma con precio bajo. La entidad de persona maneja apodos, transliteración desde cirílico, árabe y CJK, comparación fonética, variantes de orden de nombres y transposiciones de fecha de nacimiento, y la ejecución de evaluación puntúa su tasa de detección contra casos conocidos. Solicite la disponibilidad desde el formulario de esta página.
Sí. La entidad de ubicación IP geolocaliza la dirección IP de la sesión y la compara con las coordenadas de la dirección declarada por distancia geodésica, usando el radio de geolocalización como incertidumbre, y trata los indicadores de ASN, proxy y VPN como evidencia en contra. El resultado es la misma probabilidad calibrada y la misma decisión que un cotejo de direcciones, de modo que una regla de fraude o una cola de revisión puede usarlo directamente.
Sí. La entidad de empresa elimina las formas jurídicas según ISO 20275, pondera las palabras raras, expande los acrónimos y deja que un identificador de registro prevalezca sobre el nombre: LEI, EIN, UEI y números de Companies House. Los datos de GLEIF y los nombres anteriores de EDGAR son paquetes de conocimiento, así que una empresa renombrada sigue resolviéndose a la contraparte de sus libros. Eso es validación de proveedores, cotejo de contrapartes y KYB en una sola ejecución.
Jev es un modelo System One creado por TypeSafe (typesafe.ai). En lugar de generar texto, responde a una pregunta tipada, qué candidato, si alguno, es el mismo lugar que esta dirección, con una elección, una probabilidad calibrada y una confianza. Matcha lo usa porque esa es la forma de una decisión de cotejo: cuando Jev dice 0.9 acierta alrededor del 90% de las veces, y cuando no está seguro, dice que ninguno de los candidatos encaja. Solo se llama sobre el residuo que el motor no puede resolver, unos pocos miles de llamadas por cada 100,000 filas, y en el banco de direcciones corrompidas eleva las coincidencias correctas del 83.3% al 87.8% con la precisión propia del motor del 98.1%. Está desactivado por defecto y necesita una clave API de TypeSafe en el entorno y adjudicate provider=jev; en el paso.
Sí. Apunte Matcha a un modelo local servido por Ollama en su propio hardware, totalmente sin conexión, y el mismo paso de adjudicación se ejecuta sin que nada salga de la máquina. Medimos con qwen2.5:7b-instruct. Un modelo local responde a casi todos los casos que se le muestran, lo que encuentra más coincidencias, un 89.3% de aciertos en el banco de direcciones corrompidas, y aproximadamente duplica las respuestas erróneas respecto a Jev. También puede ejecutar ambos en paralelo y obtener un indicador agree por fila. Ninguno es obligatorio: el motor por sí solo no necesita modelo, clave ni red.
Pruébelo con sus propias direcciones
Ejecute una evaluación contra unos cientos de registros que pueda garantizar y obtenga una cifra honesta de lo bien que funciona con sus datos.
Las direcciones están disponibles hoy. Pida una ejecución de evaluación con sus propios datos, o solicite la disponibilidad de una capacidad sobre el mismo motor, y le responderemos con fechas y lo que hace falta para ponerla en marcha.
Vea Matcha por sí mismo
Compre Jenner y ejecute PROC MATCHA con sus propias direcciones, lea la documentación o vea la introducción de tres minutos a Jenner.