O Matcha liga moradas confusas, mal escritas ou digitadas pela metade aos registos a que realmente se referem, na sua máquina, com uma probabilidade calibrada e uma razão para cada decisão. Nomes de pessoas, nomes de empresas, e-mail, localização do IP e identificadores correm no mesmo motor. Para os casos difíceis, adicione o Jev (typesafe.ai) ou um modelo Ollama local.
Incluído no Jenner. Sem serviço externo, sem chave de API e sem dados a sair da sua rede, a menos que opte por adicionar um modelo: Jev (typesafe.ai) ou um modelo Ollama local.
Para quem é
Seis tarefas em que a morada é a chave, e a chave nunca é escrita duas vezes da mesma forma.
KYC e integração de clientes
Um requerente escreve a sua morada uma vez, num telemóvel, à pressa. O Matcha resolve-a contra a sua tabela de referência enquanto ele ainda está na página e, quando dois registos são igualmente plausíveis, indica o único campo que decidiria a questão, para que o formulário possa perguntar "Milton or Morton?" em vez de chumbar a verificação ou deixá-la passar.
AML e triagem de sanções
A triagem é correspondência com os custos invertidos: uma ocorrência perdida é cara e um falso alarme é barato. O Matcha recebe esses custos como entradas e ajusta os seus limiares em conformidade, pelo que o mesmo motor que integra um cliente pode fazer a sua triagem. As moradas estão disponíveis hoje; a triagem de nomes de pessoas e de empresas contra listas de sanções e PEP corre no mesmo motor, com as mesmas decisões.
Deteção de fraude
O Matcha reporta todos os candidatos que considerou, com a evidência por campo e a probabilidade de a verdade não estar sequer na tabela. Uma regra de fraude pode trabalhar sobre aquilo que o comparador realmente analisou, em vez de uma única pontuação, e a entidade de localização do IP confere a localização de uma sessão com a morada que o cliente declara.
Desduplicação para marketing e CRM
O mesmo agregado familiar aparece de dez formas entre inscrições, encomendas e importações. O Matcha faz corresponder uma tabela a si própria, escreve os grupos e mantém uma probabilidade calibrada em cada ligação, pelo que uma desduplicação pode ser tão rigorosa ou tão tolerante quanto o envio que alimenta. A agregação familiar por morada e apelido é uma entidade composta no mesmo motor.
Entregas e logística
Uma entrega errada custa uma viagem de regresso; uma encomenda rejeitada custa a venda. O Matcha normaliza cada morada segundo as regras postais da sua região, faz-lhe corresponder a sua tabela de moradas servidas e diz-lhe quando uma morada é real mas está fora da sua área, ou é real mas falta na sua tabela, para que a correção vá para o sítio certo.
Setor público e tecnologia cívica
Um serviço municipal de consulta de parcelas permitia aos residentes enviar uma morada por SMS e receber a sua parcela. Nos casos mais difíceis, os erros ortográficos e os deslizes de ditado que o comparador anterior errava sempre, o motor Matcha sozinho respondeu corretamente a 81% à primeira tentativa, e um modelo aplicado ao residual levou esse valor a 91%.
Como funciona
Rust nativo dentro do binário do Jenner. Um passo, uma tabela de decisões e uma razão para cada uma.
1
Analisar e normalizar
Cada morada é dividida em número de porta, direção, rua, sufixo, unidade, cidade e código postal, e normalizada segundo as regras postais da sua região (USPS Publication 28 para os EUA, Canada Post para o Canadá). Onde o texto é ambíguo, o analisador guarda todas as leituras e deixa a referência decidir.
2
Encontrar candidatos na sua tabela
O motor constrói um vocabulário de ruas a partir da sua própria tabela de referência e encaixa nele a rua escrita por ortografia, som e pseudónimos oficiais. Os candidatos são encontrados por número de porta, código postal e rua, pelo que um ZIP errado não é fatal.
3
Pontuar cada campo, calibrar o resultado
Número de porta, rua, sufixo, direção, unidade e código postal são comparados separadamente, e a evidência combina-se numa probabilidade calibrada. Um sufixo em falta não custa nada quando a referência tem uma única rua com esse nome, e levanta uma questão quando tem duas.
4
Decidir pelo custo
Diz-nos quanto custam no seu processo uma correspondência errada, uma correspondência perdida e uma pergunta de acompanhamento. O motor escolhe a decisão com o menor custo esperado, pelo que só faz corresponder quando está suficientemente seguro para os seus números e, quando não está, devolve nenhuma correspondência em vez de uma errada.
5
Reportar tudo o que analisou
Uma linha por entrada com a decisão, a probabilidade e a razão; uma linha por candidato com a evidência por campo; uma tabela de métricas que diz porque é que as entradas não corresponderam. Nada é descartado em silêncio.
6
Enviar apenas o residual a um modelo
Opcionalmente, os casos que o motor não consegue resolver vão para um modelo de linguagem com os seus candidatos, dentro do mesmo passo. O modelo escolhe um candidato ou diz que nenhum serve; nunca reescreve a morada.
Seis decisões, cada uma com uma probabilidade associada
match
Um candidato é o registo certo com alta probabilidade. Use-o.
likely
O candidato mais provável, reportado com a sua probabilidade real quando esta fica abaixo do limiar de match. Nunca uma escolha aleatória.
nonmatch
Nenhum candidato plausível. Trate como não encontrado; os candidatos considerados continuam a ser reportados.
review
O motor não conseguiu decidir e o seu processo pode perguntar. Emitida apenas quando atribui um custo a um canal de acompanhamento.
not_in_table
Uma morada real que a sua referência não contém. Corrija a referência, não a entrada.
out_of_area
O código postal ou a localidade ficam fora da área da referência. Encaminhe-a para outro lado.
A lista de acompanhamento: fazer exatamente a pergunta certa
A maioria dos comparadores entrega os casos difíceis a uma fila de revisão manual que ninguém acompanha. Quando o Matcha não consegue decidir entre candidatos, sabe porquê: a entrada dizia 1200 Milton Street e a referência tem um 1200 Milton St e um 1200 Morton St, dois nomes de rua que se parecem à vista e ao ouvido. É uma pergunta com uma resposta de uma palavra.
Assim, quando atribui um custo a um canal de acompanhamento, as linhas indecisas saem como review com os candidatos ordenados, o campo exato que resolveria a questão (ask about street, ask about unit) e as probabilidades de que o seu processo precisa para decidir se vale a pena fazer a pergunta. Um serviço de SMS responde "Milton or Morton?". Um formulário de integração mostra as duas moradas. Um ecrã de call center mostra ao operador os candidatos em vez de um espaço em branco. Sem um canal com custo atribuído não existe decisão review: essas linhas são nonmatch, com os mesmos candidatos e a mesma razão anexados.
Comece com uma execução de avaliação
Dê ao Matcha um ficheiro de verdade, algumas centenas de entradas cujo registo correto pode garantir, e uma única execução pontua cada decisão contra ele: corretas à primeira tentativa, precisão das correspondências feitas, respostas erradas, recall entre os cinco primeiros candidatos, uma curva de calibração e o custo esperado de cada peso de erro, para que possa escolher o seu a partir da curva em vez de adivinhar.
Resultados medidos
Dois testes, um sobre o que o público realmente escreve e outro sobre moradas deliberadamente corrompidas em seis áreas dos EUA. Números tal como publicados na documentação.
Consultas reais escritas pelo público
Cerca de 2.400 moradas que residentes escreveram num serviço municipal de consulta de parcelas, contra um registo de cerca de 378.000 parcelas, com a parcela correta conhecida pelo que aconteceu a seguir. Nos 223 casos mais difíceis, erros ortográficos reais, artefactos de ditado e sufixos em falta, o comparador anterior do município errava à primeira tentativa todas as vezes.
0% a 81%
casos difíceis correspondidos corretamente à primeira tentativa, só o motor
91%
com um modelo local ou o Jev no residual
89% a 97%
concordância nos casos fáceis, do motor sozinho ao motor com modelo
Moradas deliberadamente corrompidas, em todo o país
3.000 moradas reais de seis áreas ZIP escolhidas ao acaso, extraídas do National Address Database e corrompidas com a mistura de erros medida em dados reais: erros ortográficos, direções e sufixos omitidos, abreviaturas, tokens colados e dígitos trocados. A verdade é conhecida com exatidão, e cada entrada termina como correspondência ou não correspondência, sem nada posto de lado para uma pessoa.
83,3%
correspondência correta à primeira tentativa, só o motor
98,1%
precisão das correspondências feitas
1,6%
respostas erradas, cerca de uma em sessenta
87,8% a 89,3%
corretas à primeira tentativa com o Jev ou um modelo local no residual
Uma pontuação de semelhança por si só é perigosa: com a correspondência difusa de ruas ligada e nada por cima dela, uma morada em cada quatro voltava errada. As alternativas, os pseudónimos e a resolução de edifícios fazem a maior parte do trabalho, e a camada de decisão reduz depois as respostas erradas de 3,6% para 0,7% ao devolver nenhuma correspondência em vez de uma errada quando não está suficientemente segura. Os pesos de custo permitem-lhe deslocar esse compromisso em qualquer dos sentidos.
Ganho por etapa: o que cada camada acrescenta
As mesmas 3.000 moradas corrompidas, correspondidas com uma camada ligada de cada vez. As etapas 1 a 5 são cumulativas; as duas últimas são alternativas sobre o residual do motor completo.
A correspondência exata acerta 34,6% e não erra nenhuma. Analisar e normalizar sobe as correspondências corretas para 48,8%, mas as erradas para 20,8%. A correspondência difusa de ruas sobe as corretas para 64,5% e as erradas para 25,0%. Alternativas, pseudónimos e unidades levam as corretas a 89,3% e baixam as erradas para 3,6%. As decisões sensíveis ao custo, o motor completo, dão 84,1% corretas e 0,7% erradas. Sobre o residual desse motor, um modelo Ollama local atinge 90,0% corretas com 2,1% erradas, e o Jev atinge 88,5% corretas com 0,8% erradas.
Percentagem de 3.000 moradas corrompidas correspondidas corretamente, correspondidas erradamente ou perdidas, por etapa. As duas últimas linhas são alternativas derivadas da etapa 5, não uma sequência.
Etapa
Correspondência correta
Correspondência errada
Perdida
etapa 1: Correspondência exata
34.6%
0.0%
65.4%
etapa 2: Analisar e normalizar
48.8%
20.8%
30.4%
etapa 3: Rua difusa
64.5%
25.0%
10.5%
etapa 4: Alternativas e unidades
89.3%
3.6%
7.1%
etapa 5: Decisões sensíveis ao custo
84.1%
0.7%
15.2%
+ IA no residual: IA local (Ollama)
90.0%
2.1%
7.8%
+ IA no residual: Jev (TypeSafe)
88.5%
0.8%
10.7%
Fonte: 3.000 moradas reais dos EUA de seis áreas ZIP escolhidas ao acaso, extraídas do National Address Database e corrompidas com a mistura de erros medida em dados reais, pelo que a verdade é conhecida com exatidão. Números tal como publicados na documentação do PROC MATCHA.
A correspondência difusa por si só é perigosa. Com a correspondência difusa de ruas ligada e nada por cima dela, uma morada em cada quatro volta errada, e nada numa pontuação de semelhança lhe diz qual.
A camada de alternativas faz o trabalho pesado. Pseudónimos oficiais de ruas, grafias alternativas e resolução de unidades e edifícios levam as correspondências corretas de 64,5% para 89,3% e cortam as erradas de 25,0% para 3,6%.
A camada de decisão reduz as respostas erradas para menos de 1%. Ao dar um preço a uma correspondência errada face a uma perdida, o motor devolve nenhuma correspondência em vez de uma errada quando não está suficientemente seguro: 0,7% erradas, com os casos indecisos reportados, não descartados.
A IA no residual eleva as correspondências corretas para cerca de 90%. Um modelo local encontra o maior número de correspondências e aproximadamente triplica as respostas erradas; o Jev acrescenta correspondências com a precisão do próprio motor, 0,8% erradas.
Execute-o nas suas próprias moradas
O Matcha está incluído em todas as licenças do Jenner. Compre o Jenner, leia a documentação do PROC MATCHA, ou fale-nos do seu problema de correspondência e ajudamo-lo a montar uma execução de avaliação.
Os modelos de linguagem são caros por linha e lentos por linha. O Matcha usa-os como o faria um bom analista: apenas nos casos que exigem discernimento.
Ollama com qwen2.5:7b-instruct, totalmente offline
Execute um modelo local através do Ollama no seu próprio hardware, totalmente offline, para que nada saia da máquina. Medimos com qwen2.5:7b-instruct. Os modelos locais são gratuitos por linha e respondem a quase todas as perguntas que lhes são mostradas, o que encontra mais correspondências e aproximadamente duplica as respostas erradas.
Jev, um modelo System One da TypeSafe (typesafe.ai)
Em vez de gerar texto, o Jev responde a uma pergunta tipificada, qual candidato, se algum, é o mesmo lugar que esta morada, e devolve uma escolha com uma probabilidade calibrada. Quando diz 0,9, acerta cerca de 90% das vezes, e quando está inseguro diz que nenhum dos candidatos serve, em vez de adivinhar. É exatamente a forma de que um comparador atento aos custos precisa, e é por isso que o Jev acrescenta correspondências com a mesma precisão do motor.
Nas execuções medidas, a faixa de indecisão é de 2% a 8% das entradas, pelo que um trabalho de 100.000 moradas faz alguns milhares de chamadas ao modelo, e não cem mil.
Ambos são opcionais e ambos estão desligados por predefinição. O motor não precisa de nenhum deles, e um modelo remoto só pode ser usado depois de definir allow_remote na configuração.
Jev da typesafe.ai: modelos System One para os casos difíceis
O Jev é desenvolvido pela TypeSafe (typesafe.ai). O Matcha só o chama sobre o resíduo que o motor não consegue decidir.
O Jev é o modelo System One da TypeSafe. Em vez de gerar texto, responde a uma pergunta tipada, qual candidato, se algum, é o mesmo lugar que este endereço, e devolve uma escolha, uma probabilidade calibrada e uma confiança. Os modelos System One são feitos para decisões dessa forma, não para conversar.
Essa forma é a que um correspondedor sensível ao custo precisa. Calibrado significa que, quando o Jev diz 0.9, está certo cerca de 90% das vezes, de modo que o motor pode pesar a sua resposta contra o preço de uma correspondência errada, e quando o Jev não tem certeza, diz que nenhum dos candidatos serve em vez de adivinhar.
O Matcha usa o Jev apenas sobre o resíduo, os casos que o motor não consegue decidir sozinho, pelo que um trabalho de 100,000 endereços faz alguns milhares de chamadas ao Jev, não cem mil. Coloque a sua chave de API da TypeSafe no ambiente, adicione adjudicate provider=jev; ao passo PROC MATCHA e deixe allow_remote desligado até ter decidido que esses casos podem sair da sua máquina.
Ativar o Jev
export TYPESAFE_API_KEY=... # never in a file
adjudicate provider=jev; # inside the PROC MATCHA step
Medido no benchmark de endereços corrompidos, o Jev eleva as correspondências corretas de 83.3% para 87.8% com a precisão própria do motor de 98.1%, com 0.8% de respostas erradas na ablação etapa a etapa. Nas consultas reais digitadas pelo público, resolveu os casos difíceis tantas vezes quanto o modelo local, e quando nenhum candidato era o certo, disse-o em vez de escolher um.
Dados de referência abertos, atualizados só quando decidir
O motor faz a correspondência contra a tabela que lhe dá, ajudado por pacotes de conhecimento abertos: pontos de morada dos EUA do National Address Database, pseudónimos de ruas do Census TIGER e moradas canadianas da Statistics Canada, todos de domínio público ou com licença aberta. A Jenner Analytics reconstrói os pacotes quando as suas fontes publicam, valida-os contra a versão anterior, assina-os e publica-os num canal de dados.
Nada na sua máquina muda até que execute a atualização por si próprio. Cada pacote é verificado contra um manifesto assinado antes de um único byte ser extraído e é trocado de forma atómica, pelo que um trabalho em curso vê o pacote antigo ou o novo, nunca um parcial. O PROC MATCHA nunca descarrega nada, e o relatório regista qual a versão dos dados que uma execução usou.
Verifique e depois atualize, ao seu ritmo
jenner data update --check # what would change; writes nothing
jenner data update # install or refresh every pack
jenner data update --pin 2026.9.28
Regiões
Os EUA são a predefinição e o Canadá é suportado, incluindo formas bilingues. Os pacotes regionais para o Reino Unido, França, Japão, Coreia e Austrália estão em preparação. Cada um é dados, não código, pelo que adicionar um país é adicionar um pacote.
Um motor de correspondência para KYC, AML, fraude, risco de crédito, entregas e compliance
As moradas estão disponíveis hoje. Todas as outras correspondências da família KYC correm no mesmo motor: as mesmas probabilidades calibradas, as mesmas decisões ponderadas por custo, os mesmos resultados e a mesma execução de avaliação.
Um novo tipo de correspondência é uma definição de entidade, não um novo produto: os papéis que um registo tem, o comparador para cada papel, a estratégia de blocagem e os pacotes de conhecimento que pode consultar. A pontuação, as decisões, a lista de acompanhamento e a avaliação são código partilhado, pelo que uma correspondência de nomes de pessoas é avaliada e tarifada exatamente como uma correspondência de moradas.
Capacidades no mesmo motor
Endereço IP para morada postal: distância de geolocalização e sinais de VPN
O Matcha compara o local onde o endereço IP de uma sessão é geolocalizado com a morada que o cliente declara, usando a distância geodésica com o raio de geolocalização como incerteza. Os sinais de ASN, proxy e VPN contam como evidência contra, nunca como veredicto por si só. O resultado é a mesma probabilidade calibrada e a mesma decisão ponderada por custo de uma correspondência de moradas, pelo que uma regra de fraude pode agir sobre ele ou encaminhá-lo para review.
Exemplo: Um requerente de cartão indica uma morada em Denver a partir de um IP geolocalizado a 40 km de distância e sem sinal de VPN: concordância dentro do raio. A mesma morada a partir de um IP de centro de dados noutro país: conflito, e a linha é tarifada para review.
E-mail para pessoa e empresa: parte local, domínio e sinais de endereços descartáveis
A entidade de identidade de e-mail testa se um endereço pertence à pessoa e à organização declaradas na integração. A parte local é comparada com os tokens do nome, incluindo nome.apelido, iniciais e alcunhas; o domínio é comparado com os domínios registados da organização; as listas de domínios de e-mail gratuito e descartáveis e a presença de registos MX são evidência. Cada sinal é um comparador, e o motor diz com que força concordam.
Exemplo:[email protected] face a Jane Okafor na Northwind Actuarial: a parte local concorda com o nome e o domínio concorda com a empresa. [email protected] face ao mesmo registo: domínio descartável, e a probabilidade di-lo.
Correspondência de nomes de empresas: formas jurídicas, acrónimos e identificadores de registo
A entidade empresa remove as formas jurídicas segundo a ISO 20275, pondera as palavras raras, expande acrónimos e deixa um identificador de registo sobrepor-se ao nome: LEI, EIN, UEI e números da Companies House. Os dados GLEIF Level 1 e os nomes anteriores do EDGAR são pacotes de conhecimento, pelo que uma empresa que mudou de nome continua a corresponder à contraparte nos seus livros. Validação de fornecedores, correspondência de contrapartes e KYB usam a mesma execução.
Exemplo: "INTL BUSINESS MACHINES CORP" face a "International Business Machines Corporation" com LEI coincidente: match, sobreposição por identificador de registo. "IBM Credit LLC" face à empresa-mãe: nonmatch, com a evidência de forma jurídica e de palavras raras reportada.
Correspondência de nomes de pessoas: alcunhas, transliteração, fonética e data de nascimento
A entidade pessoa compara nomes próprios, do meio e apelidos com pacotes de alcunhas, transliteração de cirílico, árabe e CJK, comparação fonética e variantes de ordem dos nomes, e trata uma data de nascimento transposta ou um documento de identificação nacional com soma de verificação válida como a evidência que são. Uma lista de sanções ou PEP é uma tabela de referência comum com o custo de uma correspondência perdida definido alto, pelo que a triagem e a desduplicação de clientes são o mesmo motor com preços diferentes.
Exemplo: "Mohammed Al-Rashid, 03/07/1981" face a "Muhammad Alrashid, 07/03/1981": a transliteração concorda, a data é uma transposição dia-mês, e a linha volta como ocorrência de triagem com a sua probabilidade, em vez de uma ocorrência perdida.
Números de telefone e identificadores: IBAN, VIN, NPI e documentos de identificação nacionais
Os números de telefone são normalizados para E.164 e verificados quanto à coerência de país e indicativo e ao tipo de operadora. Os identificadores são validados antes de serem correspondidos: somas de verificação de IBAN, VIN e NPI, coerência de formato e emissor, formatos de documentos de identificação nacionais. Um identificador válido é evidência forte; um inválido é uma constatação por direito próprio, reportada antes de um único candidato ser pontuado.
Exemplo: O IBAN de um requerente falha a verificação mod-97: a linha é sinalizada antes da correspondência, com a razão, em vez de ser pontuada contra todas as contas da tabela de referência.
Coordenadas, agregados familiares, contrapartes de transações e nomes de produtos
As entidades compõem-se. Uma coordenada de dispositivo é geocodificada inversamente para o ponto de morada mais próximo; um agregado familiar é uma correspondência de morada mais concordância de apelido; uma contraparte de transação é uma empresa ou pessoa mais uma conta e um país; um nome de produto ou de medicamento corresponde por contenção de tokens com sobreposição por código. O código de pontuação não conhece a diferença, e é por isso que cada uma chega ao mesmo motor com a mesma execução de avaliação.
Exemplo: A posição GPS de uma aplicação de entregas cai a 30 m da morada da encomenda: concordância, com a distância reportada. Dois registos de cliente numa mesma morada com o apelido em concordância: um agregado familiar, com uma probabilidade calibrada na ligação.
Verifique a morada, o e-mail, o telefone e os identificadores que um requerente lhe dá num só passo, com uma probabilidade por verificação e uma pergunta de acompanhamento quando algo é ambíguo. O Matcha resolve a morada enquanto o requerente ainda está na página e pergunta "Milton or Morton?" em vez de chumbar a verificação ou deixá-la passar.
Compare a localização do IP da sessão com a morada declarada, a coordenada do dispositivo com a morada de entrega e o e-mail com a pessoa, e obtenha evidência sobre a qual uma regra pode agir, em vez de uma pontuação opaca. Todos os candidatos que o comparador considerou são reportados, com a probabilidade de a verdade não estar sequer na sua tabela.
Faça a triagem de nomes de pessoas e de empresas contra listas de sanções e PEP com transliteração, alcunhas, fonética e transposições de data de nascimento, com custos definidos para triagem: uma ocorrência perdida cara, um falso alarme barato. A lista é uma tabela de referência, a execução de avaliação pontua a sua taxa de ocorrências contra casos conhecidos, e a curva de calibração diz-lhe o que significa um 0,9 nos seus dados.
Resolva as empresas de um pedido, de uma transação ou de um razão numa única entidade jurídica através de formas jurídicas, nomes anteriores e identificadores de registo, para que a exposição seja contada uma só vez. LEI, EIN, UEI e números da Companies House sobrepõem-se aos nomes quando estão presentes e corroboram-nos quando não estão.
Normalize cada morada segundo as regras postais da sua região, faça-a corresponder à sua tabela de moradas servidas e saiba quando uma morada é real mas está fora da sua área, ou é real mas falta na sua tabela. Uma coordenada do dispositivo à porta confirma o ponto de entrega, e os pesos de custo decidem quando uma morada errada é pior do que uma encomenda rejeitada.
Cada decisão traz uma probabilidade, uma razão e os candidatos considerados, em tabelas que ficam consigo. Nada sai da sua máquina a não ser que opte por adicionar um modelo, o relatório regista qual a versão dos dados que uma execução usou, e a mesma execução de avaliação reproduz um resultado para um auditor meses depois.
O PROC MATCHA faz parte do Jenner, não é um produto separado nem uma tarifa por linha. Em Windows e Linux, uma licença do Jenner compra-se uma vez por máquina e é perpétua: a versão que compra continua a funcionar enquanto a quiser usar, com novas versões e suporte incluídos durante um ano. O Jenner para macOS está na Mac App Store, e o Workspace é faturado à hora.
A Jenner Analytics não cobra nada por uma linha correspondida, um candidato considerado ou uma pergunta feita. Se optar pelo Jev, a TypeSafe cobra-o por token de entrada, e ele só vê o residual.
O Jenner executa o código PROC DQMATCH e PROC DQSCHEME existente por compatibilidade, pelo que um programa de qualidade de dados SAS continua a funcionar. O Matcha é o comparador recomendado para trabalho novo: usa a mesma sintaxe de instruções ao estilo SAS, mas devolve uma probabilidade calibrada e uma razão para cada decisão, pode fazer uma pergunta de acompanhamento e lê e escreve CSV, Parquet, Avro e a maioria das bases de dados através da mesma sintaxe data=, pelo que não fica preso a nenhuma das ferramentas.
Não. O motor é Rust nativo dentro do binário do Jenner e não faz chamadas de rede; os dados de referência são a tabela que lhe dá mais os pacotes de conhecimento instalados na sua máquina. Os modelos de linguagem estão desligados por predefinição. Um modelo local através do Ollama mantém tudo no seu hardware. Um modelo remoto como o Jev só é usado se o ativar na configuração, e nesse caso vê apenas os casos indecisos com os seus candidatos, nunca o ficheiro inteiro.
Os Estados Unidos são a região predefinida, com normalização segundo a USPS Publication 28 e dados de moradas abertos do National Address Database e do Census TIGER. O Canadá é suportado, incluindo formas bilingues em francês e códigos postais canadianos, com dados da Statistics Canada. Os pacotes regionais para o Reino Unido, França, Japão, Coreia e Austrália estão em preparação. Já hoje pode fazer a correspondência contra a sua própria tabela de referência em qualquer país; os pacotes acrescentam regras de normalização e pontos de morada abertos.
Sim. O motor não precisa de serviço, de chave nem de rede. Os pacotes de referência instalam-se uma vez com jenner data update e só são atualizados quando volta a executar esse comando. Com um modelo Ollama local, o passo opcional de adjudicação também é offline; só o Jev é uma chamada remota, e apenas se o ligar.
Quando o motor não consegue decidir entre candidatos e atribuiu um custo a um canal de acompanhamento, essas linhas saem como review com os candidatos ordenados, o campo exato que resolveria a questão (sufixo, direção, unidade) e as probabilidades. O seu processo transforma isso numa pergunta a quem a possa responder: uma resposta por SMS, um aviso num formulário de integração, um ecrã de call center. Ninguém do lado da correspondência lê essas linhas, e sem um canal com custo atribuído são reportadas como nonmatch com os mesmos candidatos anexados.
Dê a uma execução um ficheiro de verdade com entradas cujo registo correto conhece e o Matcha pontua cada decisão contra ele: corretas à primeira tentativa, precisão, respostas erradas, recall entre os cinco primeiros candidatos, abstenções corretas em entradas fora de área, uma curva de calibração e o custo esperado para uma gama de pesos de erro. Os resultados publicados nesta página vêm do mesmo modo de execução, sobre consultas públicas com desfechos conhecidos e sobre moradas corrompidas com verdade exata.
Sim, no mesmo motor. As moradas estão disponíveis hoje. Nomes de pessoas, nomes de empresas, identidade de e-mail, localização do IP, números de telefone, identificadores com soma de verificação e listas de sanções ou PEP são entidades que o mesmo motor faz corresponder, com as mesmas probabilidades calibradas, decisões ponderadas por custo, resultados e execução de avaliação. Uma lista de triagem é uma tabela de referência comum com o custo de uma correspondência perdida definido alto. Use o formulário desta página para pedir a disponibilidade da entidade de que precisa.
O Matcha está incluído no Jenner, por isso compra o Jenner: uma licença perpétua por máquina para Windows e Linux, o Jenner para macOS na Mac App Store, ou créditos do Workspace à hora. Não há cobrança por linha nem por correspondência. A página de preços tem os planos atuais e a avaliação gratuita.
Sim. Uma lista de sanções ou PEP é uma tabela de referência de pessoas ou empresas, e a triagem é correspondência com os custos invertidos: uma ocorrência perdida com preço alto, um falso alarme com preço baixo. A entidade pessoa trata alcunhas, transliteração de cirílico, árabe e CJK, comparação fonética, variantes de ordem dos nomes e transposições de data de nascimento, e a execução de avaliação pontua a sua taxa de ocorrências contra casos conhecidos. Peça a disponibilidade no formulário desta página.
Sim. A entidade de localização do IP geolocaliza o endereço IP da sessão e compara-o com as coordenadas da morada declarada por distância geodésica, usando o raio de geolocalização como incerteza, e trata os sinais de ASN, proxy e VPN como evidência contra. O resultado é a mesma probabilidade calibrada e a mesma decisão de uma correspondência de moradas, pelo que uma regra de fraude ou uma fila de review pode usá-lo diretamente.
Sim. A entidade empresa remove as formas jurídicas segundo a ISO 20275, pondera as palavras raras, expande acrónimos e deixa um identificador de registo sobrepor-se ao nome: LEI, EIN, UEI e números da Companies House. Os dados GLEIF e os nomes anteriores do EDGAR são pacotes de conhecimento, pelo que uma empresa que mudou de nome continua a resolver-se na contraparte nos seus livros. É validação de fornecedores, correspondência de contrapartes e KYB numa só execução.
O Jev é um modelo System One criado pela TypeSafe (typesafe.ai). Em vez de gerar texto, responde a uma pergunta tipada, qual candidato, se algum, é o mesmo lugar que este endereço, com uma escolha, uma probabilidade calibrada e uma confiança. O Matcha usa-o porque essa é a forma de uma decisão de correspondência: quando o Jev diz 0.9, está certo cerca de 90% das vezes, e quando não tem certeza, diz que nenhum dos candidatos serve. Só é chamado sobre o resíduo que o motor não consegue decidir, alguns milhares de chamadas por 100,000 linhas, e no benchmark de endereços corrompidos eleva as correspondências corretas de 83.3% para 87.8% com a precisão própria do motor de 98.1%. Está desligado por padrão e precisa de uma chave de API da TypeSafe no ambiente e de adjudicate provider=jev; no passo.
Sim. Aponte o Matcha para um modelo local servido pelo Ollama no seu próprio hardware, totalmente offline, e o mesmo passo de adjudicação corre sem que nada saia da máquina. Medimos com qwen2.5:7b-instruct. Um modelo local responde a quase todos os casos que lhe são mostrados, o que encontra mais correspondências, 89.3% corretas no benchmark de endereços corrompidos, e aproximadamente duplica as respostas erradas em comparação com o Jev. Também pode executar os dois lado a lado e obter um indicador agree por linha. Nenhum é obrigatório: o motor sozinho não precisa de modelo, chave nem rede.
Experimente com as suas próprias moradas
Execute uma avaliação contra algumas centenas de registos que pode garantir, e obtenha um único número honesto sobre a qualidade nos seus dados.
As moradas estão disponíveis hoje. Peça uma execução de avaliação nos seus próprios dados, ou peça a disponibilidade de uma capacidade no mesmo motor, e respondemos com datas e com o que é preciso para a montar.
Veja o Matcha por si próprio
Compre o Jenner e execute o PROC MATCHA nas suas próprias moradas, leia a documentação, ou veja a introdução de três minutos ao Jenner.