Ce que j'ai finalement fait : avant la fusion dans mon fichier gedcom principal, j'ai nettoyé les lieux du fichier secondaire. C'est à dire que j'ai normalisé en "Lieudit, Commune, Code_INSEE, Code_Postal, Département, Région, Pays". Originellement le fichier gedcom secondaire ne contenait que "Lieudit, Commune". J'ai alors lancé "Réunir deux généalogies", et là, la recherche de doublons a tout trouvé.
J'en déduis que ce sont les lieux qui faisaient "capoter le matching". Dans l'exemple que j'ai fourni, on avait
BIRT
La Rigaudié, Montirat, 81180, 81190, Tarn, Occitanie, France
La Régaudié, Paroisse de Canezac
DEAT
La Régaudié, Montirat, 81180, 81190, Tarn, Occitanie, France
La Régaudié, Commune de Montirat
Je ne sais pas ce qui fait capoter le matching:
- est-ce la comparaison des BIRT, c'est le plus probable (différence Ri-Ré, et Montirat-Canezac)
- ou est-ce la comparaison des DEAT fait également capoter ? Là je trouverai cela dommage, mais c'est peut-être améliorable ? Comment est fait le calcul de similarité ? Il devrait donner un scoring positif, faible certes, mais positif non ?