法人名の名寄せはなぜ難しいのか
外字・異体字、新旧字体、全角半角、「株式会社」の位置。日本語の法人名を突き合わせるときに実際に起きる問題と、単純な文字列一致が失敗する理由。
社内の取引先マスタと法人番号の登録簿を突き合わせようとすると、「同じ会社なのに一致しない」が大量に出ます。原因は表記のゆれで、しかも種類が多岐にわたります。
一致しない理由
株式会社の位置と略記。 「株式会社サンプル」と「サンプル株式会社」は前株・後株の違いであり、別法人です。一方で「㈱サンプル」は同じ会社の略記です。単純な文字列比較はこの区別ができません。
新字体と旧字体。 「齋藤」「齊藤」「斉藤」「斎藤」は別の字です。登記上の表記は 1 つですが、社内システムには別の字で入っていることがあります。
全角と半角。 英数字、カタカナ、スペース、中黒。同じ社名が入力経路によって違うバイト列になります。
空白の有無。 「日本 サンプル」と「日本サンプル」。
外字。 これが最も厄介です。
外字の問題
法人名には、Unicode で表現できない字が使われていることがあります。その場合、国税庁は文字そのものではなく画像の ID を返します。
つまりデータ上、その法人名は完全な文字列として存在しません。どんな文字列比較アルゴリズムを使っても、比較する対象がないのです。
これは珍しい例外ではなく、登記名に一定数含まれています。「文字化けしているデータ」ではなく、「文字として提供されていないデータ」です。
なぜ単純な正規化では足りないのか
全角半角の統一と空白除去だけなら実装できます。実際、多くの現場がそこまではやっています。
しかしそれでは、
- 旧字体と新字体は一致しません
- 外字を含む名称は、正規化してもなお比較できません
- 前株・後株を無理に同一視すると、別法人を誤って同一と判定します
最後の点が重要です。名寄せの失敗には 2 種類あり、「同じ会社を別と判定する」より「別の会社を同じと判定する」ほうが、経理・与信の文脈では重い誤りになります。緩い正規化は後者を増やします。
現時点で Daichodo が提供していること
正直に書きます。名寄せ・あいまい一致の機能はまだ提供していません。
現在提供しているのは、登録番号・法人番号による照会と、その登録内容が変わった時点での通知です。番号が分かっている前提の機能です。
ただし取り込みの段階で、外字が使われているレコードには印を付け、国税庁が返す画像 ID をそのまま保持しています。 破棄していません。これは名寄せに取り組むときに必要になるデータで、後から取得し直せないためです。
異体字辞書と外字の対応付けは、次に着手する機能です。現時点では提供していません。
この問題に取り組んでいる場合
どのようなデータを突き合わせようとしているのか、 hello@daichodo.com までお聞かせください。機能の優先順位はこうした声で決めています。
番号が分かっているデータの照会・変更検知であれば、今すぐ利用できます。