日本語テキスト正規化・不可視文字検出
日本語テキストの全角・半角、半角カタカナ、記号、ハイフン・チルダ、句読点、空白・改行などの表記ゆれをまとめて整え、ゼロ幅スペースやBOM、方向制御文字などの不可視文字、丸数字や㈱などの機種依存文字を検出・除去できるツールです。変換前後の差分と項目別の変換件数を確認でき、処理はすべてブラウザ内で行われます。
使い方
- 変換前の欄にテキストを貼り付けるか、テキストファイルをドラッグ&ドロップします。
- 用途に合わせてプリセット(Excel/CSV取り込み用・データベース登録用・文書校正用・コピペ事故の掃除)を選ぶか、各項目のチェックボックスや選択肢を個別に設定します。
- 変換後の欄に結果が表示されます。「変換件数」で項目ごとの件数を、「変換前後の差分」で変更箇所を確認できます。
- 「検出した特殊文字」では、不可視文字や機種依存文字の位置と種類が一覧と本文中の印で表示されます。「不可視文字を除去」で入力欄から一度に取り除けます。
- 結果は「クリップボードへコピー」または「ダウンロード」で保存します。
このツールについて
日本語テキスト正規化ツールは、全角と半角が混在した英数字、半角カタカナ、ハイフンや波ダッシュの種類の違いなど、日本語のテキストで起きやすい表記ゆれを整えるツールです。CSVやデータベースに取り込む前のデータの整形、文書校正の前処理、検索や重複チェックの精度向上に役立ちます。文字数を数える場合は「文字数カウント」ツールと組み合わせて使うと便利です。
Webページやチャット、PDFからコピーしたテキストには、ゼロ幅スペースやBOM、ノーブレークスペース、文字の表示方向を変える制御文字など、目に見えない文字が混入していることがあります。これらはプログラムやExcelでの照合の失敗、思わぬ表示崩れの原因になります。このツールでは位置と種類を一覧にし、本文中に赤い印で表示します。
ハイフン・ダッシュ類の統一では、カタカナ・ひらがなの直後にあるものは長音符「ー」とみなすため、「コンピュ-タ」は「コンピュータ」に、「03-1234」は「03-1234」になります。半角の「,」「.」や「~」は、数値・英文・URLを壊さないよう日本語や数字に隣接するものだけを変換します。変換はすべて自前の変換表で行い、テキストがサーバーへ送信されることはありません。
よくある質問
NFKCとは何ですか?
Unicodeの正規化形式の1つで、全角英数字や半角カタカナ、①や㌔などの互換文字を標準的な文字にまとめて変換します。変換が広範囲に及ぶため、「①」が「1」になるなど意味が変わる場合があります。細かく制御したい場合はNFCを選び、各項目を個別に設定してください。
不可視文字を除去すると絵文字が変わることはありますか?
家族の絵文字などは、複数の絵文字をゼロ幅接合子(ZWJ)でつないで1つに見せています。ZWJを除去すると個別の絵文字に分かれるため、絵文字を含むテキストでは結果を確認してください。
異体字セレクタ(IVS)とは何ですか?
「葛」などの漢字の字形を指定するために文字の直後に付ける見えない文字です。人名などで意図的に使われることがあるため、このツールでは検出して表示するだけで、不可視文字の除去の対象にはしていません。
入力したテキストは送信されますか?
送信されません。変換・検出はすべてブラウザ内で行われます。