ガイド
UTF-8で日本語が何バイトになるか
日本語、英数字、絵文字をUTF-8で扱うときのバイト数確認方法を説明します。
UTF-8では英数字の多くは1バイト、日本語の多くは複数バイトで表現されます。入力制限が「100文字」ではなく「100 bytes」の場合、日本語では想定より早く上限に届くことがあります。
文字数・バイト数カウントはブラウザのTextEncoderでUTF-8バイト数を計算します。フォーム送信前やAPIリクエスト前に、実際のバイト数を確認できます。
使いどころ
- データベースやAPIの本文サイズ制限を確認する
- 日本語を含むCSVやJSONの送信サイズを見積もる
- 英数字中心の文章と日本語中心の文章でサイズ差を見る
注意点
バイト数は文字コードで変わります。TASUTOOLでは初期仕様としてUTF-8を基準にします。
主張と出典
| 主張 | 出典 | 確認日 | 確信度 | 更新条件 |
|---|---|---|---|---|
| UTF-8はUnicode文字列をバイト列へ符号化する方式としてWeb上で広く使われる。 | Encoding Standard | 2026-07-18 | high | Encoding Standardに変更があった場合 |
| TextEncoderの既定エンコーディングはUTF-8である。 | MDN TextEncoder | 2026-07-18 | high | MDNのTextEncoder説明に変更があった場合 |