ガイド

UTF-8で日本語が何バイトになるか

日本語、英数字、絵文字をUTF-8で扱うときのバイト数確認方法を説明します。

作成日
2026-07-18
更新日
2026-07-18
確認日
2026-07-18
コレクション
guides

UTF-8では英数字の多くは1バイト、日本語の多くは複数バイトで表現されます。入力制限が「100文字」ではなく「100 bytes」の場合、日本語では想定より早く上限に届くことがあります。

文字数・バイト数カウントはブラウザのTextEncoderでUTF-8バイト数を計算します。フォーム送信前やAPIリクエスト前に、実際のバイト数を確認できます。

使いどころ

  • データベースやAPIの本文サイズ制限を確認する
  • 日本語を含むCSVやJSONの送信サイズを見積もる
  • 英数字中心の文章と日本語中心の文章でサイズ差を見る

注意点

バイト数は文字コードで変わります。TASUTOOLでは初期仕様としてUTF-8を基準にします。

主張と出典

主張出典確認日確信度更新条件
UTF-8はUnicode文字列をバイト列へ符号化する方式としてWeb上で広く使われる。Encoding Standard2026-07-18highEncoding Standardに変更があった場合
TextEncoderの既定エンコーディングはUTF-8である。MDN TextEncoder2026-07-18highMDNのTextEncoder説明に変更があった場合

関連ツール

関連記事