Unicodeを1〜4バイトで表す方式

UTF-8はUnicodeのコードポイントを可変長のバイト列へ変換します。ASCIIの英数字は1バイト、日本語の多くは3バイト、補助領域の絵文字などは4バイトです。

A41
E3 81 82
😀F0 9F 98 80

Webとの相性

ASCIIとの互換性があり、世界中の文字を1つの方式で扱えるため、HTMLやAPI、データ交換で広く利用されています。

文字化けを防ぐ

HTMLでは文字コードをUTF-8として宣言し、保存したファイルとサーバーの応答でも同じ方式を指定します。

実際の文字を調べてみる

図鑑に戻り、気になる文字を貼り付けるとコードポイントとバイト列を確認できます。

文字コード図鑑を使う →

ほかの解説も読む

文字化け、Unicode、見えない文字など、関連する基礎知識をまとめています。

解説一覧を見る →