Unicode

世界中の文字へ共通の番号を割り当てるための国際的な標準です。

コードポイント

Unicodeで文字に付けられた番号です。「あ」は U+3042 と書きます。

UTF-8

Unicodeの番号を、ファイルや通信で扱える1〜4バイトのデータへ変換する方式です。

バイト

データ量の基本単位です。文字コードでは、保存されたデータを E3 81 82 のような16進数で示すことがあります。

エンコーディング(符号化方式)

文字番号をバイト列へ変換する方法です。UTF-8、UTF-16、Shift_JISなどがあります。

フォント

文字番号に対応する見た目の形を描くためのデータです。文字がUnicodeに存在しても、対応フォントがなければ四角い記号で表示されることがあります。

文字化け

保存したときと違う方式で読み込むなどの理由で、意図しない文字が表示されることです。

実際の文字を調べてみる

図鑑に戻り、気になる文字を貼り付けるとコードポイントとバイト列を確認できます。

文字コード図鑑を使う →

ほかの基礎記事も読む

文字化け、Unicode、見えない文字などの関連項目をまとめています。

「文字コードとは」へ戻る →