Java 開発者がよく遭遇する 3 つの基本的なエンコーディングを解説します。
UTF-8(web や多くのフォーマットの標準)とは何か、JVM の文字列の内部形式 —
UTF-16(サロゲートペアと
BOM あり)の仕組み、そしてなぜ今でも
ISO-8859-1 が登場するのか。
ASCII との互換性、1 文字あたりのバイト数を説明し、
StandardCharsets、
Files.write、
Files.readString、
Paths.get を使った Java における正しい扱い方を示します。最後に — 典型的なミス: 誤った読み書き、システムのデフォルトエンコーディング、
UTF-16/
UTF-8 の取り違え。