字符编码:ASCII 和 Unicode

发布时间:2026/7/21 19:34:44
字符编码:ASCII 和 Unicode ASCII和Unicode都是计算机用来表示字符的编码标准。简单来说ASCII 是 Unicode 的子集Unicode 是现代编程的通用标准。一、ASCII早期的字符集ASCII美国信息交换标准代码诞生于 1960 年代是计算机最基础的字符编码标准。它用7 位二进制表示一个字符总共可以表示 128 个字符0-127。┌─────────────────────────────────────────────────────────────┐ │ ASCII 字符集 (0-127) │ ├───────────────┬─────────────────────────────────────────────┤ │ 0-31 │ 控制字符不可打印 │ │ 32 │ 空格 │ │ 33-47 │ ! # $ % ( ) * , - . / │ │ 48-57 │ 0-9数字 │ │ 58-64 │ : ; ? │ │ 65-90 │ A-Z大写字母 │ │ 91-96 │ [ \ ] ^ _ │ │ 97-122 │ a-z小写字母 │ │ 123-127 │ { | } ~ DEL删除 │ └───────────────┴─────────────────────────────────────────────┘特点只支持英文字母、数字、标点符号无法表示中文、日文、韩文等非英语字符Python 示例# 字符 ↔ ASCII 码转换 print(ord(A)) # 65 print(chr(65)) # A print(ord(0)) # 48 print(chr(97)) # a二、ASCII 的局限多语言无法兼容ASCII 只用了 7 位而计算机存储的基本单位是字节8 位多出来的 1 位是空闲的。于是各国开始用这多出来的一位来定义自己的编码编码语言说明GB2312/GBK中文中国国家标准Shift-JIS日文日本标准EUC-KR韩文韩国标准问题同一个 0x80-0xFF 字节在不同国家编码中代表不同字符 →乱码不同语言编码互不兼容 →无法混合使用三、Unicode统一所有字符的万国码Unicode的目标是统一世界上所有文字为每一个字符分配一个唯一的编号码点Code Point。相关概念1. 码点Code Point每一个字符对应的唯一数字编号。┌─────────────────────────────────────────────────────────────┐ │ Unicode 码点示例 │ ├─────────────────────────────────────────────────────────────┤ │ A → U0041 │ │ 中 → U4E2D │ │ → U1F60A │ │ DŽ → U01C4 │ └─────────────────────────────────────────────────────────────┘2. 平面PlaneUnicode 目前有 17 个平面每个平面包含 65536 个码点。平面范围内容BMP基本多文种平面U0000 ~ UFFFF最常用字符含中文、英文、常用符号辅助平面U10000 ~ U10FFFF生僻字、Emoji如 3. 编码方式UTF-8、UTF-16、UTF-32Unicode 只是给字符分配了编号还需要规定这个编号在计算机中如何存储这就是UTF-8、UTF-16、UTF-32。编码可变长特点适用场景UTF-8是1-4 字节兼容 ASCII节省空间互联网标准最常用UTF-16是2 或 4 字节对中文等较紧凑Windows、Java 内部UTF-32否4 字节固定长度处理快内存大、处理方便的场景UTF-8 的编码规则┌─────────────────────────────────────────────────────────────┐ │ UTF-8 编码规则 │ ├───────────────┬─────────────────────────────────────────────┤ │ 码点范围 │ UTF-8 字节序列 │ ├───────────────┼─────────────────────────────────────────────┤ │ U0000 ~ U007F│ 0xxxxxxx1字节兼容 ASCII │ │ U0080 ~ U07FF│ 110xxxxx 10xxxxxx2字节 │ │ U0800 ~ UFFFF│ 1110xxxx 10xxxxxx 10xxxxxx3字节 │ │ U10000~U10FFFF│ 11110xxx 10xxxxxx 10xxxxxx 10xxxxxx4字节│ └───────────────┴─────────────────────────────────────────────┘Python 示例# 字符 → Unicode 码点 print(hex(ord(A))) # 0x41 print(hex(ord(中))) # 0x4e2d # 码点 → 字符 print(chr(0x4E2D)) # 中 print(chr(0x1F60A)) # # UTF-8 编码 print(中.encode(utf-8)) # b\xe4\xb8\xad print(中.encode(utf-8).hex()) # e4b8ad四、ASCII 和 Unicode 的关系ASCII 是 Unicode 的真子集ASCII 的 0-127 个字符在 Unicode 中的码点相同也是 U0000 ~ U007FUTF-8 编码中ASCII 字符占 1 字节完全兼容 ASCII所以很多文本文件看不出区别。五、其他场景建议内部处理使用 Unicode 字符串Python 3 默认网络传输/文件存储使用UTF-8编码打开文件指定encodingutf-8HTTP 响应设置Content-Type: text/html; charsetutf-8数据库连接字符集设置为utf8mb4MySQL或UTF-8PostgreSQLPython 示例# 写入 UTF-8 文件 with open(file.txt, w, encodingutf-8) as f: f.write(Hello 世界 ) # 读取 UTF-8 文件 with open(file.txt, r, encodingutf-8) as f: content f.read() print(content)概念说明ASCII7 位编码128 个字符仅支持英文Unicode统一字符集为每个字符分配唯一码点UTF-8Unicode 的存储方式变长编码兼容 ASCIIPython 3字符串默认使用 Unicode其实ASCII 是过去时而Unicode 是现在时UTF-8 是通用存储格式。 在 Python 3 中字符串默认就是 Unicode读写文件时记得指定encodingutf-8。