Advertisement

有了Unicode, 为什么还需要UTF-8?

阅读量:

为何Unicode存在仍需UTF-8

要解答这个问题,必须深入理解“编码”的概念。恰好看到技术专家阮一峰撰写的相关文章:字符编码笔记:ASCII,Unicode 和 UTF-8

摘录如下,便于查阅:

一、ASCII码

我们了解,计算机内部所有信息最终都以二进制形式呈现。每个二进制位(bit)有两种状态,即0和1,因此八个二进制位可以组合出256种状态,这被称为一个字节(byte)。换句话说,一个字节可以表示256种不同的状态,每种状态对应一个符号,共计256个符号,从00000000到11111111。

上世纪60年代初,美国制定了一套字符编码标准,对英语字符与二进制之间的映射关系进行了统一规定。这被称为ASCII码,并沿用至今。

ASCII码总共定义了128个字符的编码方式。例如空格SPACE对应的数值是32(二进制为00100000),大写字母A对应的数值是65(二进制为01000001)。这些共计128个符号(包括32个不可打印的控制符)仅使用了一个字节中的后七位,而最前面的一位统一设定为零。

二、非ASCII编码

对于英语而言,使用128个符号已足够表达需求。然而其他语言则需要更多字符。比如法语

全部评论 (0)

还没有任何评论哟~