Advertisement

python爬虫编码彻底解决问题

阅读量:

目录

    • 目录
      • 编码机制及其差异

      • 编码与解码过程

      • 获取中文百度首页内容

        • 首要步骤:
        • 次要步骤:
        • 第三阶段:
      • BeautifulSoup库应用

      • 引用文献

编码原理与差异分析

  • 第一阶段 :编码的起源:众所周知,计算机的原始语言是英语,而英语由26个字母构成。因此,在早期阶段,计算机字符编码主要依赖ASCII系统进行设定,该系统目前仍是应用最广泛的单字节编码方案。它通过7位二进制数来表达所有字母、数字、标点符号以及一些特殊控制字符,并作为美国的编码标准被广泛采用。

    • 第二阶段 :随着计算机技术的不断推广和应用范围的扩大,设备开始进入全球各个国家和地区。然而,这种跨地域的应用很快暴露出诸多不适应的问题。例如,中国用户就对此表示不满:为什么不能让计算机支持中文呢?但ASCII编码即便竭尽所能也只能覆盖256个字符,显然无法满足中文字符的需求。

    因此,Unicode编码应运而生。Unicode通常采用两个字节进行表示,总共能够涵盖256×256个字符数量,即所谓的UCS-2格式。对于一些较为罕见的文字,则可能需要使用四个字节来表达,即UCS-4形式。Unicode在设计上保持了与ASCII的兼容性。

    • **第三阶

全部评论 (0)

还没有任何评论哟~