Advertisement

Python处理中文语言:读取和解析中文文本

阅读量:

本研究涉及的处理任务:

1、引入中文格式的txt文件,并将其编码形式转换为unicode标准

2、引入包含中文字符的py文件

-----------------------------------针对第一项任务:引入中文txt文件并完成unicode编码转换-----------------------------------

基础概念界定

1、Unicode、UTF-8

从基础层面理解,Unicode是一种用于统一处理各类非英文语言字符的编码体系,其核心在于为不同语言中的每一个文字分配唯一的数字标识,从而有效防止字符混淆。目前,Unicode已涵盖全球主要语言,并拥有超过一百万项独立编码。UTF-8则是实现Unicode编码标准的一种具体技术方案。与Unicode不同,ASCII是另一种专门针对英文字符设计的编码方式。如需进一步了解,可参考相关文献1。

2、Encoding

Encoding指的是将文本信息按照特定规则转换为数字序列的一整套操作过程。

核心代码

复制代码
 string.decode(*encoding*)   # from <type 'str'> to <type 'unicode'>

    
 unicode.encode(*encoding*)   # from 

全部评论 (0)

还没有任何评论哟~