Python处理中文语言:读取和解析中文文本
发布时间
阅读量:
阅读量
本研究涉及的处理任务:
1、引入中文格式的txt文件,并将其编码形式转换为unicode标准
2、引入包含中文字符的py文件
-----------------------------------针对第一项任务:引入中文txt文件并完成unicode编码转换-----------------------------------
基础概念界定
1、Unicode、UTF-8
从基础层面理解,Unicode是一种用于统一处理各类非英文语言字符的编码体系,其核心在于为不同语言中的每一个文字分配唯一的数字标识,从而有效防止字符混淆。目前,Unicode已涵盖全球主要语言,并拥有超过一百万项独立编码。UTF-8则是实现Unicode编码标准的一种具体技术方案。与Unicode不同,ASCII是另一种专门针对英文字符设计的编码方式。如需进一步了解,可参考相关文献1。
2、Encoding
Encoding指的是将文本信息按照特定规则转换为数字序列的一整套操作过程。
核心代码 :
string.decode(*encoding*) # from <type 'str'> to <type 'unicode'>
unicode.encode(*encoding*) # from
全部评论 (0)
还没有任何评论哟~
