|
|
1
20
不幸的是,无法通过查看文件本身来确定文件的编码。这是一个通用问题,不局限于Python或任何特定的文件系统。 如果您正在读取一个XML文件,文件中的第一行 可以 给你一个编码是什么的提示。 否则,您将不得不使用一些基于启发式的方法,如 chardet (其他答案中给出的解决方案之一)试图通过检查文件中原始字节格式的数据来猜测编码。如果您使用的是Windows,我相信Windows API还公开了一些方法,尝试根据文件中的数据猜测编码。 |
|
|
2
9
您可以使用物料清单( http://en.wikipedia.org/wiki/Byte_order_mark )要检测编码,或尝试此库: |
|
3
4
下面是一个小片段,帮助您猜测编码。它在Latin1和utf8之间的猜测相当好。它将字节字符串转换为Unicode字符串。
|
|
|
4
3
有 Unicode Dammit 从 Beautiful Soup ,它使用 chardet 但是增加了一些额外的功能。 它试图从XML或HTML文件内部读取编码。然后它尝试在文件的开头查找一个BOM或类似的东西。如果不能做到这一点,它就利用 查德特 . |
|
|
5
1
|
|
|
stack programming · 如何将损坏的文本恢复为阿拉伯语 2 年前 |
|
|
FoolishMortal · 无法显示从基64字符串解码的特定图像 2 年前 |
|
|
xchrisbradley · 使用Zig签名对功能选择器进行编码 2 年前 |
|
|
dax · 运行长度编码给出错误的结果 2 年前 |
|
Ben · 内存中的Python GZIP在现有文件上 2 年前 |
|
|
GoodCat · 如何将这64行缩短4个字符? 2 年前 |