|
1
4
任何给定的Unicode字符串在UTF-8中都只有一个表示形式。 我认为这里的困惑在于Unicode中有多种方法可以得到相同的结果 视觉的 某些语言的输出。更不用说Unicode有几个没有可视表示的字符。 但这与UTF-8无关,它本身就是Unicode的一个属性。将给定的Unicode编码为UTF-8是一个纯机械的过程,而且是完全可逆的。 |
|
|
2
3
正如John已经说过的,只有一个标准符合UTF-8表示。 但棘手的一点是“符合标准”。 由于代理项,旧的编码器通常无法正确转换UTF-16。 Java是那些不一致转换器的一个显著例子(它将生成两个3字节序列,而不是一个4字节序列)。 MySQL直到最近才出现问题,我也不确定当前的状态。 现在,您只会遇到需要代理的代码点的问题,这意味着在U+FFFF之上。如果应用程序长时间没有使用Unicode,则意味着您不需要移动这样的“深奥”字符:-) 但从一开始就把事情做好是好事。 尝试使用符合标准的编码器,你会没事的。 |
|
|
Boltu · pandas从url返回的值是什么? 1 年前 |
|
|
trystine · 试图运行CausalNex错误UnicodeEncodeError:“charmap”编解码器无法对位置263607-263621中的字符进行编码:字符映射到<undefined> 2 年前 |
|
|
Danny Coleiro · 向文本字符串添加不可见字符 2 年前 |