|
|
1
6
我猜您正在处理一个原始的UTF-8编码字符串。你还没有展示你是怎么得到它的,也没有说你为什么要这么做。一个小而完整的演示程序可以帮助人们发现问题,它展示了你如何获得输入、如何更改输入以及最终抱怨的内容。如果你把这个小演示程序加到你的问题中,我可能会给出更好(甚至不同)的答案。 非中断空间的代码编号为U+00A0。在UTF-8下,它编码为两个八位字节\xC2和\xA0。所有代码在U+007F以上的东西在UTF-8下都有一个多八位组编码。U+007F下的所有内容实际上都是ASCII,所以ASCII就像UTF-8一样工作。
如果你有UTF-8编码的文本和不间断的空间,只删除
当你使用character类时
如果您有UTF-8编码文本,请将其读作UTF-8:
读取数据后,不要担心编码。使用代码编号,Perl就会知道答案。或者使用代码名,让未来的程序员不必查找字符就知道你在做什么:
完成后,将其写成UTF-8文本:
最新的 Learning Perl 背面有一个Unicode入门,涵盖了很多内容。 祝你好运 |
|
|
DotFX · RegEx捕获关键字前但括号后的所有内容 1 年前 |
|
|
Andrus · 如何在sql中查找第二个匹配项 1 年前 |
|
|
iato · 确保正则表达式不从命名材料中的数字中提取 1 年前 |
|
|
vr8ce · 非成对标记中特定字符的正则表达式 1 年前 |
|
|
MARTIN · 交换第一个和最后一个单词,反转所有中间的字符 1 年前 |
|
|
Carsten · 使用最近的搜索模式更改文本块 1 年前 |