php计算中英文混合或中文字符串的字数

php的strlen和mb_strlen用于统计字符个数。中英文混合的字符串中的中文字符则没有统计进来。所以得自己另想方法统计中英文混合的字符串的字数。以下是我的方法:
先用正则表达式把所有中文替换为空格,就可以用strlen()统计总字数了,总字数就是中文字数与英文字数的总和。
这里的讨论都是在utf-8编码情况下。
统计中文字数并把所有中文替换为空格的正则表达式:

preg_replace(‘/[\x80-\xff]{3}/’, ‘ ‘, $str, -1);

上面的正则表达式基于这样的假设:所以中文字符的utf-8都占3个字节。网上有人说:并不是所有utf-8中文都是3个字节,在0080 – 07FF码段为2字节,在0800 – FFFF码段为3字节。那么是不是用preg_replace(‘/[\x80-\xff]{1,3}/’, ‘ ‘, $str,-1)更合适?
归结起来,统计字符串中英文字数的示例:

$str = 'I am a 中国人!'; 
$str = preg_replace('/[\x80-\xff]{1,3}/', ' ', $str, -1); 
$num = strlen($str);

变量$num的值即为总字数,本例$num的值为11。这种做法,中文标点符号(所有中文特殊符号)也是算在内的。

C++中sizeof()与strlen()的区别

        终于把Assignment 2做完了,在收尾阶段,遇到了要算char[]类型的长度的问题,我一开始用了sizeof(),后来发现不对,忽然想起来strlen(),用上就对了。其间,我还编了个程序实验了一下,发现这两个函数的区别。

#include
using namespace std;
void main()
{
char st[8];
strcpy(st,"good");
cout<<"sizeof:"<<sizeof(st)<<endl;
cout<<"strlen:"<<strlen(st)<<endl;
system("pause");
}

结果为:

  

 

这就说明sizeof()是计算分配给数组的长度的,因此结果是8;而strlen()是计算数组里装有数据的长度,所以结果是4。

       因此,如果我们要计算一个字符数组的长度的时候,应该使用strlen()函数。