MySql中UTF8和GBK编码中⽂字符长度问题
为什么要了解MySql中UTF8 和 GBK 编码中⽂字符长度呢?举个例⼦,在oracle中⽤utf8 字段中⽂长度为1的话,需要char(3),mysql中则是char(1),如果你按照oracle的做法去创建mysql字段,是不是在mysql表中创建的长度⼤⼩与⾃⼰锁想的不⼀样呢,所以这个⼩知识点还是有必要了解的。
我在经过实验后得到以下结论(适⽤MySQL 5.0以上版本):
1.⼀个汉字占多少长度与编码有关:
UTF-8:⼀个汉字=3个字节
GBK:⼀个汉字=2个字节
2.在MySQL中 varchar(n)和char(n)表⽰n个字符,⽆论汉字和英⽂,Mysql都能存⼊n个字符,仅是实际字节长度有所区别
即 MySQL 并不会对超过长度的字符报错,⽽是直接截断了. 并且 char(2) 和 varchar(2) 都能存储 2个汉字,或者是两个英⽂字符.
3. MySQL 的 char(n) 和varchar(n) 可以直接存储 n 个汉字. ⽽不是 n/3或者 n/2 个,mysql 屏蔽了具体的存储细节,⽽直接以实际字符的个数来决定char 存储的个数
提⽰:MySQL检查长度,可⽤SQL语⾔:
select LENGTH(fieldname) from tablename 和 select CHAR_LENGTH(fieldname) from tablename 来查看
说明:LENGTH 输出的结果是 字符实际长度的,⽽ CHAR_LENGTH输出的则是屏蔽了字符存储细节,是实际的字符个数!
注:在涉及中⽂环境下的php+mysql组合,最好是⽤ mb_strlen来检测字符长度, ⽽在mysql 中,使⽤ CHAR_LENGTH来检测字符长度,这样能做到中英⽂统⼀处理.
php中strlen和mb_strlen,count的区别:
strlen 计算字符串长度,⼀个中⽂当2字符;mb_strlen根据它的字符编码模式,统计字符;count计算数组中的元素数⽬或对象中的属性个数
下⾯我们来验证下我们的结论是否正确:
测试⼀:
⾸先,我们先来测试⼀下 php 把⼀个汉字认作⼏个字节:
UTF8测试
<?php
header("Content-type:text/html;charset=utf-8");
$string1="字";//定义中⽂字符变量
$string2="x";//定义英⽂字符变量
//直接输出看看他们的长度
echo strlen($string1);
echo "</br>";
echo strlen($string2);
echo "</br>";
//⽤ php 多字节扩展函数 mb_strlen试试看
echo mb_strlen($string1,'utf8');
echo "</br>";
echo mb_strlen($string2,'utf8');
echo "</br>";
>
注:测试的时候请将test.php⽂件的编码也改为utf8 ,否则会出现strlen长度为2的情况,得不到正确的结果
输出:
GBK测试:
<?php
header("Content-type:text/html;charset=gbk");
$string1="字";//定义中⽂字符变量
$string2="x";//定义英⽂字符变量
//直接输出看看他们的长度
echo strlen($string1);
echo "</br>";
echo strlen($string2);
echo "</br>";
//⽤ php 多字节扩展函数 mb_strlen试试看
echo mb_strlen($string1,'gbk');
echo "</br>";
echo mb_strlen($string2,'gbk');
echo "</br>";
>
输出:
结论1.⼀个汉字占多少长度与编码有关:
UTF-8:⼀个汉字=3个字节
GBK:⼀个汉字=2个字节
测试⼆:
⾸先我们来测试UTF8
创建UTF8编码的数据库
CREATE DATABASE `testutf8` DEFAULT CHARACTER SET utf8 COLLATE utf8_general_ci;
创建utf8编码的表test
CREATE TABLE test(
varchar2最大长度txt_charchar( 2 ) NULL ,
txt_varchar varchar( 2 ) NULL
) ENGINE = MYISAM
确认表字段是否为utf8
插⼊两条记录:
INSERT INTO test(txt_char,txt_varchar) VALUES ('abcdef','uvwxyz') , ('我是测试的','测试的是我'); 插⼊结果:
创建test2表
CREATE TABLE `testutf8`.`test2` (
`txt_char` CHAR( 2 ) CHARACTER SET gbk COLLATE gbk_chinese_ci NOT NULL ,
`txt_varchar` VARCHAR( 2 ) CHARACTER SET gbk COLLATE gbk_chinese_ci NOT NULL
) ENGINE = MYISAM
确认表字段是否为gbk
插⼊两条记录:
INSERT INTO test(txt_char,txt_varchar) VALUES ('abcdef','uvwxyz') , ('我是测试的','测试的是我'); 插⼊结果:
结论⼆:
证明 mysql 并不会对超过长度的字符报错,⽽是直接截断了.
并且 char(2) 和 varchar(2) 都能存储 2个汉字,或者是两个英⽂字符.
证明 mysql 的 char(n) 可以直接存储 n 个汉字. ⽽不是 n/3 个
mysql 屏蔽了具体的存储细节,⽽直接以实际字符的个数来决定 char存储的个数
.