MySQL

MySQL 知识量:16 - 40 - 165

14.1 字符集和校对顺序><

字符集和校对顺序- 14.1.1 -

涉及多种语言和字符集时,会遇到以下重要的术语:

  • 字符集:字母和符号的集合。

  • 编码:某个字符集成员的内部表示。

  • 校对:规定字符如何比较的指令(通常用于排序)。

不同的语言和字符集需要以不同的方式存储和检索,MySQL为此设计了不同的字符集来适应不同的排序和检索数据的方法。

使用字符集和校对顺序- 14.1.2 -

要查看MySQL支持的字符集,可以使用以下语句:

show character set;

查询结果可能为:

+----------+---------------------------------+---------------------+--------+
| Charset  | Description                     | Default collation   | Maxlen |
+----------+---------------------------------+---------------------+--------+
| big5     | Big5 Traditional Chinese        | big5_chinese_ci     |      2 |
| dec8     | DEC West European               | dec8_swedish_ci     |      1 |
| cp850    | DOS West European               | cp850_general_ci    |      1 |
| hp8      | HP West European                | hp8_english_ci      |      1 |
| koi8r    | KOI8-R Relcom Russian           | koi8r_general_ci    |      1 |
| latin1   | cp1252 West European            | latin1_swedish_ci   |      1 |
| latin2   | ISO 8859-2 Central European     | latin2_general_ci   |      1 |
| swe7     | 7bit Swedish                    | swe7_swedish_ci     |      1 |
| ascii    | US ASCII                        | ascii_general_ci    |      1 |
| ujis     | EUC-JP Japanese                 | ujis_japanese_ci    |      3 |
| sjis     | Shift-JIS Japanese              | sjis_japanese_ci    |      2 |
| hebrew   | ISO 8859-8 Hebrew               | hebrew_general_ci   |      1 |
| tis620   | TIS620 Thai                     | tis620_thai_ci      |      1 |
| euckr    | EUC-KR Korean                   | euckr_korean_ci     |      2 |
| koi8u    | KOI8-U Ukrainian                | koi8u_general_ci    |      1 |
| gb2312   | GB2312 Simplified Chinese       | gb2312_chinese_ci   |      2 |
| greek    | ISO 8859-7 Greek                | greek_general_ci    |      1 |
| cp1250   | Windows Central European        | cp1250_general_ci   |      1 |
| gbk      | GBK Simplified Chinese          | gbk_chinese_ci      |      2 |
| latin5   | ISO 8859-9 Turkish              | latin5_turkish_ci   |      1 |
| armscii8 | ARMSCII-8 Armenian              | armscii8_general_ci |      1 |
| utf8     | UTF-8 Unicode                   | utf8_general_ci     |      3 |
| ucs2     | UCS-2 Unicode                   | ucs2_general_ci     |      2 |
| cp866    | DOS Russian                     | cp866_general_ci    |      1 |
| keybcs2  | DOS Kamenicky Czech-Slovak      | keybcs2_general_ci  |      1 |
| macce    | Mac Central European            | macce_general_ci    |      1 |
| macroman | Mac West European               | macroman_general_ci |      1 |
| cp852    | DOS Central European            | cp852_general_ci    |      1 |
| latin7   | ISO 8859-13 Baltic              | latin7_general_ci   |      1 |
| utf8mb4  | UTF-8 Unicode                   | utf8mb4_general_ci  |      4 |
| cp1251   | Windows Cyrillic                | cp1251_general_ci   |      1 |
| utf16    | UTF-16 Unicode                  | utf16_general_ci    |      4 |
| utf16le  | UTF-16LE Unicode                | utf16le_general_ci  |      4 |
| cp1256   | Windows Arabic                  | cp1256_general_ci   |      1 |
| cp1257   | Windows Baltic                  | cp1257_general_ci   |      1 |
| utf32    | UTF-32 Unicode                  | utf32_general_ci    |      4 |
| binary   | Binary pseudo charset           | binary              |      1 |
| geostd8  | GEOSTD8 Georgian                | geostd8_general_ci  |      1 |
| cp932    | SJIS for Windows Japanese       | cp932_japanese_ci   |      2 |
| eucjpms  | UJIS for Windows Japanese       | eucjpms_japanese_ci |      3 |
| gb18030  | China National Standard GB18030 | gb18030_chinese_ci  |      4 |
+----------+---------------------------------+---------------------+--------+

要查看MySQL支持的校对规则,可以使用以下语句:

show collation;

以上查询的结果可能有200多行,说明了适用的字符集、是否属默认设置等信息。

MySQL通常在安装时就定义了一个默认的字符集和校对,可以使用以下语句查看:

show variables like 'character%';
show variables like 'collaction%';

查询默认字符集的结果可能为:

+--------------------------+----------------------------------+
| Variable_name            | Value                            |
+--------------------------+----------------------------------+
| character_set_client     | utf8                             |
| character_set_connection | utf8                             |
| character_set_database   | utf8                             |
| character_set_filesystem | binary                           |
| character_set_results    | utf8                             |
| character_set_server     | utf8                             |
| character_set_system     | utf8                             |
| character_sets_dir       | D:\AppServ\MySQL\share\charsets\ |
+--------------------------+----------------------------------+

MySQL可以在服务器、数据库、表、甚至列上面设置字符集和校对规则。一般情况下,MySQL使用以下方法确定使用哪个字符集和校对规则:

  • 如果指定character set和collate两者,则使用这些值。

  • 如果只指定character set,则使用此字符集及其默认的校对。

  • 如果既不指定character set,也不指定collate,则使用数据库的默认设置。

以下是一个在创建表时设置字符集和校对规则的示例:

create table cc(
       id   int(11)      not null primary key auto_increment,
       name varchar(255) not null character set gbk collate gbk_chinese_ci,
       age  int(11)      not null
)default character set utf8 collate utf8_bin

以上SQL语句中,分别在表级和列级定义了字符集和校对规则。

通常情况下,一种字符集会对应多种校对规则,其中一种为默认校对。即使在定义表时规定了使用哪种校对规则,也可以在查询时使用该字符集对应的其他校对规则进行排序,例如:

select * from cc order by name collate gbk_bin;

以上SQL查询没有使用name列定义的gbk_chinese_ci校对规则进行排序,而是临时使用字符集gbk另一种校对规则gbk_bin进行排序。

除了order by子句外,collate也可以用于group by、having、聚集函数和别名等。如果需要,可以使用cast()或convert()函数,将字符串在不同字符集之间进行转换。