摘要 :一般遇到 MySQL 数据库卡顿问题时,都会用到 show [full] processlist 命令来查看当前 MySQL 数据库的状态,然后结合 kill 和 explain 命令来具体分析和解决问题。

一般遇到 MySQL 数据库卡顿问题时,都会用到 show [full] processlist 命令来查看当前 MySQL 数据库的状态,包括并发线程(连接)数,正在执行什么查询,查询耗时多久,是否有锁等待等。

当发现某些线程(连接)有问题(比如执行时间(Time)非常长)时,可以使用 kill 命令断开连接,这样可以临时解决一些突发问题。

由于show processlist命令只是一个当前快照,所以每次执行都可能结果不一样,有时候一两次快照看不出什么问题,需要多执行几次看看。

mysql> show processlist;
+-----+------+-----------+------+---------+------+-------+------------------+
| Id  | User | Host      | db   | Command | Time | State | Info             |
+-----+------+-----------+------+---------+------+-------+------------------+
| 108 | root | localhost | NULL | Query   |    0 | NULL  | show processlist |
+-----+------+-----------+------+---------+------+-------+------------------+
1 row in set (0.00 sec)

普通用户执行show processlist只能显示当前登录用户正在运行的线程,但是 root 用户或者被赋予 PROCESS 权限的用户,则能看到所有用户正在运行的线程。

show processlist显示的信息都是来自 MySQL 系统表information_schema.processlist。所以使用下面的查询语句可以获得相同的结果:

mysql> select * from information_schema.processlist;
+-----+------+-----------+------+---------+------+-----------+----------------------------------------------+
| ID  | USER | HOST      | DB   | COMMAND | TIME | STATE     | INFO                                         |
+-----+------+-----------+------+---------+------+-----------+----------------------------------------------+
| 108 | root | localhost | NULL | Query   |    0 | executing | select * from information_schema.processlist |
+-----+------+-----------+------+---------+------+-----------+----------------------------------------------+
1 row in set (0.00 sec)

常用定位问题的 SQL 语句

查证哪个客户端连接数最多

按客户端 IP 分组,看哪个客户端的链接数最多:

select
    client_ip,
    count(client_ip) as client_num
from (
    select
        substring_index(host, ':', 1) as client_ip
    from
        information_schema.processlist
) as t
group by
    client_ip
order by
    client_num desc
;

看那些语句执行时间最长

按 Time 倒排序查看正在执行的线程,看看有没有执行时间特别长的线程:

select
    *
from
    information_schema.processlist
where
    Command != 'Sleep'
order by
    Time desc
;

生成慢查询 kill 语句

上面提到可以通过 kill 线程 ID 来杀掉卡住的线程,那么如果线程很多,需要一个一个来 kill 么?答案是不,下面的语句可以用来生成需要的 kill 语句:

找出所有执行时间超过 5 分钟的线程,拼凑出 kill 语句:

select
    concat('kill ', id, ';')
from
    information_schema.processlist
where
    Command != 'Sleep' and Time > 5 * 60
order by
    Time desc
;

一些常见的问题

CPU 报警

很可能是 SQL 里面有较多的计算导致。

连接数超高

很可能是有慢查询,然后导致很多的查询在排队,排查问题的时候可以看到” 事发现场 “类似的 SQL 语句一大片。导致慢查询一般是没有索引或者索引不好使,可以用explain分析一下 SQL 语句。

show processlist 各字段含义

各个字段的含义如下:

  • Id: 线程的唯一标识,当这个线程有问题时,可以 kill <Id> 将它杀掉。
  • User: 启动这个线程的用户。
  • Host: 客户端 IP 和端口号。结合 ss -n | grep :<port> 命令,可以定位到是哪个进程发送的请求。
  • DB: 当前执行的命令是在哪个数据库。如果没有指定数据库,则为 NULL。
  • Command: 正在执行的命令。详见下文。
  • Time: 处于当前状态的时间。
  • State: 线程的状态,和 Command 对应,详见下文。
  • Info: 正在执行的语句或 NULL。默认显示前 100 个字符,使用 show full processlist 查看完整语句。

Command的取值 参考官方文档 ,简单介绍如下:

  • Binlog Dump: 主节点正在将二进制日志,同步到从节点
  • Change User: 正在执行一个 change-user 的操作
  • Close Stmt: 正在关闭一个 Prepared Statement 对象(预编译语句,JDBC 支持此类型 SQL)
  • Connect: 一个从节点连上了主节点
  • Connect Out: 一个从节点正在连主节点
  • Create DB: 正在执行一个 create-database 的操作
  • Daemon: 服务器内部线程,而不是来自客户端的链接
  • Debug: 线程正在生成调试信息
  • Delayed Insert: 该线程是一个延迟插入的处理程序
  • Drop DB: 正在执行一个 drop-database 的操作
  • Execute: 正在执行一个 Prepared Statement
  • Fetch: 正在从 Prepared Statement 中获取执行结果
  • Field List: 正在获取表的列信息
  • Init DB: 该线程正在选取一个默认的数据库
  • Kill: 正在执行 kill 语句,杀死指定线程
  • Long Data: 正在从 Prepared Statement 中检索 long data
  • Ping: 正在处理 server-ping 的请求
  • Prepare: 该线程正在准备一个 Prepared Statement
  • ProcessList: 该线程正在生成服务器线程相关信息
  • Query: 该线程正在执行一个语句
  • Quit: 该线程正在退出
  • Refresh:该线程正在刷表,日志或缓存;或者在重置状态变量,或者在复制服务器信息
  • Register Slave:正在注册从节点
  • Reset Stmt: 正在重置 Prepared Statement
  • Set Option: 正在设置或重置客户端的 statement-execution 选项
  • Shutdown: 正在关闭服务器
  • Sleep: 正在等待客户端向它发送执行语句
  • Statistics: 该线程正在生成 server-status 信息
  • Table Dump: 正在发送表的内容到从服务器
  • Time: 未使用

State的取值 参考官方文档

该命令中最关键的就是 State 列,主要状态有以下几种:

  • Checking table

    正在检查数据表(这是自动的)。

  • Closing tables

    正在将表中修改的数据刷新到磁盘中,同时正在关闭已经用完的表。这是一个很快的操作,如果不是这样的话,就应该确认磁盘空间是否已经满了或者磁盘是否正处于重负中。

  • Connect Out

    复制从服务器正在连接主服务器。

  • Copying to tmp table on disk

    由于临时结果集大于 tmp_table_size,正在将临时表从内存存储转为磁盘存储以此节省内存。

  • Creating tmp table

    正在创建临时表以存放部分查询结果。

  • deleting from main table

    服务器正在执行多表删除中的第一部分,刚删除第一个表。

  • deleting from reference tables

    服务器正在执行多表删除中的第二部分,正在删除其他表的记录。

  • Flushing tables

    正在执行 FLUSH TABLES,等待其他线程关闭数据表。

  • Killed

    发送了一个 kill 请求给某线程,那么这个线程将会检查 kill 标志位,同时会放弃下一个 kill 请求。MySQL 会在每次的主循环中检查 kill 标志位,不过有些情况下该线程可能会过一小段才能死掉。如果该线程程被其他线程锁住了,那么 kill 请求会在锁释放时马上生效。

  • Locked

    被其他查询锁住了。

  • Sending data

    正在处理 SELECT 查询的记录,同时正在把结果发送给客户端。

  • Sorting for group

    正在为 GROUP BY 做排序。

  • Sorting for order

    正在为 ORDER BY 做排序。

  • Opening tables

    这个过程应该会很快,除非受到其他因素的干扰。例如,在执 ALTER TABLE 或 LOCK TABLE 语句行完以前,数据表无法被其他线程打开。正尝试打开一个表。

  • Removing duplicates

    正在执行一个 SELECT DISTINCT 方式的查询,但是 MySQL 无法在前一个阶段优化掉那些重复的记录。因此,MySQL 需要再次去掉重复的记录,然后再把结果发送给客户端。

  • Reopen table

    获得了对一个表的锁,但是必须在表结构修改之后才能获得这个锁。已经释放锁,关闭数据表,正尝试重新打开数据表。

  • Repair by sorting

    修复指令正在排序以创建索引。

  • Repair with keycache

    修复指令正在利用索引缓存一个一个地创建新索引。它会比 Repair by sorting 慢些。

  • Searching rows for update

    正在讲符合条件的记录找出来以备更新。它必须在 UPDATE 要修改相关的记录之前就完成了。

  • Sleeping

    正在等待客户端发送新请求,这个状态比较常见,一般是正常情况。

  • System lock

    正在等待取得一个外部的系统锁。如果当前没有运行多个 mysqld 服务器同时请求同一个表,那么可以通过增加 --skip-external-locking 参数来禁止外部系统锁。

  • Upgrading lock

    INSERT DELAYED 正在尝试取得一个锁表以插入新记录。

  • Updating

    正在搜索匹配的记录,并且修改它们。

  • User Lock

    正在等待 GET_LOCK ()。

  • Waiting for tables

    该线程得到通知,数据表结构已经被修改了,需要重新打开数据表以取得新的结构。然后,为了能的重新打开数据表,必须等到所有其他线程关闭这个表。以下几种情况下会产生这个通知:FLUSH TABLES tbl_name, ALTER TABLE, RENAME TABLE, REPAIR TABLE, ANALYZE TABLE, 或 OPTIMIZE TABLE。

  • waiting for handler insert

    INSERT DELAYED 已经处理完了所有待处理的插入操作,正在等待新的请求。 大部分状态对应很快的操作,只要有一个线程保持同一个状态好几秒钟,那么可能是有问题发生了,需要检查一下。 还有其他的状态没在上面中列出来,不过它们大部分只是在查看服务器是否有存在错误是才用得着。

参考资料