并行复制相关线程

在MySQL 5.6并行复制中,当设置set global slave_parallel_workers=2时,共有4个复制相关的线程,如下:

+----+-------------+------+-------+---------+------+------------------------------------------------------------------+------+
| ID | USER | HOST | DB | COMMAND | TIME | STATE | INFO |
+----+-------------+------+-------+---------+------+------------------------------------------------------------------+------+
| 23 | system user | | NULL | Connect | 3 | Waiting for master to send event | NULL |
| 24 | system user | | mysql | Connect | 3 | Slave has read all relay log; waiting for the slave I/O thread t | NULL |
| 25 | system user | | NULL | Connect | 3 | Waiting for an event from Coordinator | NULL |
| 26 | system user | | NULL | Connect | 3 | Waiting for an event from Coordinator | NULL |
+----+-------------+------+-------+---------+------+------------------------------------------------------------------+------+

其中第一个为IO线程,负责从主库拉取binlog到备库并存为relay log;
第二个为分发线程,负责解析relay log,并将解析后的事件分发给worker线程处理;
其余两个为worker线程负责处理分发后的事件,类型非并行复制时的sql线程。

并行复制并发策略

目前MySQL(改进版)并行复制是以表级别进行分发的,即同一时刻,同一个表相关的操作只能在同一个worker线程中进行。

考虑两个事务,分别对表进行insert

trx1:
begin;
insert into t1 values(1);
comit; trx2:
begin;
insert into t2 values(1);
comit;

那么这两个事务可能分别在两个worker中并行执行。

有些特殊情会影响worker的并发执行:

  • 并行退化为串行的情况

    • DDL语句串行处理(RDS MySQL正在优化DDL并行处理)
    • binlog切换事件需串行处理
    • 有外键关系的表需串行处理
  • 并行等待的情况

当一个事务中包含多个表时,如下:

trx3:
begin;
insert into t1 values(3);
insert into t2 values(3);
comit;

如果当前worker1正在执行t1相关的事务,worker2正在执行t2相关的事务,那么分发线程在分发trx3的t2的事件时必须等待worker2的t2相关的事务执行完成。

并行复制worker分配

假设,worker线程正在执行的情况如下:

worker 1: trx1: insert t1
worker 2: trx2: insert t2; trx3: insert t3;

然后分发线程再来一个事务trx4:

trx4: insert t4;

分发线程该分配给哪个worker呢?

分配线程分配会分配给最空闲的worker(get_least_occupied_worker);

这里最空闲是指worker当前正在执行的事务涉及的表数越少越空闲。

worker1正在执行的事务涉及的表数为1,而worker2正在执行的事务涉及的表数为2,因此trx4会分配为worker1;

表和worker存在一一对应关系,为了快速找到表对应的worker,哈希表(mapping_db_to_worker)存储了这种映射关系。同时为了控制哈希表过大导致占用较多内存或哈希冲突,系统严格控制了哈希表的大小,不能超过16(硬编码mts_partition_hash_soft_max),当超过16时,会将当前没有执行的表从哈希表驱逐出去。

在表较多情况下,哈希表大小设为16显得过小,可能会频繁驱逐表,频繁新建哈希键值对的情况。

优化

  1. 表级并行复制下,哈希表的大小16(硬编码mts_partition_hash_soft_max)过小,应设为动态可调;
  2. 分配线程分配会分配给最空闲的worker(get_least_occupied_worker)

考虑如下情况:

worker 1: t1 1000个事务
worker 2: t2 10个事务 t3 10 个事务

当前worker1比worker2要繁忙,而按照当前正在执行的事务涉及的表数越少越空闲的原则,新来的事务(比如insert t4)会分配给worker1,这是不合理的。
因此,空闲的标准应改为当前正在执行的事务数越少越空闲,这样新来的事务会分配给worker2。

最新文章

  1. seajs封装js方法
  2. DocOptimizer 0.9.0 Beta Released
  3. oracle导入导出数据库和创建表空间和用户
  4. 【Newtonsoft.Json】Window Phone Json解析开发包
  5. ACM1995
  6. java多线程 join方法以及优先级方法
  7. 在Silverlight中使用async/await
  8. 【Android - MD】之RecyclerView的使用
  9. mybatis入门-框架原理
  10. js中的函数
  11. AppiumDesktop用法介绍
  12. HashSet和CopyOnWriteArraySet
  13. Spring Boot + Jersey发生FileNotFoundException (No such file or directory)
  14. 【转】HashMap集合中key只能为引用数据类型,不能为基本类型
  15. Windows7下安装、部署Weblogic和发布war项目
  16. 最大流当前弧优化Dinic分层模板
  17. Failure to transfer org.apache.maven:maven-archiver:pom:2.5 from https://repo.maven.apache.org/maven2 was cached in the local repository, resolution will not be reattempted until the update interval o
  18. InnoDB存储引擎介绍-(4)Checkpoint机制一
  19. 已知一个函数rand7()能够生成1-7的随机数,请给出一个函数rand10(),该函数能够生成1-10的随机数。
  20. Summary: Difference between null and empty String

热门文章

  1. Ms sql 2000互转2005
  2. tp框架 中的时间 查询范围
  3. java学习第9天
  4. Hadoop MapReduce编程 API入门系列之压缩和计数器(三十)
  5. redis 安装使用
  6. form表单中的常用控件
  7. C#的 构造函数 和 方法重载
  8. [题解]hdu 1009 FatMouse' Trade(贪心基础题)
  9. iconv命令 gbk 转 UTF-8
  10. CSS3--选择器