【Linux】gcc中__builtin_expect的作用

本文首发于 慕雪的寒舍

引入

代码学习的时候,遇到了__builtin_expect这个之前从来没有遇到过的东西,网上搜了一下,发现纯C语言实现的GCD(Grand Central Dispatch)中就有定义过这个宏

#define _safe_cast_to_long(x) \
        ({ _Static_assert(sizeof(typeof(x)) <= sizeof(long), \
                "__builtin_expect doesn't support types wider than long"); \
                (long)(x); })
#define fastpath(x) ((typeof(x))__builtin_expect(_safe_cast_to_long(x), ~0l))
#define slowpath(x) ((typeof(x))__builtin_expect(_safe_cast_to_long(x), 0l))
#define likely(x) __builtin_expect(!!(x), 1)
#define unlikely(x) __builtin_expect(!!(x), 0)

我遇到的用法类似末尾的likely和unlikely,刚开始我误解了这个宏的所用,以为它会改变判断条件的结果,但实际上并非如此。

上面源码中的likely和unlikely这两个宏的使用方式如下,其中value是一个判断条件

if(likely(value))  // 等价于 if(value) 只不过value可能为真的可能性更大。
if(unlikely(value))  // 也等价于 if(value) 只不过value可能为假的可能性更大

比如下面的这个代码,其含义是入参PTR这个指针为空的可能性很小,那么编译器就会对这里的分支判断做一定的优化,避免过度的跳转。

	if(unlikey(nullptr==PTR))	
	{ 
	   // 错误处理或者提示 
	}   									    

那这里是怎么个操作的呢?

指令作用说明

参考:__builtin_expect 总结

这个指令是gcc编译器引入的,指令的写法为:__builtin_expect(EXP, N),意思是:EXP==N的概率很大。

likely和unlikely这两个宏中使用了!!(x)是为了保证返回的结果一定是0或1,而不是一个其他无法和1/0直接比较的表达式。

#define likely(x) __builtin_expect(!!(x), 1)
#define unlikely(x) __builtin_expect(!!(x), 0)

普通分支的汇编

比如我们一个判断条件的分支语句如下所示

#include <stdio.h>
#include <stdbool.h>

void function(bool flag)
{
    if (flag)
    {
        printf("all good!\n");
    } else
    {
        perror("this is wrong!\n");
    }
}

int main()
{
    function(true);
    function(false);

    return 0;
}

那么默认情况下,编译器将这个代码编译成汇编的时候,也会按顺序进行处理。使用如下命令将test.c源文件生成出汇编文件test.s

test:test.c
	gcc -fprofile-arcs -O2 -c test.c
	objdump -d test.o

test.s中的内容如下(省略了一部分,只保留了function部分)

0000000000000000 <function>:
   0:   48 83 ec 08             sub    $0x8,%rsp
   4:   40 84 ff                test   %dil,%dil
   7:   74 27                   je     30 <function+0x30>
   9:   bf 00 00 00 00          mov    $0x0,%edi
   e:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 16 <function+0x16>
  15:   01 
  16:   e8 00 00 00 00          callq  1b <function+0x1b>
  1b:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 23 <function+0x23>
  22:   01 
  23:   48 83 c4 08             add    $0x8,%rsp
  27:   c3                      retq   
  28:   0f 1f 84 00 00 00 00    nopl   0x0(%rax,%rax,1)
  2f:   00 
  30:   bf 00 00 00 00          mov    $0x0,%edi
  35:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 3d <function+0x3d>
  3c:   01 
  3d:   e8 00 00 00 00          callq  42 <function+0x42>
  42:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 4a <function+0x4a>
  49:   01 
  4a:   48 83 c4 08             add    $0x8,%rsp
  4e:   c3                      retq   
  4f:   90                      nop

可以看到,这里是先通过je 30 <function+0x30>来判断当前flag是否为假,如果为假则跳到30处执行perror,如果不为假则继续执行callq 1b <function+0x1b>,即printf的打印。

je是一个汇编指令,和jz等价,判断的是运算结果的ZF标记位。对于ZF标记位而言,运算结果不为全0时Z=0,运算结果为全0时Z=1;所以je 30的意思是,如果运算结果为全0,则跳转到30标记处。

   0:   48 83 ec 08             sub    $0x8,%rsp
   4:   40 84 ff                test   %dil,%dil
   7:   74 27                   je     30 <function+0x30>

je之前的两个汇编指令操作解析如下:

  • sub是相减操作,使用$0x8位置的值-%rsp的结果,即$0x8 -= %rsp
  • test指令和and指令等价,是按位与操作,但test命令不会改变值,只会改变标记位。但是这里的操作是%dil自己和自己按位与,得到的结果还是他自己……没太看明白什么含义

但是,只从je本身的操作来考虑,这里的流程是这样的

  • je 跳转到30,Z=1的时候跳转到30,运算结果为全0的时候跳转到30,可以理解为flag为0的时候跳转到30(因为30处是perror的打印)
  • Z=0,运算结果不为30的时候,不跳转,继续执行printf的打印

这里为什么说30处是perror的打印呢?因为使用如下汇编命令整理出的test.s文件中可以看到更详细的过程

test:test.c
	gcc -E test.c -o test.i -O2 && \
	gcc -S test.i -o test.s -O2 

test.s可以看到,在默认情况下,通过je判断后会跳到.L2处执行perror的调用,或继续往后执行puts即printf的调用。因为它们的顺序和上面获得的汇编一样,所以我认为在上面的汇编中je 30是跳转到执行perror的操作。

function:
.LFB11:
	.cfi_startproc
	testb	%dil, %dil
	je	.L2
	movl	$.LC0, %edi
	jmp	puts
	.p2align 4,,10
	.p2align 3
.L2:
	movl	$.LC1, %edi
	jmp	perror
	.cfi_endproc
.LFE11:
	.size	function, .-function
	.p2align 4,,15
	.globl	function_likely
	.type	function_likely, @function

添加builtin_expect之后的汇编

示例1

上方的代码,在加上__builtin_expect的unlikely和likely之后,新代码如下

void function_likely(bool flag)
{
    if (likely(flag))
    {
        printf("all good!\n");
    }
    else
    {
        perror("this is wrong!\n");
    }
}

void function_unlikely(bool flag)
{
    if (unlikely(flag))
    {
        printf("all good!\n");
    }
    else
    {
        perror("this is wrong!\n");
    }
}

使用相同命令进行编译,得到汇编如下

0000000000000050 <function_likely>:
  50:   48 83 ec 08             sub    $0x8,%rsp
  54:   40 84 ff                test   %dil,%dil
  57:   74 27                   je     80 <function_likely+0x30>
  59:   bf 00 00 00 00          mov    $0x0,%edi
  5e:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 66 <function_likely+0x16>
  65:   01 
  66:   e8 00 00 00 00          callq  6b <function_likely+0x1b>
  6b:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 73 <function_likely+0x23>
  72:   01 
  73:   48 83 c4 08             add    $0x8,%rsp
  77:   c3                      retq   
  78:   0f 1f 84 00 00 00 00    nopl   0x0(%rax,%rax,1)
  7f:   00 
  80:   bf 00 00 00 00          mov    $0x0,%edi
  85:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 8d <function_likely+0x3d>
  8c:   01 
  8d:   e8 00 00 00 00          callq  92 <function_likely+0x42>
  92:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 9a <function_likely+0x4a>
  99:   01 
  9a:   eb d7                   jmp    73 <function_likely+0x23>
  9c:   0f 1f 40 00             nopl   0x0(%rax)

00000000000000a0 <function_unlikely>:
  a0:   48 83 ec 08             sub    $0x8,%rsp
  a4:   40 84 ff                test   %dil,%dil
  a7:   75 27                   jne    d0 <function_unlikely+0x30>
  a9:   bf 00 00 00 00          mov    $0x0,%edi
  ae:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # b6 <function_unlikely+0x16>
  b5:   01 
  b6:   e8 00 00 00 00          callq  bb <function_unlikely+0x1b>
  bb:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # c3 <function_unlikely+0x23>
  c2:   01 
  c3:   48 83 c4 08             add    $0x8,%rsp
  c7:   c3                      retq   
  c8:   0f 1f 84 00 00 00 00    nopl   0x0(%rax,%rax,1)
  cf:   00 
  d0:   bf 00 00 00 00          mov    $0x0,%edi
  d5:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # dd <function_unlikely+0x3d>
  dc:   01 
  dd:   e8 00 00 00 00          callq  e2 <function_unlikely+0x42>
  e2:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # ea <function_unlikely+0x4a>
  e9:   01 
  ea:   eb d7                   jmp    c3 <function_unlikely+0x23>

可以看到,对于function_likely中likely括起来的flag判断,是认为flag大概率为真,所以其进行的是je判断;而对于unlikely括起来的操作,认为flag大概率为假,所以用的是jne进行判断

je和jne功能相反,都是判断ZF标记位

  • je:ZF=1的时候跳转
  • jne:ZF=0的时候跳转

示例2

上面的例子用的printf和perror库函数,我们不太好观察到二者的差别,改成如下代码再次进行测试,能更明显的看到二者优化后的不同。

#include <stdio.h>
#include <stdbool.h>

#define likely(x) __builtin_expect(!!(x), 1)
#define unlikely(x) __builtin_expect(!!(x), 0)

int test_likely(int x)
{
    if(likely(x))
    {
        x = 5;
    }
    else
    {
        x = 6;
    }

    return x;
}

int test_unlikely(int x)
{
    if(unlikely(x))
    {
        x = 5;
    }
    else
    {
        x = 6;
    }

    return x;
}

int main()
{
    test_likely(1);
    test_likely(0);
    return 0;
}

使用相同命令进行编译

main:main.c
	gcc -fprofile-arcs -O2 -c main.c
	objdump -d main.o

得到汇编输出如下

0000000000000000 <test_likely>:
   0:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 8 <test_likely+0x8>
   7:   01 
   8:   b8 05 00 00 00          mov    $0x5,%eax
   d:   85 ff                   test   %edi,%edi
   f:   74 07                   je     18 <test_likely+0x18>
  11:   c3                      retq   
  12:   66 0f 1f 44 00 00       nopw   0x0(%rax,%rax,1)
  18:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 20 <test_likely+0x20>
  1f:   01 
  20:   b8 06 00 00 00          mov    $0x6,%eax
  25:   c3                      retq   
  26:   66 2e 0f 1f 84 00 00    nopw   %cs:0x0(%rax,%rax,1)
  2d:   00 00 00 

0000000000000030 <test_unlikely>:
  30:   85 ff                   test   %edi,%edi
  32:   75 14                   jne    48 <test_unlikely+0x18>
  34:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 3c <test_unlikely+0xc>
  3b:   01 
  3c:   b8 06 00 00 00          mov    $0x6,%eax
  41:   c3                      retq   
  42:   66 0f 1f 44 00 00       nopw   0x0(%rax,%rax,1)
  48:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 50 <test_unlikely+0x20>
  4f:   01 
  50:   b8 05 00 00 00          mov    $0x5,%eax
  55:   c3                      retq   

在这个例子中可以很明显的观察到,对于likely的函数操作,je后紧跟着的是

  11:   c3                      retq   
  12:   66 0f 1f 44 00 00       nopw   0x0(%rax,%rax,1)

而对于unlikely操作中,jne后面紧跟着的是

  34:   48 83 05 00 00 00 00    addq   $0x1,0x0(%rip)        # 3c <test_unlikely+0xc>
  3b:   01 
  3c:   b8 06 00 00 00          mov    $0x6,%eax

两个操作的顺序正好倒过来了,符合优化的预期!

结论

通过上面的两个例子,__builtin_expect的优化作用就体现出来了

  • 当我们认为flag大概率为假的时候,使用jne判断为真的情况,如果是真才跳转。为假继续往后执行;
  • 如果我们认为flag大概率为真的时候,使用je判断为假的情况,如果是假才进行跳转。为真继续往后执行;

相比于直接往后执行汇编,跳转是需要一定消耗的!使用该宏进行优化后,编译器会把更有可能执行的操作放在判断语句之后,避免多次跳转产生的消耗

// if(unlikely(flag)) // B更有可能执行,flag更大概率为假
if(likely(flag)) // A更有可能执行,flag更大概率为真
{
	//A
}
else
{
	//B
}

再用上面这个简单的demo来说明一下:

  • 使用likely进行flag判断的时候,汇编语句中会使用je判断,并把A紧跟着je判断之后;
  • 使用unlikey进行flag判断的时候,汇编语句中会使用jne判断,并把B紧跟着jne判断之后;

因为依照更有可能发生的情况来生成不同的汇编代码,减少了跳转次数,自然优化了性能!你看明白了吗?

好得很

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/352348.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

2017. 圆周排列

一、题目 Problem #2017 - ECNU Online Judge 二、思路 一开始以为是全排列&#xff0b;验证的问题&#xff0c;后来超时&#xff0c;然后转向组合排列思考&#xff0c;结果AC了 首先要知道&#xff1a;n个不同元素的圆排列有(n-1)!个 证明&#xff1a;将个n 元素中的某个元素…

语图奇缘:林浩然与杨凌芸的哲学漫画大冒险

语图奇缘&#xff1a;林浩然与杨凌芸的哲学漫画大冒险 Language Odyssey: The Philosophical Comic Adventure of Lin Haoran and Yang Lingyun 在一个充满逻辑谜题和言语陷阱的城市——逻言市&#xff0c;住着两位热衷于探索语言奥秘的年轻人&#xff0c;林浩然和杨凌芸。林浩…

docker之部署青龙面板

青龙面板是一个用于管理和监控 Linux 服务器的工具&#xff0c;具有定时运行脚本任务的功能。在实际情况下也可以用于一些定期自动签到等任务脚本的运行。 本次记录下简单的安装与使用&#xff0c;请提前安装好docker&#xff0c;参考之前的文章。 一、安装部署 1、拉取镜像 # …

黑马点评Redis项目实战(1)基于Session实现短信登录

一、导入黑马点评项目 1.后端部署 下载好资料之后&#xff0c;先在数据库中制作所需的表&#xff0c;如下&#xff1a; 接着在工程中按照自己的数据库设置相应的username和root&#xff0c;如下&#xff1a; 启动项目之后&#xff0c;输入网站&#xff1a;localhost:8081/sho…

【原神游戏开发日志3】登录和注册有何区别?

版权声明&#xff1a; ● 本文为“优梦创客”原创文章&#xff0c;您可以自由转载&#xff0c;但必须加入完整的版权声明 ● 文章内容不得删减、修改、演绎 ● 本文视频版本&#xff1a;见文末 ● 相关学习资源&#xff1a;见文末 前言 ● 这是我们原神游戏开发日记的第三期 ●…

【Java面试】Mysql

目录 sql的执行顺序索引的优点和缺点怎么避免索引失效(也属于sql优化的一种)一条sql查询非常慢&#xff0c;我们怎么去排查和优化&#xff1f;存储引擎 MylSAM和InnoDB、Memory的区别事务的四大特性(ACID)脏读、不可重复读、幻读事务的隔离级别&#xff1f;怎么优化数据库SQL优…

fastapi学习

fastapi框架 fastapi&#xff0c;一个用于构建 API 的现代、快速&#xff08;高性能&#xff09;的web框架。 fastapi是建立在Starlette和Pydantic基础上的&#xff0c;Pydantic是一个基于Python类型提示来定义数据验证、序列化和文档的库。Starlette是一种轻量级的ASGI框架/工…

春运倒计时,AR 引领铁路运输安全新风向

根据中国交通新闻网发布最新消息&#xff0c;今年春运全国跨区域人员流动量预计达 90 亿人次。 随着春运期间旅客数量不断创下新高&#xff0c;铁路运输面临着空前的挑战与压力。 图源&#xff1a;pixabay 聚焦铁路运输效率与旅客安全保障问题&#xff0c;本期行业趋势将探讨 …

在 Vue 项目中,可以通过设置不同的环境变量来区分不同的环境,例如本地开发环境、测试环境和生产环境。以下是设置环境变量的步骤:

1、在src下新建三个文件夹 &#xff08;.env.local、.env.test 和 .env.prod&#xff09; 2、配置信息 .env.local VUE_APP_ENVlocal VUE_APP_API_URLhttp://localhost:8080.env.test VUE_APP_ENVtest VUE_APP_API_URLhttp://124.220.110.203:9090/ .env.prod VUE_APP_…

看门狗定时器

1. 看门狗 看门狗: 用于设备在 程序异常(死机) 时 可以自动重启设备 实现原理: 通过定时器 进行定时 , 在定时器时间结束前 进行 "喂狗" 重置定时器时间 若时间到,还没有"喂狗",系统重启 本质就是一个定时器, 如何定时? 定时器 本质是对 晶振时钟进行 计…

上位机图像处理和嵌入式模块部署(c/c++ opencv)

【 声明&#xff1a;版权所有&#xff0c;欢迎转载&#xff0c;请勿用于商业用途。 联系信箱&#xff1a;feixiaoxing 163.com】 opencv可以运行在多个平台上面&#xff0c;当然windows平台也不意外。目前来说&#xff0c;opencv使用已经非常方便了&#xff0c;如果不想自己编译…

前端工程化之上cdn

一、cdn介绍 cdn的使用还是和前端打包相关&#xff0c;我们都希望前端最后的打包页面越小越好。那么可不可以把一些包不pack进去&#xff0c;让用户的流浪器自行下载呢&#xff1f;答案是可以的&#xff0c;那这些包就会被托管到分发站点上&#xff0c;就是在全国都有服务器&a…

【C++】STL和vector容器

STL和vector容器 基本概念六大组件容器算法迭代器容器算法迭代器 vector容器基本概念vector构造函数赋值vector的容量和大小vector插入与删除vector存取数据函数原型 vector互换容器vector预留空间vector容器嵌套容器 基本概念 长久以来&#xff0c;软件届一直希望建立一种可重…

解决 github.com port 443: Timed out 的问题

国内访问github.com总是那么不竟如人意&#xff0c;时而无法加载网页&#xff0c;时而等我们抽完了一根烟后&#xff0c;它还处于转圈的状态。 虽然国内有gitee.com等诸多的代码托管平台&#xff0c;但却鲜有国人愿意去呢&#xff1f;其中的缘由&#xff0c;想必也不用我多说&a…

SkiaSharp:.NET强大而灵活的跨平台图形库

在.Net 6之前&#xff0c;我们一般是使用System.Drawing.Common来生成图像。 但在.Net 6平台需要配置&#xff0c;才能在非Windows平台使用System.Drawing.Common。而从.Net 7开始&#xff0c;非Windows不再允许使用&#xff0c;官方也给我们推荐了几个替代库。 今天我们一起来…

MySQL索引类型及数据结构【笔记】

1 索引类型 返回面试宝典 主键索引&#xff08;PRIMARY&#xff09;:数据列不允许重复&#xff0c;不允许为NULL&#xff0c;一个表只能有一个主键。 唯一索引&#xff08;UNIQUE&#xff09;:数据列不允许重复&#xff0c;允许为NULL&#xff0c;一个表允许多个列创建唯一索引…

软考之项目管理

一、考点分布 盈亏平衡分析&#xff08;※&#xff09;进度管理&#xff08;※※※&#xff09;软件质量管理&#xff08;※※&#xff09;软件配置管理&#xff08;※※&#xff09; 二、盈亏平衡分析 正常情况下&#xff0c;销售额固定成本可变成本税费利润 盈亏平衡下&#…

JDK8新特性:Stream

Stream 认识Stream 也叫Stream流&#xff0c;是jdk8开始新增的一套API&#xff08;java.util.stream.*&#xff09;&#xff0c;可以用于操作集合或者数组的数据。优势&#xff1a;Stream流大量的结合了Lambda的语法风格来编程&#xff0c;提供了一种更强大&#xff0c;更加简…

SSH:加密安全访问网络的革命性协议

目录 博客前言 一.ssh介绍 1.为什么需要SSH&#xff1f; 2.SSH是如何工作的&#xff1f; 连接建立 版本协商 算法协商 密钥交换 用户认证 会话请求 会话交互 3.SSH和SSL的区别 二.实战&#xff08;centos配置密钥&#xff09; 2.1.ssh/里面的文件作用解释 2.1 配…

【C++】std::variant

上一篇文章讲到了 union&#xff0c;union union存在很多问题&#xff0c;因此C17设计了一个新的variant替代原来的union。 union的问题 无法知道当前使用的类型是什么。而且union无法自动调用底层数据成员的析构函数。 这些使得一般只对一些“基本类型”使用union&#xf…