Vitis HLS 学习笔记--接口存储器布局模型

目录

1. 简介

2. 详解

2.1 数据对齐

2.2 数据结构填充

3. 总结


1. 简介

软件开发者写的程序会在 CPU 处理器上运行,而硬件开发者设计的“内核”则会在 FPGA 上运行。这两部分需要通过一个精心设计的接口来沟通,就像两个人用对讲机来交流一样。为了确保这种沟通顺畅,数据必须以一种特定的方式来存储和组织,这就是所谓的存储器模型。这个模型就像是一个书架,告诉你如何摆放你的书籍,以便你能快速找到它们。

在这个过程中,有两个重要的概念:数据对齐和数据结构填充

数据对齐就像是确保所有的书都准确地靠在书架的边缘,这样你就能更快地找到它们。

数据结构填充则是在书与书之间留出空间,以防它们挤在一起时难以取出。

Vitis HLS 编译器允许开发者调整这些规则,就像你可以调整书架的层板一样,以适应不同大小和形状的书籍。这样,软件和硬件就能更高效地一起工作,就像一个精心组织的图书馆一样。

2. 详解

2.1 数据对齐

打个比方,CPU 内存就像一个巨大的书架,而每本书代表了一块数据。程序员通常会认为这个书架是由一排排紧挨着的书组成的,每本书都可以单独拿出来看。

但实际上,现代的计算机处理器(就像是拿书的人)并不是每次只拿一本书,而是一次拿一整组书,比如一次拿2本、4本、8本,甚至更多。这样做的原因是,一次拿多本书可以更快地找到需要的信息,就像你可以一眼看到一组书的标题一样。

为了让处理器能够高效地拿书,书架上的书需要按照一定的规则摆放。比如,如果处理器一次拿4本书,那么每组书的第一本书的位置就需要是4的倍数。这就是所谓的“对齐”。如果书没有按照这个规则摆放,处理器在拿书时就会遇到麻烦,可能会拿得很慢,或者甚至拿不到想要的书。

如果程序员在编写软件时没有考虑到这些对齐的规则,就可能会导致软件运行缓慢,或者程序卡住不动,有时候甚至会导致整个操作系统崩溃。最糟糕的情况是,软件可能会在没有任何提示的情况下出错,给出错误的结果。所以,理解并正确处理内存对齐是非常重要的,它可以确保软件运行得既快速又稳定。

下表显示了 C/C++ 中对应 32 位和 64 位 x86-64 GNU/Linux 机器的基本原生数据类型的大小和对齐(以字节数为单位):

类型

32 位 x86 GNU/Linux

64 位 x86 GNU/Linux

大小

对齐

大小

对齐

float

4

4

4

4

double

8

4

8

8

long double

12

4

16

16

void*

4

4

8

8

为了在存储器要求和性能之间取得平衡,程序员可能需要更改数据的默认对齐方式。因为在主机与加速器(FPGA)之间往返发送数据时,发射的每个字节都有成本。

GCC C/C++ 编译器提供了一个语言扩展 __attribute__((aligned(X))),允许程序员为变量、结构体或类指定一个特定的对齐字节数。例如,声明 int x __attribute__ ((aligned (16))) = 0; 会使编译器在16字节边界上分配变量 x。

使用 __attribute__((aligned(X))) 不会改变变量的大小,但会通过在结构体元素之间添加填充来改变内存布局,从而可能增加结构体的总大小。aligned 属性只能用来增加对齐的字节数,不能减少。C++ 中的 offsetof 函数可以用来确定结构体中每个成员的对齐情况。

如果在使用 __attribute__((aligned)) 时没有明确指定一个对齐因子(即 X 的值),编译器会自动选择一个对齐值。这个值是目标机器上所有数据类型中最大的对齐要求。例如,如果目标机器上最大的数据类型对齐要求是8字节,那么编译器会将变量或字段对齐到8字节边界。

这样做的好处是可以提高内存访问的效率。因为大多数现代处理器在访问对齐的数据时更加高效,特别是当数据的对齐边界与处理器的内存访问粒度相匹配时。这意味着,如果处理器一次可以高效地读取8字节,那么在8字节边界上对齐的数据可以一次性被读取,而不需要多次内存访问。这就是为什么默认情况下,编译器会选择最大的对齐要求,以期望在不同的内存访问操作中获得最佳性能。

2.2 数据结构填充

在C++中,内置的数据类型(如 int, float 等)有预定义的对齐要求,这些要求确保了数据在内存中的有效访问。对于用户定义的数据类型,如结构体或类,编译器也会自动确保其中的成员变量是正确对齐的。

为了做到这一点,编译器可能会在结构体或类的成员变量之间插入填充字节(也称为“padding”)。这是因为每个成员变量可能有不同的对齐要求,而编译器需要确保每个成员都按照其类型的对齐要求放置在内存中。

此外,如果有一个用户定义类型的数组,编译器还会在数组的每个元素之间添加填充,以确保数组中的每个元素都能满足对齐要求。这样做的目的是为了提高数组元素访问的效率。在某些情况下,编译器甚至会在结构体或类的最后一个成员之后添加额外的填充,以确保当这个结构体或类被用作数组元素时,数组中的下一个元素也能正确对齐。

比如以下这个示例:

struct One
{
    short s;
    int   i;
    char  c;
}

struct Two
{
    int   i;
    char  c;
    short s;
}

在 struct One 的例子中,short 类型的 s 成员要求在2字节边界上对齐,int 类型的 i 成员要求在4字节边界上对齐,而 char 类型的 c 成员对齐要求最小,通常是1字节。因为 int 类型的对齐要求是最严格的,所以整个结构体会在4字节边界上对齐。

为了满足这些对齐要求,编译器会在 s 和 i 之间插入2个填充字节,以确保 i 在4字节边界上对齐。同样地,为了在 c 之后开始新的对齐块,编译器会在 c 之后插入3个填充字节。因此,struct One 的总大小变为12字节。

然而,在 struct Two 中,成员的顺序被重新排列,以减少填充的需要。int 类型的 i 成员首先出现,后面紧跟着 char 类型的 c 和 short 类型的 s。c 只需充填一个字节,s 则不需要额外的填充。因此,struct Two 的总大小只有8字节。

3. 总结

在现代计算机系统中,数据对齐和结构填充是确保数据存储和访问效率的关键因素。数据对齐涉及将数据按照处理器优化的边界排列,以加快访问速度。结构填充则是在数据结构中插入额外空间,以保持成员变量的正确对齐。这些概念在硬件设计中尤为重要,因为 FPGA 和其他硬件加速器对数据布局的要求更为严格。Vitis HLS 等工具允许开发者自定义对齐和填充规则,以优化软件与硬件之间的数据交互,从而提升整体性能。理解并应用这些原则,可以帮助开发者在存储器要求和性能之间找到最佳平衡点。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/692583.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

GDPU unity游戏开发 寻路与导航

学会寻路,出门在外,身份不是他给的,他做不了你一直的导航。 角色寻路 角色控制器替换为普通的角色控制器,给实验九的地形增加NavMesh Surface组件,然后给角色增加NavMesh Agent组件,并选择合适的参数。通过…

mac安装brew遇到的一些问题

mac终端执行命令/bin/bash -c “$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)”,无法建立连接或连接超时错误,错误信息如下: curl: (28) Failed to connect to raw.githubusercontent.com port 443 af…

高性能MySQL(第3版)电子书笔记

Mysql官方文档:https://dev.mysql.com/doc/refman/5.7/en/ 高性能MySQL(第3版):百度网盘,基于Mysql5.1和Mysql5.5 本机版本 mysql> select version(); ------------ | version() | ------------ | 5.7.32-log |…

Numba 的 CUDA 示例(4/4):原子和互斥

本教程为 Numba CUDA 示例 第 4 部分。 本系列第 4 部分总结了使用 Python 从头开始学习 CUDA 编程的旅程 介绍 在本系列的前三部分(第 1 部分,第 2 部分,第 3 部分)中,我们介绍了 CUDA 开发的大部分基础知识&#xf…

第十一届蓝桥杯C++青少年组中/高级组国赛2020年10月真题解析

一、单选题 第1题 在数组中,数组名表示( ). A:数组第1个元素的首地址 B:数组第2个元素的首地址 C:数组所有元素的首地址, D:数组最后1个元素的首地址 答案:A 数组名是一个地址,指向第一个元素 第2题 …

locale本地化库学习

std::locale 类型的对象(本地环境对象)是不可变刻面的一个不可变索引集。C 输入/输出库的每个流对象都与一个 std::locale 对象关联,并用它的各刻面来分析及格式化所有数据。另外,每个 std::basic_regex 对象也都与一个本地环境对…

如何用群晖当异地组网服务器?

在当今信息化时代,远程通信成为了企业和个人之间不可或缺的一部分。特别是对于跨地区的通信需求,一个可靠的异地组网服务器是必不可少的。而群晖(Synology)作为一款功能强大的网络存储设备,可以被用作办公室或家庭的异…

【小白专用24.6.8】C#Lambda表达式

Lambda表达式可以采用以下任意一种形式的表达式&#xff1a; 1.表达式Lambda&#xff0c;表达式为其主体&#xff1a; (input-parameters) > expression 1 2.语句Lambda&#xff0c;语句块作为其主体&#xff1a; (input-parameters) > {<sequence-of-statements>…

★pwn 24.04环境搭建保姆级教程★

★pwn 24.04环境搭建保姆级教程★ &#x1f338;前言&#x1f33a;Ubuntu 24.04虚拟机&#x1f337;VM&#x1f337;Ubuntu 24.04镜像 &#x1f33a;工具&#x1f337;可能出现的git clone错误&#x1f337;复制粘贴问题&#x1f337;攻击&#x1f337;编题 &#x1f33a;美化&…

C++的STL 中 set.map multiset.multimap 学习使用详细讲解(含配套OJ题练习使用详细解答)

目录 一、set 1.set的介绍 2.set的使用 2.1 set的模板参数列表 2.2 set的构造 2.3 set的迭代器 2.4 set的容量 2.5 set的修改操作 2.6 set的使用举例 二、map 1.map的介绍 2.map的使用 2.1 map的模板参数说明 2.2 map的构造 2.3 map的迭代器 2.4 map的容量与元…

【数据结构】栈的应用

目录 0 引言 1 栈在括号匹配中的应用 2 栈在表达式求值中的应用 2.1 算数表达式 2.2 中缀表达式转后缀表达式 2.3 后缀表达式求值 3 栈在递归中的应用 3.1 栈在函数调用中的作用 3.2 栈在函数调用中的工作原理 4 总结 0 引言 栈&#xff08;Stack&#xff09;是一…

【网络编程开发】8.TCP连接管理与UDP协议 9.IP协议与ethernet协议

8.TCP连接管理与UDP协议 三次握手 三次握手的过程在TCP/IP网络通信中起着至关重要的作用&#xff0c;它不仅确保了数据的可靠传输&#xff0c;还为两端的数据传输提供了稳定的连接初始化过程。这一过程涉及到几个关键步骤&#xff0c;每个步骤都有其特定的目的和功能。 步骤&…

LSTM卷土重来之Vision-LSTM横空出世!!

在Transformer诞生三年后&#xff0c;谷歌将这一自然语言处理的重要研究扩展到了视觉领域&#xff0c;也就是Vision Transformer。 论文链接&#xff1a;https://arxiv.org/abs/2406.04303 项目链接: https://nx-ai.github.io/vision-lstm/ GPT-4o深夜发布&#xff01;Plus免…

MySQL—多表查询—联合查询

一、引言 之前学习了连接查询。现在学习联合查询。 union&#xff1a;联合、联盟 对于union查询&#xff0c;就是把多次查询的结果合并起来&#xff0c;形成一个新的查询结果集 涉及到两个关键字&#xff1a;union 和 union all 注意&#xff1a; union 会把上面两个SQL查询…

Python魔法之旅-魔法方法(23)

目录 一、概述 1、定义 2、作用 二、应用场景 1、构造和析构 2、操作符重载 3、字符串和表示 4、容器管理 5、可调用对象 6、上下文管理 7、属性访问和描述符 8、迭代器和生成器 9、数值类型 10、复制和序列化 11、自定义元类行为 12、自定义类行为 13、类型检…

MySQL—多表查询—子查询(介绍)

一、引言 上一篇博客学习完联合查询。 这篇开始&#xff0c;就来到多表查询的最后一种形式语法块——子查询。 &#xff08;1&#xff09;概念 SQL 语句中嵌套 SELECT 语句&#xff0c;那么内部的 select 称为嵌套查询&#xff0c;又称子查询。 表现形式 注意&#xff1a; …

零基础入门学用Arduino 第一部分(二)

重要的内容写在前面&#xff1a; 该系列是以up主太极创客的零基础入门学用Arduino教程为基础制作的学习笔记。个人把这个教程学完之后&#xff0c;整体感觉是很好的&#xff0c;如果有条件的可以先学习一些相关课程&#xff0c;学起来会更加轻松&#xff0c;相关课程有数字电路…

转型AI产品经理(4):“认知负荷”如何应用在Chatbot产品

认知负荷理论主要探讨在学习过程中&#xff0c;人脑处理信息的有限容量以及如何优化信息的呈现方式以促进学习。认知负荷定律认为&#xff0c;学习者的工作记忆容量是有限的&#xff0c;而不同类型的认知任务会对工作记忆产生不同程度的负荷&#xff0c;从而影响学习效果。以下…

项目总结报告(Word模板)

2 项目工作成果 2.1 交付给用户的产品 2.2 交付给研发中心的产品 2.2.1 代码部分 2.2.2 文档部分 2.3 需求完成情况与功能及性能符合性统计 2.3.1 需求完成情况统计 2.3.2 功能符合性分析 2.3.3 性能符合性分析 3 项目工作分析 3.1 项目计划与进度实施分析 3.1.1 开发进度 3.1.…

Hadoop3:MapReduce源码解读之Map阶段的Job任务提交流程(1)

3、Job工作机制源码解读 用之前wordcount案例进行源码阅读&#xff0c;debug断点打在Job任务提交时 提交任务前&#xff0c;建立客户单连接 如下图&#xff0c;可以看出&#xff0c;只有两个客户端提供者&#xff0c;一个是YarnClient&#xff0c;一个是LocalClient。 显然&a…