AI大模型的预训练、迁移和中间件编程

  大家好,我是爱编程的喵喵。双985硕士毕业,现担任全栈工程师一职,热衷于将数据思维应用到工作与生活中。从事机器学习以及相关的前后端开发工作。曾在阿里云、科大讯飞、CCF等比赛获得多次Top名次。现为CSDN博客专家、人工智能领域优质创作者。喜欢通过博客创作的方式对所学的知识进行总结与归纳,不仅形成深入且独到的理解,而且能够帮助新手快速入门。

  本文主要是AI大模型的预训练、迁移和中间件编程,希望能对学习大模型的同学们有所帮助。

前言

  OpenAI 在 2022 年 11 月推出了人工智能聊天应用—ChatGPT。它具有广泛的应用场景,在多项专业和学术基准测试中表现出的智力水平,不仅接近甚至有时超越了人类的平均水平。这使得 ChatGPT 在推出之初就受到广大用户的欢迎,被科技界誉为人工智能领域的新里程碑。

  人们在为生成式人工智能所带来的多模态内容创作效率的提升而欢呼时,常常低估ChatGPT的推理能力。这种能力使ChatGPT不仅能作为新一代人机交互的核心,还能作为智能代理来构建自动化和半自动化的工作流程,甚至使它能与工业控制或机器人领域相结合,引发深刻的社会变革。

  许多人低估了这种变革的影响力。以当前研发和商业应用的迭代速度来看,预计在未来三至五年内,这种变革将逐渐渗透到人类生活和生产的各个方面,极大地提升现有的生产力。若要追溯上一个被称为“巨大技术变革”的时代,很多人都会毫不犹豫地说是互联网开创期。这次变革也将重塑内容生产相关的商业模式,改变现有的工作方式,甚至推动生产方式的变革。当然,这还需要依赖下一代大语言模型在内容输出的可控性方面的突破。

ChatGPT原理与架构:

大模型的预训练、迁移和中间件编程

程戈 著

大模型领域技术专家和布道者实践经验总结

阿里、Google等企业多位大模型技术专家联袂推荐

限时五折优惠中!,点击链接进行购买

内容简介

  这是一本深入阐述ChatGPT等大模型的工作原理、运行机制、架构设计和底层技术,以及预训练、迁移、微调和中间件编程的著作。它将帮助我们从理论角度全面理解大模型,从实践角度更好地应用大模型,是作者成功训练并部署大模型的过程复盘和经验总结。

  • 第1章介绍了ChatGPT等大模型的发展历程、技术演化和技术栈等基础知识;
  • 第2~5章深入讲解了Transformer的架构原理,并从GPT-1的生成式预训练到GPT-3的稀疏注意力机制详细描述了GPT系列的架构演进;
  • 第6~8章从底层技术实现的角度讲解了大模型的训练策略、数据处理方法,以及如何利用策略优化和人类反馈来进一步提升模型的表现;
  • 第9~10章首先详细讲解了大模型在垂直领域的低算力迁移方法,并给出了医疗和司法领域的迁移案例,然后讲解了大模型的中间件编程;
  • 第11章对GPT的未来发展趋势进行预测,探讨数据资源、自回归模型的局限性,以及大模型时代具身智能的可行路线。

作者简介

  程戈:博士生导师,湘潭大学计算机学院·网络空间安全学院教授,湘潭大学技术转移中心副主任,湘潭市京东智能城市与大数据研究院副院长,智慧司法与数字治理湖南省重点实验室副主任,CCF计算法学会执委。

  大模型领域技术专家和布道者,作为两项科技部国家重点研发子课题的负责人,与成都数之联等多家企业合作推动人工智能在司法领域的落地,带领团队开发了JusticeGPT司法大模型,不同于其他的以提升司法领域知识问答能力为核心的司法大模型,该大模型致力于提升司法文献检索增强生成以及司法文档的多跳信息聚合能力,并通过特定的多任务表征与控制指令生成框架重构司法信息化系统的业务中台,实现司法业务编排以及工作流自动化。

  连续创业者,先后创立湘潭安道致胜信息科技有限公司等多家企业,曾经作为共同创始人加盟美国WiFi Free llc. ,开发了WiFi Free、WiFi Analyzer?等项目,其中WiFi Free在2014到2015年是Google Play市场相关WiFi分享类应用下载的前三名。作为技术顾问,先后服务于北京捷通华声等多家企业,提供知识表示学习的技术解决方案,为某知名私募开发了基于深度学习的股票趋势预测系统,成为该私募公司的主要量化工具。

专家推荐

  作者结合科研和实践经验,用朴实无华的语言,扎实、严谨地剖析了ChatGPT的技术原理和大模型的关键技术。全书内容丰富翔实,图文并茂,任何想要真正理解ChatGPT的读者,都会从本书中获益匪浅,深刻领会这项里程碑式的技术成果。
—— 陈峰 北京滴普科技有限公司合伙人&《ClickHouse性能之巅》作者

  创业不易,比较幸运的是,我在北大做研究时,和团队一起成功地开发了ChatLaw——国内首个在法律领域应用的大模型。本书的作者和团队也成功训练出法律行业的大模型,这本书分享了他们的成功经验。如果你对类似ChatGPT大模型的训练感兴趣,那么本书将是你不容错过的力作。
—— 崔家熙 ChatLaw

  本书不仅能让你站在巨人的肩膀上俯瞰大语言模型的全貌,还带领你深入洞察其背后的原理与架构设计。不仅是一本理论与实践并重的参考书,更是一部引领人工智能领域创新发展的启示录。它将为你揭示大语言模型如何改变我们的生活,并展示如何在这一领域挖掘无限可能。
—— 黄剑 Google工程师/抖音“剑哥聊技术”博主(仅代表个人观点,与任何公司无关)

  本书系统地剖析了支撑ChatGPT的关键技术,包括Transformer模型、注意力机制、生成式预训练等理论基础,以及模型优化、低算力部署、人机交互等关键问题。全书内容丰富翔实,图文并茂,任何想要真正理解ChatGPT的读者都能从中获益。作者结合科研和实践经验,用平实的语言娓娓道来,让这个高深的主题变得触手可及。
—— 刘聪 南京云问科技首席算法架构师/知乎博主:@刘聪NLP/《ChatGPT原理与实践》作者

  这是一本细致入微地剖析ChatGPT内在技术原理的佳作。内容严谨,结构清晰,层层深入地剖析了大语言模型背后的关键技术,如Transformer、注意力机制、生成式预训练等。这是一本质量上乘的技术专著,它不仅系统全面,而且深入浅出,将ChatGPT这一复杂系统娓娓道来,让读者获益匪浅。
—— 刘树春 阿里巴巴高级算法专家

  对于任何渴望深入了解大语言模型的人来说,本书是一本无价之宝。它是进入大语言模型训练和微调世界的敲门砖,同时也是您在人工智能领域取得成就的助推器。通过本书,您将掌握大语言模型的工作原理、技术挑战与发展趋势,从而为自己在人工智能时代的角色定位提供有力支持。
—— 占冰强 AIGCLINK发起人/行行AI合伙人

读者对象

  • 人工智能领域的产品经理。对于希望在自家产品中引入AI功能的产品经理来说,了解ChatGPT等大语言模型的基本原理和运行机制是至关重要的。从本书中,他们可以学习大语言模型的设计思想、构造方式,以及如何将这些模型整合到产品中去。他们也可以借此更好地理解产品的性能瓶颈,从而进行更为精确的产品规划。

  • 人工智能相关专业的研究人员。AI研究者可以将本书作为一本深入了解大语言模型的教科书。无论是Transformer模型的细节,还是GPT模型训练和优化的技巧,书中都进行了详细的介绍。更重要的是,书中还探讨了一些最前沿的研究领域,比如人类反馈强化学习、指令自举标注算法等。

  • 大规模数据处理和分析的工程师。对于面临如何高效处理大规模数据、如何构建分布式训练架构等问题的工程师来说,本书可以提供许多宝贵的建议和思路。例如,第6章对数据处理和分布式训练模式进行了深入的讨论。

  • AI技术的爱好者和使用者。如果你是一个AI技术的爱好者,或者是一个善于运用技术改善生活的人,本书同样适合你。书中对大语言模型的介绍通俗易懂,可以让你对这个强大的技术有个全面的了解。此外,书中还提供了许多实用的使用技巧和案例,可以将它们直接应用到你的生活或工作中去。

目录


前言

第1章 人工智能的新里程碑——ChatGPT / 1

1.1 ChatGPT的发展历程 / 1

1.2 ChatGPT的能力 / 3

1.3 大语言模型的技术演化 / 6

1.3.1 从符号主义到连接主义 / 6

1.3.2 Transformer模型 / 7

1.3.3 无监督预训练 / 10

1.3.4 有监督微调 / 11

1.3.5 人类反馈强化学习 / 11

1.4 大语言模型的技术栈 / 12

1.5 大语言模型带来的影响 / 13

1.6 大语言模型复现的壁垒 / 16

1.6.1 算力瓶颈 / 16

1.6.2 数据瓶颈 / 17

1.6.3 工程瓶颈 / 18

1.7 大语言模型的局限性 / 19

1.8 小结 / 20

第2章 深入理解Transformer模型 / 21

2.1 Transformer模型简介 / 21

2.2 自注意力机制 / 23

2.2.1 自注意力机制的计算过程 / 23

2.2.2 自注意力机制的本质 / 26

2.2.3 自注意力机制的优势与局限性 / 28

2.3 多头注意力机制 / 29

2.3.1 多头注意力机制的实现 / 29

2.3.2 多头注意力机制的作用 / 31

2.3.3 多头注意力机制的优化 / 32

2.4 前馈神经网络 / 33

2.5 残差连接 / 35

2.6 层归一化 / 36

2.7 位置编码 / 38

2.7.1 位置编码的设计与实现 / 38

2.7.2 位置编码的变体 / 40

2.7.3 位置编码的优势与局限性 / 41

2.8 训练与优化 / 41

2.8.1 损失函数 / 41

2.8.2 优化器 / 42

2.8.3 学习率调整策略 / 42

2.8.4 正则化 / 43

2.8.5 其他训练与优化技巧 / 44

2.9 小结 / 46

第3章 生成式预训练 / 47

3.1 生成式预训练简介 / 47

3.2 GPT的模型架构 / 48

3.3 生成式预训练过程 / 50

3.3.1 生成式预训练的目标 / 52

3.3.2 生成式预训练的误差反向传播过程 / 53

3.4 有监督微调 / 55

3.4.1 有监督微调的原理 / 55

3.4.2 有监督微调的特定任务 / 56

3.4.3 有监督微调的步骤 / 58

3.5 小结 / 59

第4章 无监督多任务与零样本学习 / 61

4.1 编码器与解码器 / 61

4.2 GPT-2的模型架构 / 64

4.2.1 层归一化 / 65

4.2.2 正交初始化 / 66

4.2.3 可逆的分词方法 / 67

4.2.4 可学习的相对位置编码 / 71

4.3 无监督多任务 / 72

4.4 多任务学习与零样本学习的关系 / 74

4.5 GPT-2的自回归生成过程 / 76

4.5.1 子词单元嵌入 / 76

4.5.2 自回归过程 / 77

4.6 小结 / 79

第5章 稀疏注意力与基于内容的学习 / 80

5.1 GPT-3的模型架构 / 81

5.2 稀疏注意力模式 / 83

5.2.1 Sparse Transformer的特点 / 83

5.2.2 局部带状注意力 / 85

5.2.3 跨层稀疏连接 / 85

5.3 元学习和基于内容的学习 / 86

5.3.1 元学习 / 87

5.3.2 基于内容的学习 / 87

5.4 概念分布的贝叶斯推断 / 90

5.4.1 隐式微调 / 90

5.4.2 贝叶斯推断 / 93

5.5 思维链的推理能力 / 95

5.6 小结 / 99

第6章 大语言模型的预训练

策略 / 100

6.1 预训练数据集 / 100

6.2 预训练数据的处理 / 102

6.3 分布式训练模式 / 104

6.3.1 数据并行 / 105

6.3.2 模型并行 / 106

6.4 分布式训练的技术路线 / 110

6.4.1 Pathways / 111

6.4.2 Megatron-LM / 113

6.4.3 ZeRO / 116

6.5 训练策略案例 / 120

6.5.1 训练框架 / 120

6.5.2 参数稳定性 / 120

6.5.3 训练设置的调整 / 121

6.5.4 BF16优化 / 121

6.5.5 其他因素 / 122

6.6 小结 / 123

第7章 近端策略优化算法 / 124

7.1 传统的策略梯度方法 / 125

7.1.1 策略梯度方法的基本原理 / 125

7.1.2 重要性采样 / 127

7.1.3 优势函数 / 128

7.2 Actor-Critic算法 / 129

7.2.1 Actor-Critic算法的基本步骤 / 130

7.2.2 值函数与策略更新 / 131

7.2.3 Actor-Critic算法的问题与挑战 / 131

7.3 信任域策略优化算法 / 132

7.3.1 TRPO算法的目标 / 132

7.3.2 TRPO算法的局限性 / 133

7.4 PPO算法的原理 / 134

7.5 小结 / 137

第8章 人类反馈强化学习 / 138

8.1 强化学习在ChatGPT迭代中的作用 / 138

8.2 InstructGPT训练数据集 / 140

8.2.1 微调数据集的来源 / 141

8.2.2 标注标准 / 142

8.2.3 数据分析 / 143

8.3 人类反馈强化学习的训练阶段 / 145

8.3.1 有监督微调阶段 / 145

8.3.2 奖励建模阶段 / 147

8.3.3 强化学习阶段 / 148

8.4 奖励建模算法 / 149

8.4.1 算法思想 / 149

8.4.2 损失函数 / 150

8.5 PPO算法在InstructGPT中的应用 / 151

8.6 多轮对话能力 / 153

8.7 人类反馈强化学习的必要性 / 154

8.8 小结 / 156

第9章 大语言模型的低算力领域迁移 / 157

9.1 指令自举标注 / 157

9.2 人工智能反馈 / 161

9.3 低秩自适应 / 163

9.3.1 模型训练与部署 / 164

9.3.2 秩的选择 / 165

9.4 量化:降低部署的算力要求 / 166

9.5 SparseGPT剪枝算法 / 168

9.6 开源大语言模型的低算力迁移案例 / 170

9.6.1 基座模型 / 170

9.6.2 自举指令微调的羊驼系列 / 171

9.6.3 中文解决方案 / 172

9.6.4 医疗领域的迁移实例 / 174

9.6.5 司法领域的迁移实例 / 175

9.7 小结 / 178

第10章 中间件编程 / 180

10.1 补齐短板—LangChain恰逢

其时 / 180

10.2 多模态融合中间件 / 184

10.2.1 任务规划 / 185

10.2.2 模型选择 / 187

10.2.3 任务执行 / 188

10.2.4 响应生成 / 189

10.3 AutoGPT自主代理与任务

规划 / 189

10.4 中间件框架的竞品 / 192

10.5 小结 / 194

第11章 大语言模型的未来

之路 / 195

11.1 强人工智能之路 / 195

11.2 数据资源枯竭 / 198

11.3 自回归模型的局限性 / 200

11.4 具身智能 / 202

11.4.1 具身智能的挑战 / 203

11.4.2 PaLM-E / 204

11.4.3 ChatGPT for Robotics / 205

11.5 小结 / 210

直播预告

  3月7日周四19:00,大模型领域技术专家,湖南国家应用数学中心副主任,湘潭市京东智能城市与大数据研究院副院长,湘潭大学计算机学院.网络空间学院教授 程戈老师与您分享“世界模型改变世界:从GPT到Sora”,点击预约观看!

在这里插入图片描述

粉丝福利

  • 本次送书两本
  • 活动时间:截止到2024-3-8 14:00
  • 参与方式:关注博主、并在此文章下面点赞、收藏并任意评论。

自主购买

  小伙伴也可以访问链接进行自主购买哦~

  直达京东购买链接🔗:ChatGPT原理与架构:大模型的预训练、迁移和中间件编程

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/431058.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

python.模块与包

1.模块是什么 本质上是一种python文件,以.py结尾,里面有类,函数,变量等,认为这是一个工具包,每个模块有不同的功能,导入后可以直接使用 2.模块的导入 方法1 import 模块名 使用&#xff1a…

展示模型展台的高度一般为多少---模大狮模型网

展示模型展台的高度一般取决于多个因素,包括展示物品的大小、展台的设计风格、展览场地的限制等。一般来说,展示模型展台的高度可以根据以下几点考虑: 展示物品的大小:如果展示物品比较大或需要竖立展示,展台的高度可能…

GraphGeo参文19:Auto-Encoding Variational Bayes

https://arxiv.org/abs/1312.6114 [19] Diederik P Kingma and Max Welling. 2014. Auto-encoding variational bayes. In ICLR. 【前言】:VAE模型是Kingma(也是Adam的作者)大神在2014年发表的文章,是一篇非常非常经典,且实现非常优雅的生成模型,同时它还为bayes概率图模型…

LVS负载均衡集群——NAT地址转换模式与DR直接路由

目录 一、LVS集群基本介绍 1、集群是什么? 2、集群的类型 ①负载均衡集群 ②高可用群集 ③高性能运算群集 3、负载均衡集群的结构 第一层,负载调度器 第二层,服务器池 第三层,共享存储 4、LVS负载均衡集群的三种工作模…

学习计算天数

学习计算天数 题目描述:解法思路:解法代码:运行结果: 题目描述: 输入y和m两个整数,y表示年份,m表示月份,计算y年m月有多少天,并输出天数。 测试1: 输⼊&…

Redis常见的15个【坑】,避坑指南

一、常见命令 1.1 过期时间意外丢失 原因: SET命令如果不设置过期时间,那么Redis会自动【擦除】这个key的过期时间 1.2 DEL命令阻塞redis key是String类型时,DEL时间复杂度是O(1)key是List/Hash/Set/ZSet类型,DEL时间复杂度是…

FRM模型十五:净值归因之Fama_French三因子模型

文章目录 一、起源二、构建因子三、投资组合的净值归因1. 市场因子2. 规模因子3.价值因子4. 基于净值的归因方法 三、代码实现 一、起源 在多因子模型推出之前,CAPM模型被视为资产定价的第一标准。随着市场不断发展,发现了越来越多CAPM模型无法解释的现…

Microsoft@ppt@快速掌握核心功能@常用功能培训

文章目录 refs动画动画的用途逐部分显示内容实现问答效果部分地修改页面内容动画效果 常用窗口对象选择窗口👺批量选择对象 如何为重叠的对象高效的命名重命名方式方案1方案2对象重命名原则重命名后如何使用tips 动画窗口👺 幻灯片管理幻灯片母版幻灯片母…

【软件测试】一个扫码支付的二维码怎么测(测试点分析)

目录:导读 前言一、Python编程入门到精通二、接口自动化项目实战三、Web自动化项目实战四、App自动化项目实战五、一线大厂简历六、测试开发DevOps体系七、常用自动化测试工具八、JMeter性能测试九、总结(尾部小惊喜) 前言 面试的时候&#…

VS统计代码行数

1.使用查找和替换方式 按CTRLSHIFTF (Find in files),勾上支持正则表达式, 然后输入搜索内容:^:b*[^:b#/].*$ 如图所示: 2.查看查询结果 需要注意:#开头和/开头或者空行都不计入代码量。

javascript操作DOM的方法

目录 1. 弹出框 2. 定时器 3. 导航与URL 4. 浏览器信息 5. 窗口控制 6. 屏幕信息 7. 历史对象 1. 弹出框 警告框(Alert) window.alert(这是一个警告消息); 确认框(Confirm) var isConfirmed window.confirm(您确定要执…

【开源】SpringBoot框架开发用户画像活动推荐系统

目录 一、摘要1.1 项目介绍1.2 项目录屏 二、功能模块2.1 数据中心模块2.2 兴趣标签模块2.3 活动档案模块2.4 活动报名模块2.5 活动留言模块 三、系统设计3.1 用例设计3.2 业务流程设计3.3 数据流程设计3.4 E-R图设计 四、系统展示五、核心代码5.1 查询兴趣标签5.2 查询活动推荐…

Java学习笔记002——类的修饰符

在Java语言中,类的访问修饰符决定了其它类能够访问该类的方式。类有如下4种访问修饰符,在创建类时用于类的声明: 1、public: 当一个类被声明为public时,它可以从任何其他类中被访问,无论这些类位于哪个包中。通常&am…

一台服务器,最大支持的TCP连接数是多少?

一个服务端进程最大能支持多少条 TCP 连接? 一台服务器最大能支持多少条 TCP 连接? 一、原理 TCP 四元组的信息:源IP、源端口、目标IP、目标端口。 一个服务端进程最大能支持的 TCP 连接个数的计算公式:最大tcp连接数客户端的IP…

随机森林算法

[1] 随机森林是集成学习中的bagging方法.通过有放回的抽样方法训练模型.再通过对输出求均值的方式得出最终结果。其中,回归树将输入样本分配至其子节点,不同子节点对应不同的取值.再通过损失函数将样本进行训练和分配,直至达到叶子结点。回归…

StarRocks实战——特来电StarRocks应用实践

目录 一、为何引入StarRocks 二、主要应用场景 三、封装或扩展 四、集群监控预警 五、总结规划展望 5.1 使用经验分享 5.2 下一步计划 5.2.1 StarRocks集群自动安装 5.2.2 StarRocks集群高可用架构 原文大佬的这篇StarRocks应用实践有借鉴意义,这里摘抄下来…

1、Ajax、get、post、ajax,随机颜色

一、Ajax初始 1、什么是Ajax? 异步的JavaScript和xml 2、xml是什么? 一种标记语言,传输和存储数据----------现在用JSON传输数据 3、Ajax的作用 局部加载 可以使网页异步更新 4、Ajax的原理或者步骤(6步) 创建Ajax对象 if (window.X…

centos 搭建ftp服务器

项目上需要用到ftp文件服务同步,所以在测试环境进行搭建,其中遇到了一些问题,遂记录。 1、安装vsftpd软件包 打开终端并输入以下命令来安装vsftpd yum install vsftpd -y 2、运行vsftpd systemctl start vsftpd 3、测试匿名连接 我这里…

基于springboot+vue的球队训练信息管理系统

博主主页:猫头鹰源码 博主简介:Java领域优质创作者、CSDN博客专家、阿里云专家博主、公司架构师、全网粉丝5万、专注Java技术领域和毕业设计项目实战,欢迎高校老师\讲师\同行交流合作 ​主要内容:毕业设计(Javaweb项目|小程序|Pyt…

【OBS】obs-websocket实战技巧,让你更快的了解OBS

▒ 目录 ▒ 🛫 导读开发环境 1️⃣ 修改OBS-web源码2️⃣ 常用api汇总获取输入源类型列表获取输入源列表获取属性列表打开输入源属性设置框获取设置输入源静音状态获取特殊输入源设置(全局音频设备)打开输入源属性设置框 🛬 文章小…