GPT-4o多模态大模型的架构设计

c2327171b0c60ae67fd073418750992a.jpeg

GPT-4o:大模型风向,OpenAI大更新

   

f96189c3f23981190707efc6c9112d90.jpeg


OpenAI震撼发布两大更新!桌面版APP与全新UI的ChatGPT上线,简化用户操作,体验更自然。同时,全能模型GPT-4o惊艳亮相,跨模态即时响应,性能卓越且性价比飙升。相较于GPT-4 Turbo,GPT-4o不仅性能卓越,更向用户免费开放,引领大模型新风向。不容错过,立即体验OpenAI的最新科技成果!


1. 桌面版及新 UI ChatGPT

ChatGPT 发布桌面版 APP,支持与计算机语音对话,提升用户与模型交互体验。对于免费和付费用户,OpenAI 推出了适用于 macOS 的新 ChatGPT 桌面应用程序,该应用程序旨在无缝集成到用户的计算机上执行的任何操作。通过简单的键盘快捷键(Option + Space),用户便可向 ChatGPT 提问,并支持直接在应用程序中截取屏幕截图进行讨论。与此同时,ChatGPT 支持与计算机直接语音对话,并在未来将推出新音频和视频功能。

OpenAI率先为Plus用户推出macOS应用程序,并计划在未来数周内全面上线,预计2024年晚些时候还将推出Windows版本,为用户提供更多选择。

OpenAI全面革新UI界面,以更友好、对话性的设计,增强用户与平台的自然互动,简化操作流程,提升用户体验。

2. GPT-4o 实现毫秒级视觉音频理解

GPT-4o,OpenAI新旗舰,兼具GPT-4强大模型能力与卓越推理速度,更拥有多模态处理文本、图像、音频的创新功能。发布会亮点纷呈,为您揭示AI新时代的无限可能。

GPT-4o引领人机交互新纪元,实现毫秒级响应,即时语音对话。它兼容文本、音频、图像多元输入,并灵活输出,全面升级交流体验。相较于GPT-3.5的2.8s和GPT-4的5.4s延迟,GPT-4o音频响应最短至232毫秒,平均仅320毫秒,媲美人类对话速度。这一革命性突破,极大地提升了人机交流的自然度和效率,开启了人机交互的新篇章。

GPT-4o彰显卓越视觉与音频理解力,实时感知语气语态。用户可随时打断对话,模型则能灵活生成多音调回复,富含人类情感。通过与AI视频通话,即时解答疑问,体验前所未有的智能交互。

GPT-4o API的性价比显著跃升,其速度翻倍,成本减半,同时速率限制提升5倍,相较于GPT-4 Turbo,展现出卓越的性能与价值。

3. 端到端多模态 GPT-4o,刷新 SOTA 性能飞跃

传统语音 AI 通常经过三步法实现对话功能,在这过程中会丢失很多信息且不能判断情绪变化。三步法具体为:1)语音识别或 ASR:音频到文本,类似 Whisper;2)LLM 计划下一步要说什么:文本 1 到文本 2;3)语音合成或 TTS:文本 2 到音频,类似 ElevenLabs 或 VALL-E。GPT-4 便采用该模式,在这过程中不仅响应速度更慢而且丢失了大量信息,无法直接观察语调、多个说话者或背景噪音,也无法输出笑声、歌唱或表达情感等。

43ce13c423f4c6c577a0984f73bae855.jpeg

GPT-4o,跨模态端到端新模型,实现多模态统一,性能飞跃。其响应迅捷,于文本、推理、编码智能方面均达GPT-4 Turbo水平,更在多语言、音频、视觉功能上刷新记录。GPT-4o,真正的多模态统一模型,引领智能技术新篇章。

GPT-4o在文本推理领域再创新高!在0-shot COT MMLU测试中,它斩获了88.7%的卓越成绩;在5-shot no-CoT MMLU测试中,也达到了87.2%的高分。相较于GPT-4 Turbo,GPT-4o的文本推理能力得到了显著增强,展现了其强大的语言理解和分析能力。

41462687caf6263f64c4a84ca9afa35b.jpeg

GPT-4o在多语言识别上卓越于Whisper-v3,尤其在资源匮乏语言上表现优异,展现出色的跨语言识别能力。

GPT-4o在音频翻译上表现卓越,达到新高度,MLS基准测试成绩超越Whisper-v3,展现强大实力。

1a087fe6eba9aaf349aab735a0103338.jpeg

M3Exam测试涵盖多语言与视觉评估,结合多国标准化测试的多选题与图形图表。在各类语言基准测试中,GPT-4o表现超越GPT-4,凸显其卓越性能。

GPT-4o在视觉感知领域大放异彩,其性能在基准测试中达到了顶尖水平。MMMU测试结果显示,GPT-4o以69.1的高分领跑,远超GPT-4 Turbo的63.1分,以及Gemini 1.0 Ultra、Gemini 1.5 Pro和Claude Opus的59.4分和58.5分。这一突破性的表现,再次彰显了GPT-4o在视觉理解领域的卓越实力。

GPT-4o在端到端多模态架构的加持下,其多模态能力得以显著增强。不仅涵盖文本、图像等经典功能,更拓展至3D物品合成、文本转字体等创新领域,功能多样且强大。

 

-对此,您有什么看法见解?-

-欢迎在评论区留言探讨和分享。-

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/701165.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

vue防止多次点击

1.新建js 在util文件夹下新建一个preventReClick.js文件,名字可自定义,文件夹也可以根据你自己的目录来 2.js文件中通过自定义指令的形式封装一个名为preventReClick的指令 import Vue from vue // 通过自定义指令的形式封装一个名为preventReClick的…

动手学深度学习31 深度学习硬件 CPU和GPU

动手学深度学习31 深度学习硬件 CPU和GPU CPU和GPU主频 QA PPT: https://courses.d2l.ai/zh-v2/assets/pdfs/part-2_1.pdf 视频: https://www.bilibili.com/video/BV1TU4y1j7Wd/?p2&spm_id_frompageDriver&vd_sourceeb04c9a33e87ceba9c9a2e5f09…

..\USER\stm32f10x.h(298): error: #67: expected a “}“

原keil4的示例工程在用keil5打开之后出现报错: ..\USER\stm32f10x.h(298): error: #67: expected a "}" 在去掉手动添加的一个宏定义STM32F10X_HD后即可正常编译,因为KEIL5已经自动添加了

免费生成短链接,常用短网址生成站点推荐!

什么是短链接 "短链接"俗称"短网址",通俗的讲就是将长的URL网址通过程序计算等方式,转换为简短的网址字符串,更便于使用者在第三方平台引用网址,节省字符数空间。 短链接最大的特点就是短,今天给…

大模型应用产品指北

一、试用类型 计算机视觉Computer Vision:Text-to-image(文生图) 二、国内产品 Aliyun通义千问 【体验】 可以替代Stable Diffusion、Midjourney;支持风格、滤镜; [传送门:通义万相] 【体验】Transformer架构;中英双语;开源可以…

WWDC24 快速回顾

今天凌晨,苹果公司在2024年全球开发者大会(WWDC24)上,发布了一系列的系统更新。然而,对于期待苹果带来突破性创新的消费者来说,今年的大会似乎并没有达到预期的震撼效果。 下面让我看看,苹果都带…

【小白专用 已验证24.6.12】MySQL连接使用-创建数据库和创建数据表

【小白专用 已验证24.6.12】Mysql 8.0的安装配置教程(详细)_mysql安装教程8.2-CSDN博客 1.在Windows开始搜索输入Mysql,并选择第一个打开。 2.输入安装时的密码,再回车,就连接上 MySQL 了 1. MySQLSQL语句通用语法 (1)SQL语句可以…

Compshare平台使用体验分享

一、引言 随着AI技术的飞速发展,对高性能计算资源的需求也在不断增加。为了满足广大AI研究者和开发者的需求,各类算力共享平台应运而生。其中,Compshare平台凭借其卓越的性能和便捷的操作,迅速成为用户关注的焦点。本文将通过对隶…

[leetcode]删除链表中倒数第k个结点

. - 力扣(LeetCode) class Solution { public:ListNode* trainningPlan(ListNode* head, int cnt) {int n 0;ListNode* node nullptr;for (node head; node; node node->next) {n;}for (node head; n > cnt; n--) {node node->next;}retu…

遥控玩具车电机驱动应用中的双H桥驱动芯片

遥控玩具车的基本工作原理是通过无线电遥控器发送信号,这些信号被玩具车内的接收器接收并解码,从而控制玩具车的运行。根据车身外型的不同,可以分为:普通的私家房车、越野车、货柜车、翻斗车等等。遥控器的操作,如前进…

鸿蒙元服务未来是能一“通”多端的前端形态?

2024年,华为鸿蒙的热度只增不减。 在2023年底就有业内人士透露,华为明年将推出不兼容安卓的鸿蒙版本,未来IOS、鸿蒙、安卓将成为三个各自独立的系统。 果不其然,执行力超强的华为,与2024年1月18日的开发者&#xff0…

AC/DC电源模块:多种应用需求的通用能源解决办法

BOSHIDA AC/DC电源模块:多种应用需求的通用能源解决办法 AC/DC电源模块是一种通用能源解决方案,可满足多种应用需求。它将交流电转换为直流电,提供给各种电子设备以稳定的电源。AC/DC电源模块拥有多种优势,包括高效能、可靠性好、…

Win11如何屏蔽个人数据跨境传输提示

今天重启电脑,出现系统【个人数据跨境传输】的更新提示,为了快速开始办公就给点同意了,中午休息时,总是觉得不爽,必须关闭这个。 后来我知道,到了这一步的时候,可以有其他方法终止,参…

【算法实战】每日一题:18.2 ST 表(Sparse Table)

1.题目 给定一个长度为 n 的数列和 m 个查询,每个查询指定一个闭区间,要求对每个查询输出该区间内的最小值。 2.思路 其实用Python的话,我们可以直接用Python内置的min函数做,但是这种方法很容易超时,所以我们用ST表…

OpenGauss数据库-8.权限管理

第2关:权限设置 gsql -d postgres -U gaussdb -W passwd123123 CREATE ROLE lily WITH CREATEDB PASSWORD passwd123123; GRANT lily TO gaussdb; 第3关:管理员 gsql -d postgres -U gaussdb -W passwd123123 CREATE USER peter WITH SYSADMIN PASSWOR…

【ai】openai-quickstart 配置pycharm工程

之前都是本地执行脚本【AI】指定python3.10安装Jupyter Lab环境为:C:\Users\zhangbin\AppData\Local\Programs\Python\Python310 参考之前创建的python工程 使用的是局部的私有的虚拟环境 pycharm给出的解释器 直接使用现有的,不new了 可以选择3.10 :可以选虚拟的:

macOS Sequoia 将 Mac 生产力与智能化提升至全新高度 (macOS 15 ISO、IPSW、PKG 下载)

macOS Sequoia 将 Mac 生产力与智能化提升至全新高度 (macOS 15 ISO、IPSW、PKG 下载) iPhone 镜像、Safari 浏览器重大更新、备受瞩目的游戏和 Apple Intelligence 等众多全新功能令 Mac 使用体验再升级 请访问原文链接:https://sysin.org/blog/macOS-Sequoia/&a…

windows上修改Podman的镜像配置源加速

目录 前言解决办法1. 打开window的Powershell 2. 修改registries.conf3. 重启podman即可 扩展内容1. 国内镜像源地址2. 阿里加速地址 前言 今天在电脑上准备通过podman安装mysql,结果执行安装命令后,网络不通没法下载镜像。 解决办法 将默认镜像源修改…

Fegin如何传参form-data文件

Form-data传输file参数,这个大家都比较清楚,那么针对于Fegin参数file参数该如何操作呢!下面截图来找到对应的参数关系。 一、之前我们在postMan中是这种传参的,那么如果使用Feigin来传输文件File 二、在Fegin中传form-data参数&a…

滴滴出行 大数据研发实习生【继任】

大数据研发实习生JD 职位描述 1、负责滴滴核心业务的数据建设,设计并打造适应滴滴一站式出行平台业务特点的数仓体系。 2、负责抽象核心业务流程,沉淀业务通用分析框架,开发数仓中间层和数据应用产品。 3、负责不断完善数据治理体系&#xff…