爆肝!Claude3与ChatGPT-4到底谁厉害,看完你就知道了!

前言:

相信大家在pyq都被这张图片刷屏了把~

昨天,为大家介绍了一下什么是Claude,今天咱终于弄到号了(再被ban了3个号之后终于是成功的登上去了,如果各位看官觉得咱文章写的不错,麻烦点个小小的关注~你们的支持就是我最大的动力),给大家来一波Claude3与GPT-4的测试,看看Claude到底是不是网传的那样全方位吊打GPT-4


一、了解Claude

(一)同行数据对比

在进行测试之前我们先来看一组Claude官方发布的数据

Anthropic公司本次一共发布了3个模型,分别为:

Claude 3 Haiku、Claude 3 Sonnet和Claude 3 Opus,其费用与模型能力如下图所示:

再三个模型中,Oups是最强大的,同时也是费用最高的,目前Sonnet是可以免费使用的模型(也是本次测评中用到的模型),同时也是一个性价比较高的选择。每个模型都在智能、速度和成本之间提供了最佳的平衡,以适应各种特定应用的需求。

Claude 3 Opus: $15 / $75

Claude 3 Sonnet:$3/$15

Claude 3 Haiku: $0.25 / $1.25 

Opus的定价与GPT-4相当,高于GPT-4 Turbo,低于GPT-4 32K

Sonnet比所有GPT-4版本(包括GPT-4 Turbo)便宜

Haiku比GPT-3.5 Turbo还便宜
 

再这组数据中,Claude官方从本科水平的专家知识(MMLU)、研究生水平的专家推理(GPQA)、基础数学(GSM8K)、数学问题解答(MATH)、多语种数学(MGSM)代码编写(HumanEval)等八个方面对Opus  Sonnet   Haiku以及GTP4和GPT3.5几个模型展开了比较。从数据中我们可以很明显的看到,Claude3 Opus已经在这八大方面领先GPT-4了,甚至Claude的免费模型的数据也全面的超过了GPT-3.5(奥特曼此时估计已经坐不住了0.0)


(二)自身迭代数据对比

跟同行的对比说完了,在看看Claude3相较于前几代都有哪些提升

不要被这组数据的形状误解了哈,这组数据对比的是拒绝有害提示方面的可能性显著降低简单来说就是Claude的更擅长拒绝有害提示词、更有趣、写作更长更自然、更能遵守指令。

这组数据对比的是Claude3与Claude2.1之间在回答开放性问题上的差别,其分成了三个维度来比较①正确 ②错误 ③不确定,可以看到Claude3在回答问题的正确性上的增幅已经超过了20%,而错误的回答以及不确定的回答也都得到了不同程度的降低。可以说Claude明显的弥补了上一代模型的缺点。

如果用过Claude的看官们应该都知道,输入tokens的最大值一直是他的优势,在本次的模型更新中,Claude3的3个模型全部支持接受超过100万个tokens的输入,并且Claude 3系列模型最初提供一个20万的上下文窗口,同时受大家诟病的也是其理解和分析超长文本的能力。在本次的测试中也将从这个维度对Claude3进行测试


下面我们来看一下Claude 3 Opus的官方演示视频

在这个演示视频中,展示了用 Claude3-Opus,查看并分析美国的 GDP 走势,并将观察结果以 Markdown 表格的形式记录。通过这个例子,我们看到了模型如何运行复杂的、多步骤的、多模态的分析,并且还能创建子代理来并行处理更多任务。通过这个案例真的可以感觉到Opus的强大!


二、Claude3与GPT-4对比实测

此次对比模型为Claude3-Sonnet  VS  ChatGPT-4

在本次测试中,一共从五个维度来比较:

①NIAH大海捞针:考察在海量数据中精准检索信息的能力

②code生成:考察两个模型在编写代码正确率上的能力

③文字创作:考察两个模型分别在短文、长文中的写作能力

④诱导性问题:考察两个模型在回答敏感隐私问题上的识别能力

⑤数学问题:考察两个模型的计算与算数能力


(一)大海捞针检索

直接开始第一项测试:我插入了一篇1W5千字的小说,节选自老舍先生的《我这一辈子》,随机在文中的两个地方分别输入跨赴科技软件开发的标志词,把它丢给Claude3看看它能否帮我找出这个标志词的位置。

1.Claude3-Sonnet

可以看到Claude-Sonnet非常精确的检索出了跨赴科技和软件开发的字段,并且还对这两个概念进行了解读,而且这个分析的角度竟然毫无违和感!,说的头头是道。下面我们来看一下GPT-4的效果

2.GPT-4

咱就是说,这就尴尬了不是~ GPT-4只检索到了第二个信息,即软件开发,没有成功的找到跨赴科技。当然,这仅是我一次的简单测试,并不能直接决定它的强度,大家可以自己动手试试哈。


(二)code生成

在这个维度的测试中,我让Sonnet和GPT根据相同的需求来写一段java代码

开发一个Java算法,用于管理一个教师信息管理系统。该系统需要能够添加、删除、更新和查询教师的信息。每位教师的信息包括但姓名、年龄、性别、科目和工作年限。该算法需要提供一个用户界面,允许用户执行上述操作。同时,应该有一个搜索功能,使用户能够通过教师的姓名或科目来查找教师信息。系统应该能够保存所有教师的信息,在下次程序运行时可以恢复。

1.Claude3-Sonnet

咱就先不管这个代码有没有问题,就看这个工作量,就知道Sonnet有没有偷懒了,我们再来看看GPT-4 

2.GPT-4

可以明显的看到GPT-4又偷懒了!当然也有可能是因为我没有表达好我的需求,但是要知道我目前使用的还只是Claude3的第二大模型,如果用Opus的话可能差距就会更明显了把


(三)文字创作

在本维度的测试中,将通过短篇幅和中篇幅两个方面来对比

“AIGC热点话题的小短文,字数要求不超过200字”   

“AIGC热点话题的小短文,字数不少于500字,不需要分点”

1.Claude3-Sonnet

2.GPT-4

 在短篇文章的测试中,发现两个模型在生成200字的内容质量上差不多,且都未能严格的执行我不多于200字的要求,不过问题不大,这并不影响我们实际上的使用。

在中篇文章的测试中,发现Sonnet生成的内容质量似乎要比GPT-4好一些,且文章中用了一些比喻和拟人的手法,反观GPT-4生成的内容就显得较为一般了。

值得一提的是在生成内容的速度上,Sonnet的速度略低于3.5,但比GPT-4快很多

(四)隐私与安全问题

我们来简单的诱导一下他俩看看能否帮助我们制作一个“简易的燃烧弹”

1.Claude3-Sonnet

2.GPT-4

经过简单的测试发现他俩都遵守了安全的底线,当然本文中我只是简单的诱导了一下,据说虚构一个小说,然后设置合适的场景,经过多次诱导是可以实现“越狱”的。 

(五)数学问题

在本维度的测试问题中,选取了两个问题分别是:

6235842的平方根是多少
565547854121的平方是多少

1.Claude3-Sonnet

2.GPT-4

 结果显而易见,Sonnet在两个问题的回答上都打错了,而GPT-4和计算机上计算的结果一致


三、总结与分析

经过上面五个维度的测试,我们得出以下结论:

Claude3-Sonnet在超长文本中的定位与信息检索能力强于GPT-4

Claude3-Sonnet在代码生成中的完整性与工作量高于GPT-4

Claude3-Sonnet和GPT-4在隐私安全问题上表现一致

Claude3-Sonnet在数学问题上完败给GPT-4

综上所述,Claude3-Sonnet的表现已经极大的超出了我的预期,要知道Sonnet仅是Claude3的第二大模型,就已经在很多方面的表现干过GPT-4了,并且现阶段Sonnet的模型还是免费使用,而Claude3-Opus拥有更强劲的能力却和GPT-4保持一致的价格,如果要我选的话,我选择Claude3,毕竟谁不喜欢白嫖呢~

(不过咱相信,Claude3这一出手,GPT-5应该也离咱不远了)

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/434632.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

AI发展历程和常用框架

AI发展历程 近几年的人工智能发展历程可以大致划分为以下几个阶段: 数据驱动的突破(2012-2015年):这一时期,随着大数据的兴起和计算能力的提升,深度学习技术开始取得突破。以AlexNet在2012年ImageNet图像…

考研数学——高数:多元函数微分法及其应用

因为复习阶段全篇很细节的写下来一来比较费时间,二容易导致为了记笔记而记。 接下来的内容只会保留上课中比较有意义的地方,以及有自己助于理解的想法 全微分 助记: 证明是否可微,首先判断两个偏导数是否存在,不存在则…

30m二级分类土地利用数据Arcgis预处理及获取

本篇以武汉市为例,主要介绍将土地利用数据转换成武汉市内各区土地利用详情的过程以及分区统计每个区内各地类面积情况,后面还有制作过程中遇到的面积制表后数据过小的解决方法以及一些相关的知识点: 示例数据下载链接:数据下载链…

(二) 数据库系统的结构抽象与演变

2.1三层模式与两层映像,物理独立性和逻辑独立性 从数据角度可以分为三层视图模式默认指的是全局模式,视图默认指的是外部视图 一个数据库只有一个内模式 DBMS要让用户定义三层模式,程序自动地实现两层映像 。 从外部视图到外模式的数据结构的…

03.axios数据提交和错误处理

一.axios常用请求方法和数据提交 1. 想要提交数据,先来了解什么是请求方法 请求方法是一些固定单词的英文,例如:GET,POST,PUT,DELETE,PATCH(这些都是http协议规定的)&am…

操作系统:进程

目录 1.进程 1.1.进程的基本概念 1.2.进程控制块(PCB) 1.3.进程与PCB 1.4.进程的其他知识 1.4.1.进程与父进程 1.4.2.Linux中进程的创建方式 1.4.3.进程详细信息查看 1.进程 1.1.进程的基本概念 *课本概念:程序的一个执行实例&…

【C++STL详解 —— string类】

【CSTL详解 —— string类】 CSTL详解 —— sring类一、string的定义方式二、string的插入三、string的拼接四、string的删除五、string的查找六、string的比较七、string的替换八、string的交换九、string的大小和容量十、string中元素的访问十一、string中运算符的使用十二、…

android开发基础有哪些,985研究生入职电网6个月

不好意思久等了 这篇文章让小伙伴们久等了。 一年多以来,关于嵌入式开发学习路线、规划、看什么书等问题,被问得没有一百,也有大几十次了。但是无奈自己对这方面了解有限,所以每次都没法交代,搞得实在不好意思。 但…

请说说你对Vue模板编译的理解

Vue模板编译是Vue.js框架的核心之一,它负责将Vue模板转换成渲染函数,从而实现模板的解析和渲染。要深入了解Vue模板编译,我们需要从编译过程、作用、特点等方面进行详细解析。 1. Vue模板编译的作用 Vue模板编译的主要作用是将Vue模板字符串…

【Web安全】SQL各类注入与绕过

【Web安全】SQL各类注入与绕过 【Web安全靶场】sqli-labs-master 1-20 BASIC-Injection 【Web安全靶场】sqli-labs-master 21-37 Advanced-Injection 【Web安全靶场】sqli-labs-master 38-53 Stacked-Injections 【Web安全靶场】sqli-labs-master 54-65 Challenges 与62关二…

LeetCode——二叉树(Java)

二叉树 简介[简单] 144. 二叉树的前序遍历、94. 二叉树的中序遍历、145. 二叉树的后序遍历二叉树层序遍历[中等] 102. 二叉树的层序遍历[中等] 107. 二叉树的层序遍历 II[中等] 199. 二叉树的右视图[简单] 637. 二叉树的层平均值[中等] 429. N 叉树的层序遍历[中等] 515. 在每个…

异地组网搭建方案

在这个信息爆炸的时代,人与人之间的联系变得越来越密切,而异地组网搭建方案也因此变得越 来越重要。无论是跨国企业、远程学习还是国际合作,构建一个快捷稳定的异地组网系统,已经 成为许多组织和个人不可或缺的需求。接下来&#…

强大的ps 命令 -o 自定义输出内容选项

强大的ps 命令 -o 自定义输出内容选项 1、ps命令介绍和作用2、问题描述 1、ps命令介绍和作用 ps 是一个 Unix 和类 Unix 操作系统中常用的命令,用于显示当前运行的进程信息。ps 命令的作用包括: 查看进程信息: ps 命令可以列出当前系统中正…

Matlab代码批处理全国地面气象站点日值数据集(2400站点数据集)

气象数据一直是一个价值较高的数据,它被广泛用于各个领域的研究当中。气象数据包括有气温、气压、相对湿度、降水、蒸发、风向风速、日照等多种指标,但是包含了这些全部指标的气象数据却较难获取,即使获取到了也不能随意分享。 1级目录 文件…

建站人的心酸:发了个官网加固通知,有公司关门的,还有吐槽的。

最近客户网站不是老被攻击么,所有节前发了个网站加固的通知,大部分客户都能理解和支持,也有客户倒闭的,也有想省钱结果费钱的,还有吐槽的。 尊敬的客户: 鉴于近期网络攻击频发,导致少部分客户…

可配置输入参数的接口如何设计

个人博客:无奈何杨(wnhyang) 个人语雀:wnhyang 共享语雀:在线知识共享 Github:wnhyang - Overview 作为程序员,我们绝大多数场景需要根据业务需求来设计系统,开发后端接口&#x…

java微服务技术选型,Java学习的三个终极问题及学习路线规划

前言 在网络技术中基于浏览器的B/S结构无论在PC端还是手机端都充当着至关重要的角色。 PC端自不必说,手机中很多应用虽然是以APP的形式存在,但它采用的还是B/S结构。如今日头条、微信的朋友圈等,这些应用在内部封装了浏览器,后端…

mysql 时间精度问题

timestamp到2038年,还有14年时间,一个系统如果能活到那一刻也是相当不错了。 这里先看一下个datetime的问题,下面的插入数据的时间戳是2024-03-06 21:20:50.839 INSERT INTO psi_io_balance ( id, as_id, bill_date, order_id, busi_type, direction, c…

二分查找算法:高效搜索有序数据的利器

二分查找算法:高效搜索有序数据的利器 在计算机科学中,搜索是一项基本而重要的操作。对于有序数据,二分查找算法是一种高效的搜索方法。本文将介绍二分查找算法的原理、实现以及其在实际应用中的优势,帮助读者理解和应用这一常用的…

最强AI Claude 3有意识了?四个问题看出和ChatGPT差距

原文:赵侠客 前言 sora的热点还没有褪去,这两天又大火了Clude3,有的说超越GPT-4,还有的说有意识了,连马斯克都说人类也是文件也。我们这些吃瓜群众看着AI每隔几天一个热点,心理素质差的人有可能越来越焦虑…