爱吱声

标题: 中外大模型数学能力比拼 [打印本页]

作者: 可梦之    时间: 2025-1-26 17:34
标题: 中外大模型数学能力比拼
本帖最后由 可梦之 于 2025-1-26 17:57 编辑
+ l* j- K# a# W+ r/ l9 L$ j0 _. ]5 l/ ~
遇到一个数学问题,懒得推导了。习惯性让GPT推一下。
+ }2 v! a* f% ~" d$ g  S
8 g. V: _4 C' D* s: V+ {最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。
. {' [9 Z1 j, f& T9 ?( }5 i) k: k- X" ~6 C+ d
5 E9 {5 O, N& l2 i
可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解
. }* R" G0 n8 g! `6 W8 N, s6 X! @1 a$ d5 I' l; q+ I* Z

9 I5 y2 p) t* w, Y
; j$ r! m  @! c$ m" V# S9 s* K5 Z) M7 X  R' V" a5 Y

* X! r+ @$ M; {( P要么继续胡说八道。9 |( |9 C3 a5 E, L) g, G
3 X; K' Q. R" [0 c' e
. a6 ]8 Y6 W; d" d; c7 \
抱着试试看的态度,把同样的问题扔给了豆包和deepseek。
: j) w' A" i3 k% C
% m7 z7 z8 b- K6 I' V: G# S2 a! ldeepseek速度快,结果也对,但是过程是不对的。( P0 y& X: B& n. o2 w% o+ o
/ f4 X0 ]% K9 c; Z5 p

7 y; q- F$ Q! \; y+ F! p- X4 W豆包过程比较绕,但是基本正确,结果也是对的。: E# a5 g2 V, H% v5 `, A

4 @3 V# {! J9 U# v. H: ^# ~
( `. _1 N9 [6 z* d当然,都不如人推导的哈。. n$ t+ S: s- z6 F( W1 g! [/ y* P

# r5 F' D0 ]+ R& A0 ^
1 I2 q( l& ?3 s/ y过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。
. q- m4 H8 p. U9 X! C8 {
: k0 X& r' e% J5 _* {) ^/ z虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。5 [9 L5 C! ~* y

# w- ?  t# T+ F+ h' U5 C3 i1 |* X4 y2 j. }5 T2 f

9 x8 ~9 v" m8 ]  S1 R- \9 m+ b5 S6 w( Q# C3 W  q* b2 w
. Z  w+ T" B! d  R( ~0 o0 y( w$ ]3 s+ J

作者: 可梦之    时间: 2025-1-26 18:52
个人推导错了 落了一个系数2.
, p) L1 r* N; o. r/ h' d: L. `% X- z! r
这也是我们需要AI的原因啊
作者: 马鹿    时间: 2025-1-26 22:43
我没用过花钱的AI, 但是我觉得各有优缺点吧。+ L" c7 k( {& i, I9 L+ s& c8 p3 d

1 [- R7 e; h3 W1 E8 g# L3 x/ s要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。$ K& t) ~1 F$ L: B" i. O
. R, O' U0 D1 }3 }5 f6 J- X4 u  E- |
即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI( E9 _% t5 v4 v+ ?
0 x( }% t: h6 }
现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;  r- ^* d% p/ ?$ u7 b( o
另外的一个笔记本我基本上只常规使用搜。) `' b$ x1 Q) W( k( w- i7 ^; [
) y1 l( @* h" d! J$ ]: k' U
我个人的本上装了好几个AI, 经常每个问一下。
作者: 方恨少    时间: 2025-1-27 01:55
马鹿 发表于 2025-1-26 22:43
3 b8 D8 W# U/ |/ S7 U: o我没用过花钱的AI, 但是我觉得各有优缺点吧。
' ]3 S# q) l4 t
. B- Q2 f6 P+ N# y5 I+ E. n' v要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
我个人的本上装了好几个AI, 经常每个问一下。

+ }, k) }1 b- m0 g; ?( d# ]# @* i3 u9 W0 z& Y
所以到底哪个更好?
作者: 松叶牡丹    时间: 2025-1-27 03:30
Chatgpt数学非常不行。以下是个典型例子:
0 ^4 f" s6 J7 I# i5 y2 Q- X7 A( ]
9.11和9.9哪个大4 _* ]0 H) R) ^6 T+ C2 d
ChatGPT said:
8 i: b/ e( i( h) Z$ @, mChatGPT. m( P! p2 p' n/ l% w/ N' q' h+ T
9.11 比 9.9 大。
2 q- }2 l8 O" _4 j+ N
( ~1 H) C+ b$ F+ @* K5 g8 m5 `原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:) @; E, u- X% P8 g& t8 o" V' ~+ X

* @8 g. e  \( k% {" @( }9.11 的小数第一位是 1,9.9 的小数第一位是 9。* G& T4 q1 A: |8 L1 }) b
由于 1 < 9,因此需要继续看下一位。
# x1 v- V# l# j6 K7 p* E. E' [9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。! s6 O, ~4 W* N2 G( }
因为 1 > 0,所以 9.11 > 9.9。
作者: 马鹿    时间: 2025-1-27 03:44
方恨少 发表于 2025-1-26 12:55) C8 H/ g0 K& ?! _" a" u. T8 @% G
所以到底哪个更好?

  G; U; h: v, m2 [$ t说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。




欢迎光临 爱吱声 (http://www.aswetalk.net/bbs/) Powered by Discuz! X3.2