爱吱声

标题: 中外大模型数学能力比拼 [打印本页]

作者: 可梦之    时间: 2025-1-26 17:34
标题: 中外大模型数学能力比拼
本帖最后由 可梦之 于 2025-1-26 17:57 编辑 + D8 q" |& K4 d; A1 ~1 V1 V2 q- g

% t0 M; n7 r& i. Z遇到一个数学问题,懒得推导了。习惯性让GPT推一下。! F8 V  [* V7 ]; [, T
7 z- E7 V. W9 _: p) X
最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。  z$ f, I. s3 E" G

- K0 M# I( s5 M- @9 ^9 P& H9 \- ?" Y9 T: s& x. O% M
可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解5 g+ o- w8 l4 b# Q
7 f0 E0 Y  q: ?
0 q1 d9 C2 X8 J9 v, D
# S, z- p  H  m5 k" `

) F$ F. q8 r) Z0 ]
0 R" w  s) G! l+ t  a要么继续胡说八道。
1 ^6 C' E5 m& r& c
2 u: \  E* ~7 s# B3 a# ]* x$ m* F8 y
抱着试试看的态度,把同样的问题扔给了豆包和deepseek。; c9 H# i& o" ^* n! G' @

3 }7 x3 J. s$ xdeepseek速度快,结果也对,但是过程是不对的。
9 h" f# F, `/ S; S( c3 ?) I
/ M6 O# R/ s" I: ]
) P, e6 X& {4 ^! I5 u3 x豆包过程比较绕,但是基本正确,结果也是对的。
4 ?& Q) |5 q8 J5 ?4 L
6 ^. g& ^1 W; p# d* G7 |$ K6 r4 z+ e$ k* O
当然,都不如人推导的哈。; z/ ^' D) m% p- |) ?$ w; X
* N/ F0 P! l" _  f) g+ f" v4 z$ v! D
  G  b) H( k; C) f
过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。  W( G" [! _! Z2 A! C: K) o

2 l: t* `% B  F) M9 r2 a5 ~5 p4 U" s虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。2 p& m; A# ~( ^

3 I5 c2 ]3 p; ^+ d, }/ M
7 P9 f- u, l5 U+ X7 z: f
) w  I6 ^  p: }& n  a
0 ]+ [. f1 \6 f* C3 o/ S" b
& F% X' B+ ]  Q7 V- M' K1 v* V' t
作者: 可梦之    时间: 2025-1-26 18:52
个人推导错了 落了一个系数2. 3 @1 R+ y* R" l! M# s
/ z9 H# X+ b. p
这也是我们需要AI的原因啊
作者: 马鹿    时间: 2025-1-26 22:43
我没用过花钱的AI, 但是我觉得各有优缺点吧。
$ R' ~! x3 ~0 y, O( U: x* b; m/ e' x- {4 r1 S' a- o: y! \5 v( s
要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。( ]( M) ^; D, _% ^

/ H8 E6 h1 _1 k8 f: F3 `: `, h即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI。 1 @5 F' Z( ^( p, M; A

  i, m. h4 H2 {  o  h  q' b. `现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;
7 N8 _' E8 H7 f6 D9 P) y* J另外的一个笔记本我基本上只常规使用搜。
+ \$ W! t% z0 P
4 q7 i/ I/ T- X: Y$ ^6 k; `我个人的本上装了好几个AI, 经常每个问一下。
作者: 方恨少    时间: 2025-1-27 01:55
马鹿 发表于 2025-1-26 22:43
8 U/ ~& e5 ?% L我没用过花钱的AI, 但是我觉得各有优缺点吧。
% c( }" \0 u6 H5 w6 c
" j" P6 M% Q6 f# r1 P: N, j% K2 y要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
我个人的本上装了好几个AI, 经常每个问一下。

- J2 v$ h& l# Q. l+ ~
& Z2 T+ Q+ M1 V# Z( U所以到底哪个更好?
作者: 松叶牡丹    时间: 2025-1-27 03:30
Chatgpt数学非常不行。以下是个典型例子:
% v5 I* a0 B* ?+ x3 {) n
: f. {  z, e9 J9.11和9.9哪个大
% d8 H! \3 t# |& Z& ?9 x4 L( FChatGPT said:
% w; b; E" n7 `3 X+ UChatGPT
& S. X* J$ @7 r7 I4 K5 z" c9.11 比 9.9 大。4 K1 S/ t$ n* |' ]

9 }: i0 V" |& f7 @& N9 f原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:; G% `/ Q/ f% Q0 s' m/ {: N
$ [! Q8 b5 Y- W
9.11 的小数第一位是 1,9.9 的小数第一位是 9。
3 x0 \. Q( x9 {6 e3 e7 l由于 1 < 9,因此需要继续看下一位。4 H9 r- S% u9 s6 i+ h2 a
9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。- R: ^5 p3 B8 N6 h8 X
因为 1 > 0,所以 9.11 > 9.9。
作者: 马鹿    时间: 2025-1-27 03:44
方恨少 发表于 2025-1-26 12:55
8 \" w! Q# O( m$ P8 |  Y所以到底哪个更好?
- ?. U1 J; r* e2 W9 d9 P0 H
说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。




欢迎光临 爱吱声 (http://www.aswetalk.net/bbs/) Powered by Discuz! X3.2