爱吱声

标题: 中外大模型数学能力比拼 [打印本页]

作者: 可梦之    时间: 2025-1-26 17:34
标题: 中外大模型数学能力比拼
本帖最后由 可梦之 于 2025-1-26 17:57 编辑
: r8 H7 q5 W' Y' l
: q$ ?# q# R! k& F8 r$ w  Y遇到一个数学问题,懒得推导了。习惯性让GPT推一下。
' o3 {6 l% O  p8 ~
1 B3 V7 N7 z; U/ A8 E最开始问题给错了,然后纠正了一下,貌似GPT就鬼打墙出不来了。给的答案也不对。* B' R3 q% q( t! l$ b
) ]* l( i( O. R1 b+ x1 a7 C

7 e" ~, d) m: m% Y可能受上下文影响。那重开一个对话,结果还是不对。要么说没有解% A- {0 `; v& }* Y; k! u
  j% u& k  j; F7 x/ Z
, R: F: f, w' V( F1 B
  v7 v/ M6 K+ t) w3 L

+ O/ j& l# m$ {- Y) w, P; x) L- j7 Z2 Z5 M( p9 _' G# I. A: |
要么继续胡说八道。2 h# e8 x7 k8 R" n# P- R& q5 b# S; `9 e

5 ^0 L  J7 G# [. ?2 R/ N4 e
( M/ G2 y- m( J- F抱着试试看的态度,把同样的问题扔给了豆包和deepseek。4 |5 T  h/ Q0 {" y# r
5 g5 t2 F5 u! L8 R) [) a) F4 Q
deepseek速度快,结果也对,但是过程是不对的。4 d' x5 a2 I( o# n! c' @/ z; n
" L/ s& y$ m' z, z# x9 Q0 P. w
  Z+ z, i  h' t
豆包过程比较绕,但是基本正确,结果也是对的。
' C7 o& u% u$ j) u* M7 a& y! ~! P+ H3 _7 Y  T( S. F* Q* f# t% r0 K

; v8 S% J3 s1 A, U当然,都不如人推导的哈。7 y! l( O, c  k; ?3 s: N  ^4 U
* x- ~6 u5 D0 F# `( G
- E6 A7 a9 L4 Y. D
过去一年多,算是ChatGPT的深度用户,感觉也不错,一直花钱买VIP。但是对国产大模型用的不多。一方面最开始用户体验不好,一方面自己内心还是有点看不起国内的大模型。内心是不希望ChatGPT输的,所以反复尝试了多次,还是不行。
- w# a+ K, c! |" g) G
6 w2 ~" b8 w" c- P  i虽然GPT可能被我误导了,换个账号也许就没问题了?虽然这只个例,ChatGPT比国内大模型表现好的多了去了。但却破除了我心中的执念,以后有问题,也会在国内大模型试试了。
: p3 E% e, `$ X% k! [" S: i; v
* V/ Z! x; J* v
+ u1 Z" L% X3 H- [2 @6 d- b! A' i- S, h3 r& v5 q1 `4 b& ]
5 H( G0 f) y: h  U% {: K; h
2 L2 C/ |+ ~. e  c9 M- z2 p

作者: 可梦之    时间: 2025-1-26 18:52
个人推导错了 落了一个系数2.
9 L% w& @# T. z$ Q
! Z$ x  [9 O4 Z' t+ z- H这也是我们需要AI的原因啊
作者: 马鹿    时间: 2025-1-26 22:43
我没用过花钱的AI, 但是我觉得各有优缺点吧。1 J" v; W+ o! \4 e

. k* I1 ^4 B" g- h要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产AI我会特意指名用英语搜国外的资源。+ _6 n5 W3 u( o0 S

1 |3 H* R' V; C5 G) E即使美国的几个AI, 答案也不一致, 我都是一个问题问2,3个AI5 g( Z: {" @" h' r+ u

3 l1 D9 @( o$ K5 u2 h现在搜索喜欢上了AI搜, 平时看我在用哪个笔记本, 工作上有一个笔记本上有vs code,所以顺手用了copilot;- y6 P( w' i9 Z2 T0 d
另外的一个笔记本我基本上只常规使用搜。+ F( ]) K# f4 Q" L' ]' s' j2 M

. b8 Z% R: {" K2 o我个人的本上装了好几个AI, 经常每个问一下。
作者: 方恨少    时间: 2025-1-27 01:55
马鹿 发表于 2025-1-26 22:43
+ h8 E, K( l1 I' [/ p# c1 `/ V我没用过花钱的AI, 但是我觉得各有优缺点吧。# \' J2 x% q5 w  R0 ]  c
* T. g  d7 f7 H) X
要是用中文问问题, 我喜欢国内开发的, 要是用英语问国产A ...
我个人的本上装了好几个AI, 经常每个问一下。

6 |  b+ @4 A3 v9 q7 u: M# b: F. L" \7 A2 D2 T3 j1 n0 X
所以到底哪个更好?
作者: 松叶牡丹    时间: 2025-1-27 03:30
Chatgpt数学非常不行。以下是个典型例子:
  {; k2 J9 I  u: s  v3 Q2 `' T' B. L  t9 `/ q3 K  w
9.11和9.9哪个大
# s7 ?7 G& J2 F/ Y- \ChatGPT said:
0 n  ~! `  Y+ t3 A, t; @1 c0 [& }! U8 bChatGPT' m  V/ D6 g- A7 S7 q; j# p
9.11 比 9.9 大。& u4 d& m" D* \/ _( ^8 d
/ |" Q3 ^: q% p. ]2 N
原因是比较小数时,先看整数部分:两者都是 9。然后看小数部分,从左到右逐位比较:# m2 M0 \; j& Y! q+ x" A" v$ R
2 h; I3 o9 K3 h* ~/ n8 _
9.11 的小数第一位是 1,9.9 的小数第一位是 9。
/ X! ~8 v% s% U5 l由于 1 < 9,因此需要继续看下一位。
# Z+ x) W; a: G; M; ]9.11 的小数第二位是 1,而 9.9 的小数第二位可以看作是隐含的 0(即 9.90)。
1 l1 e) g! e; F因为 1 > 0,所以 9.11 > 9.9。
作者: 马鹿    时间: 2025-1-27 03:44
方恨少 发表于 2025-1-26 12:55
9 N0 \# ?3 H. P所以到底哪个更好?
! z$ i  u9 j; Y) {
说不上哪个好,真有要问的问题 都跟个遍, 看看哪个答案适合自己。 就连平时的搜索我都是bing 和google互相验证。




欢迎光临 爱吱声 (http://www.aswetalk.net/bbs/) Powered by Discuz! X3.2