设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3980|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 4 K9 W7 w: B: Y, A# S
2 x, k% ?' ?3 O4 a# V" M/ T$ P
把PDF上传,然后让他抓取文字,并修改可能的错误。
: a) `, p, s1 p* C然后deepseek完美的完成了任务。
4 I8 O1 ]0 E5 B# V7 @/ ^段落清楚,列清楚,页眉页脚全部去掉。
1 W/ t& J. [/ E$ S- E# F/ v我要疯掉了!7 ^! A3 h1 y3 X, J- |
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
# c( [  r1 z, w! b0 V4 ?====% r$ D1 P; m6 u  S, x( z
中文也很完美。% r: Y/ g% U5 l1 R
经验值,每次十页比较稳定。
* H2 N. j8 D" h" \* i& t" U现在我这里API还不能用,等恢复了,全自动了。' _2 i  c: C& O& n% s" Z
====
+ u2 y) i" m& l. [第二次疯掉了!
( _- @& W( R" H, n5 L我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
( b0 a3 X$ X6 D: y% t* v3 s/ n====# N% k; c! Z+ N7 V4 z) B
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
% ]$ U# f3 G8 L5 V4 n% V但是任务多了后,每次翻译的页面数是减少的。5 K" E# {- M& P+ H; {8 h( r
好吧,我五体投地,继续探索。
8 p  F( P  T7 W9 H/ H. n$ o. v) B====
0 m; C4 Y! h  E为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
/ v# r, I: b' Z5 y- |====
# ~) U/ y+ j( i. Y9 X0 W* l好吧,有些东西是不给翻译的,哈哈。
  O1 X  o3 D1 K7 j2 M! n& S4 u6 D
Sorry, that's beyond my current scope. Let’s talk about something else.
. Y5 }! _6 J1 G+ Q! \: F====/ x' N1 C; h+ q* J- u; H# i
然后我的英文命令也让deepseek 帮我修改,呵呵。9 U) o1 i, F9 d1 q2 C! r8 k( W% Q
====
5 M) V! N6 \% w3 a: E日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
1 S8 \' [  y5 Q, p8 b* ?5 D! L0 T====; `' ?6 {* a$ V" L# k: X% N. W+ P% s
时间段的话,北京时间的下午和晚上用比较好。7 B; i0 }! @" h* g
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
3 s  \; }$ i/ i% r1 p====% V, v# w: w* t) E9 Y* ~% ]
用千问吧,非常稳定,非常强大。6 z9 q7 |/ n5 }2 o
https://chat.qwenlm.ai/
1 f0 P' g. r; a6 Z====
9 X1 u  K$ Y1 c1 h0 }" O* [Deepseek,API 看上去可用了,但是不给充钱。
# t$ ]2 @' M1 y' t. J
+ l; E& |: B5 `; S- z; |% t6 |: o7 @, y2 f. I# g8 P6 e' v
  ]  B8 M6 {% F

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    昨天 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    : Q  l6 O  r7 b这功能很赞呀

    + e8 q$ U+ c& @0 ~& [0 O简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    衰
    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13, f0 C! |9 K1 a1 g
    有没有上传整本书试试
    2 Q# Y1 W3 l( c2 \7 i* J" z
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    昨天 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 ( C" x: B3 B5 f8 B: u& v
    3 @3 {$ E5 ^2 V; U1 k& `4 z
    以后让deepseek 读出土的竹简
    0 ]6 q7 J) z8 ~& ]8 F4 g% B' K# S5 {
    / m/ i0 j: L. O# e& q% _还有把古文翻译成现代白话
    ; i  b8 G7 j- G7 u7 J- ]8 e
    ! Q0 M' X* u) x以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    前天 12:04
  • 签到天数: 3069 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    0 B2 l: V1 o/ _8 R! k* k% n& Z6 J# e& Y7 Q% k
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23/ n0 e+ `; z9 O/ s. C( A
    请教是如何实现的?
    # _( R% V+ w& `! q% L2 Y- J: Z* b$ _9 K  H/ n; j
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    0 v: s" f: {8 ~; C% d2 Q
    , |6 ^$ C. o/ u; [5 P, s% X! N( Q; _我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    ( c  H) O1 }' G/ k文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    " \* Z1 O' c% _: f1 I, ?1 |5 z美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    ; @9 S& E" X; ~1 c

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    ; X! _! y  L; m! I- }请教是如何实现的?
    2 c& P0 T5 l6 H+ @9 I/ D5 W
    ! I' _5 w% d/ K5 S, l  T我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    / L5 k2 ]7 l4 T) J( |https://chat.qwenlm.ai/7 x) z% |7 `7 J- l1 F
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    ; y( @4 G* w0 t1 `# r( _' @很稳定,质量不错,好像最多一次处理15页。6 v' Y. r" f% K( X$ G8 L
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    昨天 00:03
  • 签到天数: 3177 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
      b; N1 P5 Z2 s* x0 c2 x处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
    1 A. s$ T. h; W5 l1 k" t这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。: A3 k& d' M7 {5 I" I: k# r6 C/ x
    7 B' {4 j# e% x
    https://github.com/oomol-lab/pdf-craft: w4 ?% O* k  V

    ) {1 D6 [% S2 W. g1. 这个工具要求装 python3.10
    8 z! c6 F. m( }2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0- L: y) `5 |& H5 i: ?7 a( j
    3. pip install pdf-craft
    1 A1 t; @. G9 O1 Z4. 把下面的内容写到一个文件里,例如 a.py
    9 T0 t6 o6 U  b! `2 m" |3 Q
    # j% ~- T# b4 t  B
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      0 x& Z) |3 k# u5 U+ p) C3 _

    2. 3 [7 @0 L; a2 L- }( e
    3. extractor = PDFPageExtractor(
      $ y" n9 m* I% ^6 J3 n8 [
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      ; K; @% t6 P% B; ?3 E
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed; E7 J) a  m  X
    6. )3 ~4 [' ~) T. g0 Q
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:( F3 z: U- F) m$ g5 B" x1 m. i: }# w
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):5 z2 @. O& C2 o6 N
    9.     md.write(block)
    复制代码

    ; n: }! }) k! v, ~6 F  `& R) ?. I  q" l* ^! I
    要修改的内容:4 ?$ X2 H% t& E/ G- k
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型- M/ j6 Y. F+ H, c# ^# q; ]
    4.2 markdown_path:输出的 markdown 路径文件名
    9 m, o' }, X0 [7 C4.3 /path/to/pdf/file: 输入的源PDF路径文件名# A2 V: K# f. @; b7 |# P. u
    # m& j; D+ d6 d5 Y1 e9 i& V+ B
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    7 E4 Z9 b. P# I0 |- n, D& `4 @
    & P' H! o( s$ n3 t; c# ~5 ?目前为止PDF转纯文字的最佳办法。
    4 p2 [% z* K% K( j3 V0 R先写个小程序,把PDF按章节切成小的PDF。
    ! H/ t8 q2 k: u& B然后,把PDF一个个传到deepseek,让她抓取,除错,输出。1 \8 Y- u( i1 l3 v( k0 U
    效果非常好。  k2 H+ j$ s$ k% _5 \) S

    ; l  k8 ~0 V) S& Y5 C$ sdeepseek,qwen,chatgpt 三个,deepseek是最好的。
    1 [  S" r1 }7 b% A/ D8 ]4 }# I2 c9 S) d- X& N, v) @6 `$ j* p
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。; w" W# w3 {* t2 j+ Y7 [9 w  P8 f
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。6 \! a4 n& C9 m7 W! I$ {
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    ( a. O* b. P/ i& G
    * o& _2 {8 b0 l, [1 D. gAPI到目前为止,差强人意,不如网页版本修得干净。
    ! O* ]/ H9 G2 j9 m& y
    5 b3 B/ M3 U7 j7 g' Gdeepseek可以同时开四个。9 c; u/ j: N, ]% V7 r

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 + Q7 J( G1 ?) |  W$ q: R" h/ k

    / O% C* X1 Y  G. b) r让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    / v) c3 Z2 Z  H/ U* S6 I让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
      s0 e# `8 j- g8 ~' d7 l; q" n
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33+ S9 A. @+ I+ x1 j: [
    细说一下,听上去很不错,多谢。
    2 J. x" @5 e% V! {- }. |" p2 D
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    * g" q6 w. H( y/ A  N
    0 }2 x5 K+ E  E已经搞定.
    8 D5 \/ ~( X/ m1 ]2 s  y# s& Y; H
    $ C- |2 p8 f2 {3 I% |; F; ^1 ~2 B首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。. E  X$ t/ }' o6 K6 {

    5 N' u1 v. q& @8 n1, python + pypdf 按章节拆分小的PDF. ~, w" Y' N) z: h8 [# d; r; Y
    ) z/ }  h* h0 M6 e: B) a) y& I
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    % d2 f  L3 `1 m% I6 ]) t, c6 ]2 P, w  R0 ]9 h; w
    得到text file
    * t3 |  E' U1 ]+ ?
    % T, V* X3 }1 M. e4 @% [8 v+ `2 `3, python 读取整个outputfile,丢给deepseek 矫正。& p& X: u" Z; O3 U
    ' q0 e5 r4 i' C3 {; i5 x1 ~
    模型是 deepseek-chat3 T( s) b# ~; N8 h5 t, I

    ) |  \! A0 p! `6 i# {/ h7 Fmax_tokens 最大是 8192,别的不用改。
    8 `1 Y$ C& u0 O2 J; P9 ^$ R/ v' q8 U# R$ H. ~2 s
    参考:
    - P3 Z' f8 M0 s; G0 s! ahttps://api-docs.deepseek.com/api/create-chat-completion/ Z3 k3 e2 n$ W& Z$ d

    $ i( P& q% W0 X) E5 H* S7 W4,费用:9 W$ Q/ P, v# X4 R$ ?+ R9 k/ N+ ^- L2 ~
    2 g* J. ?  ]7 p7 u
    实测:
    " X3 ^, e) @2 _5 l; }  f8 P  Y4 j$ N  }0 x8 i: u! V
    296K 字母,用了 9 美分。# y1 f8 C$ \* ]! d( K3 I$ E$ ]' _6 T
    8 m$ |  Z8 W- U+ N+ g* u/ t
    英文字母 到 token 用量大约 1/3
    ; R! O; b7 u! ~0 M) `% Z9 n4 M) t; R4 {! }  @( g3 ?" f
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    + O. h( m$ Y# ^4 s" i
    + A6 M1 n( G- \. z  v4 m32899 个字母花费 11782 tokens,包含输入输出的 tokens- H" o8 ^" i6 K! N; Z/ n
    8 ?3 f; \: a7 r- }% Q8 R9 x5 r6 i- M
    价钱,非常非常便宜了。3 V1 e6 \' G4 V

    . R( ~4 Q) M' A! R3 x参考如下可以计算,懒得算了。
    , T3 W# U% z* [+ o$ \# b8 Q3 ?9 i& t0 u! {0 ~5 K
    https://api-docs.deepseek.com/quick_start/pricing( r* i( m: H% L/ r, Q% |# j/ U

    6 _& g$ j; ?- C8 S7 E- F( _1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    0 }1 A" W: q3 t  J1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    - I* p- A# Z" L. d" r5 F" C0 Z1M TOKENS OUTPUT(5)                                              $1.10                $2.19% h& g$ H- w+ ?7 f: z* G
    3 j$ b, ~$ @7 C! `8 ^
    5, Balance
    - L2 F# C# z$ n+ f0 w' ^, N8 R$ L7 b7 Z. h5 ?$ l
    可以在程序里调用,知道每次运行结束后,balance还剩多少。$ O; A- p7 _! A7 [- w& V
    参考:
    5 W  v# [# p- X6 [https://api-docs.deepseek.com/api/get-user-balance
    9 X- i, P& p6 q$ q/ Z, i
    6 {$ h. f) e- H8 T2 H6, Models0 B5 l9 K7 o, z+ H+ H
    * M& ]/ D( y( Q& ^
    目前就两个: Q" b+ v6 l$ c! V8 b# N$ U
    # deepseek-chat7 @; c; |0 X$ j% d& K# G  m
    # deepseek-reasoner: \. J( j* \4 O4 T. x& U3 ]
    2 ?, @" f3 ^7 ]2 X% D1 ?2 W$ e, c
    参考:# b% L2 W+ C! s2 U; e, H: C
    https://api-docs.deepseek.com/api/list-models
    , A. C  L$ s, m! z
    6 @/ h) \2 `: `+ _0 D8 ?- B3 \% H+ P& V& o7 J' P& `$ I& o
    7, 问题( c' A1 Y4 R9 Y8 U- V/ S

    9 W! Z2 `* m4 u2 U2 jdeepseek 会将前后两段合成一段。
    : ^5 ?+ c* ^1 d特别是那种大量的对话的段落,deepseek会给你合成一大段。" V. [) j3 ^5 i6 @

    : |! A4 u7 Z" v  C# t8, 钱说了算。; J3 {! K1 u4 }2 W) L& O; d
    3 r! L- o" I& Z9 W9 a7 X
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    + |' k( Y8 C9 y3 F9 h7 j8 N" \9 }但是API就不会出现这种情况,毕竟我们给钱了。
    9 Z, s+ R1 [5 o6 J# e* X- Qchatgpt也是这样的。3 V- _) O- j/ K4 I+ t6 i% z* R) o

    2 H* k3 |4 O  N% j0 X$ ~3 M. c
    7 F4 M6 N2 t1 Q3 }# Z* d( r! v

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-25 08:35 , Processed in 0.066431 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表