设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3488|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
# R% w! W, q6 @8 X. U! f
+ S' }) |9 r) i3 y) L9 V& A把PDF上传,然后让他抓取文字,并修改可能的错误。
" k. q6 G6 b! i9 w3 d* D然后deepseek完美的完成了任务。
+ c+ y# b# p' s/ v$ w% [3 ]段落清楚,列清楚,页眉页脚全部去掉。
0 z6 u0 c* j" }3 b' S+ v/ q我要疯掉了!8 W& w; d5 B$ s4 H: z* i2 y& _6 }7 f
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!" I1 W9 y, Q. F. t5 c9 `' r" v
====
0 [1 }# g8 {$ [/ y) ~中文也很完美。, p& s7 ]; g, S# x
经验值,每次十页比较稳定。
# Y4 w2 Z& \' {6 |) J- H现在我这里API还不能用,等恢复了,全自动了。  j) N/ J: L( N/ x- S8 w
====
6 R; e; }8 z8 Z- ]9 C  ?第二次疯掉了!
/ W# E, @: C2 |, F我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
# i. i1 S3 w: O# L====$ |5 ?+ k) `8 C1 q
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。  m6 p9 Z$ L8 Z( W" }: O8 U0 L
但是任务多了后,每次翻译的页面数是减少的。6 S# W4 e% q4 m* m; n+ p& |
好吧,我五体投地,继续探索。/ D. L2 x* H( k4 s# g1 V
====
/ Y3 ^- T# b8 x为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
  N6 ]  n7 \3 ~====
+ O6 D1 ^3 I: N5 w. R7 D, w  I* }好吧,有些东西是不给翻译的,哈哈。
8 v( N1 _* ]" L% M% _
6 H; l1 y( n7 l, ]! v1 mSorry, that's beyond my current scope. Let’s talk about something else./ e& g$ \% Z7 j
====3 \8 g5 X$ D9 M3 }7 O( e
然后我的英文命令也让deepseek 帮我修改,呵呵。
4 {0 N0 u4 R6 O* ?3 F; C====
$ e5 ~0 M! p$ ], r0 s$ r9 o$ L7 I日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
# x; Y  Z0 V2 Y3 ]+ y====& m0 _5 k2 l6 n5 B7 Y: `: I
时间段的话,北京时间的下午和晚上用比较好。
  |/ }% w( i: Z5 _# Q1 i) {+ J5 O后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
1 }/ N" T5 ~9 F4 |" ]# f! `====6 B. \, |; S) ?; ^
用千问吧,非常稳定,非常强大。4 Y2 H. g$ q; k! {) Z5 @
https://chat.qwenlm.ai/
) V5 C4 E+ ^6 e) _* w6 O. E====
$ _- o! p( }" Z2 k/ YDeepseek,API 看上去可用了,但是不给充钱。
/ z5 S3 S) _  a9 E7 N. W) j$ P0 Z7 N! Y/ C! R

$ c0 n) o' A. ?% P
0 u3 p) P" [1 ^& M5 z: s' l0 z

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    5 小时前
  • 签到天数: 3874 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53! `6 G. @$ V- l( i0 e' W$ E1 A! Z+ a
    这功能很赞呀

    ) [( u  _5 k2 l7 P  O3 _+ R简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13  d5 k0 [* @1 \# D
    有没有上传整本书试试

    ( ?+ l; I9 l* Z: r- Z目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    5 小时前
  • 签到天数: 3874 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 ) |8 q8 F- Q4 n
    9 H! K# {/ v! t% s
    以后让deepseek 读出土的竹简; ?1 e7 R# ?6 G' ~
    2 {1 H3 y# F8 g; Z  d
    还有把古文翻译成现代白话
    4 b3 [$ t. i$ J; C$ |7 S* r8 W/ F- q2 l' a1 ~
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    昨天 04:46
  • 签到天数: 3034 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    0 \1 T# M- f; W& u  O8 ]
    9 r2 s. u) D9 }7 A' Q我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:235 K% T- j% f: j" }
    请教是如何实现的?
    & \/ o+ r' h- f: Q
      V* j: L+ z. e4 v# g! D/ \我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    3 \/ h+ h# U- L$ N4 J- R' T1 |$ H6 i6 H  e) q
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    $ V4 U; J& Q$ i6 x2 P$ H文字之类的没问题。估计deepseek现在暂时只保证主要功能。, O, Z' C# }# ?3 m  _: B
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    , \6 M  B% u& \+ Q: j' F2 E; ?

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23' X% o" H6 P+ G" Q2 j! k, A% {
    请教是如何实现的?
    3 k/ w4 O$ _$ f3 Y- F: f
    5 |: P. f, h! P. f0 r% {我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    6 `: w6 [$ {. n& k. T4 \5 K5 Whttps://chat.qwenlm.ai/  n  {# W- ]( d# p% \  i
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    % y& i' I/ `$ W  R( a+ K很稳定,质量不错,好像最多一次处理15页。
    1 Z& W* S& x* ]* _2 @/ I2 @我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    5 小时前
  • 签到天数: 3139 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。8 e0 f0 j% |4 Q4 e- V
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。( ]1 u5 P1 ?9 M! W$ ^* L3 ?  |1 [
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。" N" o! I2 Z' I

    ( \, G- \6 e4 `! Y6 C$ yhttps://github.com/oomol-lab/pdf-craft
    5 d/ H2 P% @# [% {9 ]" l
    . _7 i6 T2 j" H( H1 _  K1. 这个工具要求装 python3.10* L0 j# h" V, e9 ]  X. }; W
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.09 R% |4 W3 q& ~, ^, ^" Y1 u; F
    3. pip install pdf-craft
    . n2 K1 Z2 w( _# e1 x4. 把下面的内容写到一个文件里,例如 a.py
    # ]3 D# n9 y- {# M/ k6 v8 O' a$ ~# |' f$ ^
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter- f3 v5 J+ y, }4 A$ L
    2. / |/ @5 p1 D; l+ l& @
    3. extractor = PDFPageExtractor(6 @8 d8 L2 J! Y! C2 A; e/ I
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.0 i4 f6 ]( ]. ^& S; ~% f: W
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed; {6 T2 \6 x$ n- K0 [4 v! E! Y+ y
    6. )
      # F, |; c4 t% g1 Y$ m' V
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      : h4 y# z4 ?8 l+ H2 h6 D
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      2 I2 e5 ^' W( C6 |4 D
    9.     md.write(block)
    复制代码

    . F- Y5 [4 M/ U
    4 B: i3 g0 `# u' e+ d/ M+ I& j" m" B要修改的内容:% Y# f' k6 C$ i2 c0 _
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型  }4 ~( Y( x5 R; T* C! [8 x6 P: w
    4.2 markdown_path:输出的 markdown 路径文件名1 ~3 R/ f, Y7 d$ w
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名6 N. A* D9 C1 j% D* }& g# c. z
    . D9 W+ O- |- b. p3 \
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 ' m+ M' R% V3 V' l

      n4 I/ H! d! m7 x! P; O目前为止PDF转纯文字的最佳办法。; b' d+ d9 j3 \% @$ {  f
    先写个小程序,把PDF按章节切成小的PDF。" I/ g2 o' V" f1 m) k7 t
    然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    ; y* @$ o3 P8 V& t3 C1 q6 p效果非常好。. e. U5 W% a* ?' E+ V2 i1 t  p

    $ F% ?0 ^' l0 N) y4 G+ |deepseek,qwen,chatgpt 三个,deepseek是最好的。
    - l- q+ ]) V5 I$ J) [% W; p
    : w. l! ]5 ]; E8 k# ?1 Wdeepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    4 B+ b: c: S' L3 B! f/ ]而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
      b# y( t: I4 H9 z4 H6 y1 z, T% i5 ]我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    ! j! U8 L6 D+ s8 u4 y
    ! r8 S9 V5 N' V8 s% OAPI到目前为止,差强人意,不如网页版本修得干净。
    ) x. u. ~1 _" ~& h
    5 I) n% {4 g% [4 E' Qdeepseek可以同时开四个。9 U9 k& @- Q6 |, k6 c- s" R, A% x" W

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 0 v/ O5 y8 ~0 Y6 ]: L8 W) y

      A+ x5 A, d% i5 y让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:263 y4 H) o+ L! b  S% D  g( D
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    " r& }( B9 j3 x: N细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    ( t' b) m1 a8 C+ f3 k& D$ ~, N细说一下,听上去很不错,多谢。

    9 z* U+ S- \* f, y直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    3 y5 |' F1 N. X2 }; E; t" ]* ]( Z- E9 D9 g, E
    已经搞定.
    , Z2 [. T7 s6 M) G4 I
    & S# V- V2 g! z  M1 |首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    / U+ Q) |8 N  M  q
    9 \6 f# D5 f: w! T# W8 ]8 a1, python + pypdf 按章节拆分小的PDF
    . D2 a) U  w2 h; W: E/ R; D1 Q+ c/ y
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    , v" a" D- U: g' @
    - ]8 p  g# V- f$ ^4 t, l得到text file7 m2 \5 c) Z. E# ^

    " d4 R( f4 U0 T1 D; T- }, A3, python 读取整个outputfile,丢给deepseek 矫正。
    * H- v6 J" H5 m3 V6 z& K0 y% ~5 [3 E4 L- C/ d4 a' v/ O
    模型是 deepseek-chat
    & n* K1 {2 S' P1 |# Y& X( N8 ]. M' K* u3 T1 k; K
    max_tokens 最大是 8192,别的不用改。
    ! M5 X! x+ J8 Q( }
    9 u4 I# M6 D! G) b. w参考:
    * P" j6 ?, \/ ghttps://api-docs.deepseek.com/api/create-chat-completion
    ' m1 {6 N4 b) w) f9 {) t+ x4 n
    9 h- P3 |4 D, _  K4,费用:
    3 ^2 \( t# @* ]; E) L6 R# h5 N0 |9 t4 t* ]
    实测:4 S) s4 u0 ~! f

    5 ]/ d5 d& A% F) P: g, ^! R296K 字母,用了 9 美分。
    & M. v1 O! V1 q% ^& i1 H  }" I" R7 h
    英文字母 到 token 用量大约 1/3
    ( S# j9 ~$ U, j3 T3 g" Z8 ~% y
    1 v3 J5 u# {3 n' \! ]tokens: total, 11782 completion,  3729 prompt,  8053 | s:  328991 k  |4 j: _, R5 @
    6 N) b) h4 g0 j1 f( E* n
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    ( G$ x# r8 D1 @( ~% p" O6 d
    % T% `0 `3 L5 r5 J  ]价钱,非常非常便宜了。
    " s" u4 A3 [5 H8 }
    3 {+ y) N7 y7 _! t8 D" B8 N( w! ^参考如下可以计算,懒得算了。
    6 j8 [! n/ Z* T: n& v+ S
    8 `" E0 H2 }5 ~* `2 Chttps://api-docs.deepseek.com/quick_start/pricing
      `" ?, ~/ J- @- F
    + ^. R" }$ T1 e/ `3 q/ h: j) _, c/ H1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    ) M1 Y4 ~$ O, j3 X# E1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55" @3 R! |/ C4 u3 `0 C1 S+ l
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    . _  H. y9 E* t3 ~6 @3 \& ?
    + d4 H1 }2 I  J; e) g5, Balance+ f- ^3 ^5 S9 W
    * m' R: T" J1 Y- Z0 n5 w
    可以在程序里调用,知道每次运行结束后,balance还剩多少。
    * T) {7 O. }6 i' L  \% O3 @参考:
    6 [( k, [: ]! }" ahttps://api-docs.deepseek.com/api/get-user-balance
    ; D2 T9 [5 g# D; B$ P+ m; I, r
    ( `1 N+ |# t. _0 N' a. k0 N. D6, Models  f, x  Q1 \' J" o: ~; D

    9 z3 R# ?/ g- o& }: b" S5 g8 u; o( |目前就两个
    7 F' m8 S. M& S2 r) _+ B3 b# deepseek-chat% w3 D: S& X& M3 V
    # deepseek-reasoner  F, @6 V; X( c
    1 I3 z; e1 ~( ?% n8 `5 F
    参考:4 a6 q  c3 w5 U/ S0 j
    https://api-docs.deepseek.com/api/list-models: D% I5 s+ B8 w8 i
    , d8 r7 B: o! }  J2 U- x( ]$ \

    % a/ b# T2 e- q+ G' a$ J6 ^* F/ v7, 问题0 r) v7 z! ?& ]' A

    3 v; ~& q, G/ {* Bdeepseek 会将前后两段合成一段。
    ! k0 `1 C1 {. _5 [特别是那种大量的对话的段落,deepseek会给你合成一大段。+ K$ `8 K+ g/ D
    * Y) {$ F0 @, R
    8, 钱说了算。
    " N0 [% f( P! F6 J& y3 d& B/ B1 {# a, l; \" r0 e) D$ V- Y( S
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    1 K4 P6 ?1 z! N$ p2 R& k但是API就不会出现这种情况,毕竟我们给钱了。
    , H" g, z1 U- q# e/ G5 Ochatgpt也是这样的。
    + b7 v. A# Y" q8 H( h
    2 ]# a% {: F: U! b, ^, u0 ?/ a* |0 t/ n5 n" E" c7 y$ X

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-8-13 05:44 , Processed in 0.085309 second(s), 27 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表