设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 4097|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 ! y* c( }3 b7 r5 U+ A
4 L1 i6 x* m6 b4 P  @1 j% w
把PDF上传,然后让他抓取文字,并修改可能的错误。; m, x" V6 R) x) I' h0 L2 P7 |
然后deepseek完美的完成了任务。
  T4 j: e7 A- L% i# i. H# T  h段落清楚,列清楚,页眉页脚全部去掉。
. `' _6 P$ r) V5 ]我要疯掉了!6 F7 G& D0 q# b( H7 a& Z  L5 W1 Z
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!& |: E# X$ F1 ?% r' ~5 j4 U5 h
====
, k# Q3 {* \+ j中文也很完美。
' c( A- c; K9 B& E; B经验值,每次十页比较稳定。/ [& F; K" b4 y2 ~+ d9 B( M
现在我这里API还不能用,等恢复了,全自动了。
- j7 G3 M5 s, X* f====
, z2 |9 L  ~2 B' g$ D) h2 G" m第二次疯掉了!% l& A; O7 Z/ z& |
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。$ j* X, R3 Q/ ]$ o
====% h, g% A6 g4 Q; x) E# K
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。) v& O7 `0 ]4 r7 t9 D
但是任务多了后,每次翻译的页面数是减少的。
( [& a( P% q# z+ N8 r" P" G5 R$ M好吧,我五体投地,继续探索。
9 h# l: m1 g$ p! L( C4 `====
0 D1 x9 D) ?& B, R4 t为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
1 E0 i3 e: x: `5 c& ?6 y% [====8 u$ @; O0 l5 l3 b
好吧,有些东西是不给翻译的,哈哈。3 l2 a# R9 x* o; [2 V/ U5 @+ J
( `$ ?" w7 u2 ?4 x& x4 d
Sorry, that's beyond my current scope. Let’s talk about something else.
: i. j) m; F- N: ~4 z: P; W+ H! _====
  R( M& q+ w0 X- D然后我的英文命令也让deepseek 帮我修改,呵呵。8 T3 E) l! Z* H7 E; u
====
+ ]4 @' d% ^7 O8 s8 u# v日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。9 J, M$ k2 J4 o
====- ^" f" ^$ `; n2 z, Y/ p. b2 U
时间段的话,北京时间的下午和晚上用比较好。
4 v! h( [& C" u. V* }后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
) x5 C2 N, l; A( Y2 E/ |/ P====3 v0 A6 j6 V) L/ b6 w& w3 \
用千问吧,非常稳定,非常强大。
" b; G% B- G3 s; N6 Bhttps://chat.qwenlm.ai/. W6 f# R, g% @
====' m2 `( }" {& V! D+ e# r& u
Deepseek,API 看上去可用了,但是不给充钱。% r  I9 |% C. w, G' j, |5 ^
# V$ N& p! |: \6 F$ `. U) V5 u9 R

: O8 U0 I/ W: w0 l; Y& a2 T; ^8 j" p/ I! k5 g

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    - l* h8 I& J8 m/ m这功能很赞呀

    + A& `6 y" J) f3 e! B简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    衰
    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:132 B( K5 O5 Y; E' ]& j- N+ K
    有没有上传整本书试试

    - G6 H' E& V0 s9 J1 _目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    3 ~* p1 H% t1 ^$ d7 B
    " u) x8 K+ G! W" _) i以后让deepseek 读出土的竹简! j1 F# ~0 w' k

    . ~. C  ^7 [6 N还有把古文翻译成现代白话
    3 L% K7 C! l$ b" p2 @! l; i. X) \
    1 b4 Z" I4 T  Q. L% n5 U以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    2026-10-2 18:41
  • 签到天数: 3071 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?# Q2 [* L. n4 }. y% m3 U

      ?' }, u7 y; _& a6 H我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:234 W% I  ~1 S' a* M
    请教是如何实现的?
    - y( U3 Z% H# J7 H: x. Z# k7 b$ _/ m- Y+ ]6 ]# W
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    5 G6 U" R/ `+ v' A' D- d$ Y

    5 e8 s$ l- u; w我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。' D2 d. ?5 C' s$ [+ K/ O0 c/ P
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    1 [  Q& ~1 j+ g: H4 _4 X美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。  S3 }6 d5 h8 h, ^' y9 H# p

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    7 i3 _* g2 ?+ _6 i9 [9 b9 V请教是如何实现的?' F1 i2 I8 R( t1 a) D! X$ L

    : o  d/ U( O+ w* s5 a' z" Q+ @我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    ) e5 `7 t+ ^: h  h# k- Y6 f4 i1 }7 \
    https://chat.qwenlm.ai/1 q: f( M# q0 A( ?+ A+ O
    试一下千问,估计美国人没有攻击他,所以资源敞开用。6 A) B9 |% ]0 \5 ]1 Q
    很稳定,质量不错,好像最多一次处理15页。) {3 ?( e! A- F9 L  r( J
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:03
  • 签到天数: 3177 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。- d  o2 M. ~+ j' A5 `
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。. O% G% }& _3 ]% {( N1 J
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。' P0 @+ g" r7 s* D: n
    3 @' @2 B& I) ~6 C, J" c
    https://github.com/oomol-lab/pdf-craft$ e# R( f9 I! C* u# C# K! }

      x9 N0 O/ c6 l1 [1. 这个工具要求装 python3.10, B  d: o0 }( a8 _* r# M
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    - Q9 I: ~7 G. u2 f; X; C3 q3. pip install pdf-craft; l- W( n; y4 S+ d; j' `" O
    4. 把下面的内容写到一个文件里,例如 a.py
    ; W0 u. g2 X3 p: H; u( W2 V3 P2 X
    - ]" ?( X/ d+ E% P5 ^8 `
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter& m  F5 N+ k- M+ t7 |5 s, e

    2. 7 m9 D0 Q  I* l/ h, w
    3. extractor = PDFPageExtractor(3 G# `1 m& [* A- n4 a  W/ N' R  u
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      4 q$ k! V' i' d8 u) ]7 H2 q8 p
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      5 u& u" x  o, m$ W9 V9 `# D: N
    6. )
      * g0 T! u4 B# V' O" M6 u: f! e
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:  R; ~' K7 I9 s8 q
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      9 ~# l) T  u& V# o+ ^
    9.     md.write(block)
    复制代码
    # [1 ~/ p% e7 C8 x
    ' R( {* w  `& B& C$ |+ O* L6 R
    要修改的内容:
    % N) m3 L5 i- ]1 f1 ]4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型2 p2 H* f( Z: w2 p5 g8 }
    4.2 markdown_path:输出的 markdown 路径文件名
    * Y- e7 {" K( I8 x( U+ z- U4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    % g  F% X1 o) C1 K; }. ^1 h. t
    . z9 ~7 w# g) L% J2 C0 g5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    * Y; e' \' T0 O; Q4 y' m2 k+ p' U' U% N  c5 c
    目前为止PDF转纯文字的最佳办法。/ c  a- S) f) t. B" l8 g
    先写个小程序,把PDF按章节切成小的PDF。$ K, V% {/ t+ ?2 Y# V
    然后,把PDF一个个传到deepseek,让她抓取,除错,输出。. ]1 N3 [2 x% D. R& Q
    效果非常好。
    6 k: ^$ N  s9 o6 l0 R8 j! F
    8 z6 H6 Z. |+ t1 m, w- fdeepseek,qwen,chatgpt 三个,deepseek是最好的。# g% ^% X  B* \, B+ z
    / J7 T) a8 Y& ^6 a3 Q* I$ E8 H
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    7 L* p/ ?; f. ~而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    $ A5 r! X( J; @1 m我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    * V" F8 u: `) ?
    ! ]! |; W6 U$ o8 OAPI到目前为止,差强人意,不如网页版本修得干净。
    8 n/ t' t1 m0 L# T, X/ o; _7 k; E  m  _% _7 @- a: L" T& x
    deepseek可以同时开四个。- f+ D. i1 _0 v3 p5 I/ v3 @

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    9 K! L; k3 i1 M
    ' U3 I* E$ x2 D8 T6 b8 o让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    ) ]+ q; K9 R1 @' H/ p' l2 m  C让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    ' }! b3 ?$ `; D9 P2 C0 b细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:338 X  v( [% f' T" U
    细说一下,听上去很不错,多谢。

    2 e/ ?$ D$ B* z5 i9 h5 ^直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    0 `) p8 \0 P5 `
    6 N% _5 {; \! @- v2 @& B9 t2 g已经搞定.2 l5 _0 ]2 H. `5 V+ Q
    : j( b/ o" Z/ s7 p
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    ' E9 M/ o7 m! I6 s* a3 X( w5 A6 [" m" d, Z8 Z: d' z5 i8 D
    1, python + pypdf 按章节拆分小的PDF# k' h1 P9 x/ T, ?
    1 u3 a  j; x! ^9 @0 k
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile  w6 C; H2 d" @$ ~' ~) P( G) |" y

    1 d+ D3 I) i  y3 M3 p) `9 |得到text file
    9 K# ~  v9 W  Q: w- ^/ y9 |: t4 {. w( S" I) t9 c8 V* x
    3, python 读取整个outputfile,丢给deepseek 矫正。* R6 Z+ b' w3 T1 m! N0 g
    1 q: }  s! g" G& M3 E
    模型是 deepseek-chat( K! w/ K( J2 K; R0 S  G
    ! W  h6 q5 @7 B
    max_tokens 最大是 8192,别的不用改。( |: `+ E3 R: Q& ?' K

    9 H4 ^; c8 D: e% N参考:
    ' ?3 m8 @  V3 n3 c8 r' Xhttps://api-docs.deepseek.com/api/create-chat-completion4 Z3 y% Q9 q3 w6 j$ @6 x! R8 U
    * E) }) `! U. b" @
    4,费用:
    6 @# {% x' d* p. x; D5 N( V8 n4 \- z
    实测:
    8 `  f, y9 A: e+ [+ _/ @
    6 }& ]! H, O' o! d: I" s296K 字母,用了 9 美分。
    , K- M/ b* F+ b3 B- U. g( Z
    5 ]; ]- L' m% N( V0 s英文字母 到 token 用量大约 1/3
    5 y" X2 Q+ R% ?) z2 z6 L
    ! N0 y2 C0 E8 n- W' g) qtokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899$ A; G/ {+ f! o0 k) |
    0 A2 U6 [' W) `' h6 \* M" h! _
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    * j& r4 @3 [* b' s' |; ?+ d) I% u0 ~& {* b5 V* }5 J1 ^
    价钱,非常非常便宜了。# y+ n& J1 ^* ~* h' g. l
    8 ]0 C0 h9 R) M" m6 {& K7 |
    参考如下可以计算,懒得算了。% T' f8 X  A7 F! Z% N, \& j: n5 m! C
    # d( D- B# U' ~- N3 t# c' S& ^8 |
    https://api-docs.deepseek.com/quick_start/pricing4 n4 D2 k# `; M7 N* M: N, S
    4 ?- ]2 D: F/ X3 q& B" [
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.140 P' Z; ^6 ?1 x3 Q$ U5 p$ t
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    " O! f7 r$ A7 r% @3 B% q; c1M TOKENS OUTPUT(5)                                              $1.10                $2.195 R& k) X- z5 c8 H* z2 Q
    - a$ Z" j4 r* [/ e0 t
    5, Balance
    8 Q- o  [) z2 L" h. t$ d' O& |3 R/ S2 q2 N5 H4 w
    可以在程序里调用,知道每次运行结束后,balance还剩多少。2 C) o: ^( s5 x' s  C7 u1 n& O
    参考:
    / y* J6 }2 }9 {https://api-docs.deepseek.com/api/get-user-balance
    # j9 w# ]1 G2 K8 G: H' [0 j6 H+ w
    / A- u) X% x' b8 L: u$ i6, Models2 R8 o7 o5 H' i5 ^$ I

    + j3 \( {8 c0 t# d! V目前就两个$ }$ J) ?2 W! N6 h4 J
    # deepseek-chat
    2 ~2 B7 {; u3 P' f0 K) Q; a' E7 I# deepseek-reasoner
    3 f- u8 g$ E. {$ ]# k2 f
    9 \" R3 @$ X7 ?9 s8 q参考:6 j9 J' P5 X# }1 g* |; \
    https://api-docs.deepseek.com/api/list-models
    / N5 T  O, c% R- `9 `. B4 u. k" R4 R: r* e* i; s5 m! T# j, p2 [

    2 f3 i% d4 U: W0 Z7, 问题
    / z8 C6 S* i/ e7 A
      Z* Y/ _& V. B2 J( f  ^+ D& c( Vdeepseek 会将前后两段合成一段。
    6 ^4 k) u) d4 p0 ]" l+ c特别是那种大量的对话的段落,deepseek会给你合成一大段。
    ( u! I4 ?2 y1 h
    3 G$ S# T0 G1 @0 y4 z8, 钱说了算。5 `0 d% a: s/ i) m7 K1 q6 I4 v
    " u: |7 v0 h5 c2 \
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    , g- [  G  @: Z6 z) i& l9 u# U但是API就不会出现这种情况,毕竟我们给钱了。
    1 I+ I& ~- j0 m1 M( Z5 z2 V! cchatgpt也是这样的。
    0 _2 ]* w" [6 w0 Z+ i  k
    ( k. Y5 z5 C( F% Q7 ?5 ]
    0 g$ s3 |& s5 y; N8 j0 r

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-10-10 14:32 , Processed in 0.072483 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表