设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 4090|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
  G* ]' ^% L+ C9 C" `$ k8 D4 O: ?* v8 r) l; h/ j1 ~! U
把PDF上传,然后让他抓取文字,并修改可能的错误。" m$ k! ~8 l) F1 ?" I' X4 p' Y
然后deepseek完美的完成了任务。; c/ Z2 D. |# d& i) ^
段落清楚,列清楚,页眉页脚全部去掉。
. b0 X: I0 ~7 F! T& P3 }, Y2 F我要疯掉了!6 z+ j! u4 b) L( W1 j
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
" }7 A4 |4 f5 |1 x====* l9 W% X1 Z* _; h4 I! n3 v0 d
中文也很完美。
$ ^# P/ }: N/ c5 c9 }; ]经验值,每次十页比较稳定。& I. B4 O# `$ @8 g
现在我这里API还不能用,等恢复了,全自动了。
6 {% i& q; X7 v====+ `4 X5 w' g, b. b
第二次疯掉了!7 Q' A  ~# v7 \% s9 N* Z
我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
) {2 K" |/ }/ v6 p- P0 f  P====8 S4 U: N! G; O6 u0 u! l- y
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
! v$ `( m  ?( b0 \7 k/ C但是任务多了后,每次翻译的页面数是减少的。
4 L  b6 n/ w+ N' J1 A6 `& O2 t好吧,我五体投地,继续探索。
9 b/ N7 g) f* r  e====
; P  u1 k) s  A4 J& c) z4 Y为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
  x& D% S/ `0 K# o4 U) Q====
" G- @' ]  c) _0 z8 j1 l* \7 O7 H好吧,有些东西是不给翻译的,哈哈。
' }+ m6 Y: A$ ]
  X: B5 H1 b7 C& e7 y9 ySorry, that's beyond my current scope. Let’s talk about something else.0 ?' B0 Z0 g; h0 \) N$ F
====
2 F$ ~2 q$ a0 Y7 f: }( S然后我的英文命令也让deepseek 帮我修改,呵呵。3 B6 Q  m( D. Q/ x4 n" m" u
====6 n1 H! W  E- l* ^
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。1 X9 M# p/ X: M" B1 W" d7 v" X
====- b) [! c2 m7 t
时间段的话,北京时间的下午和晚上用比较好。/ L) }. I# i8 l' b& M
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
) r" i( x8 y/ {; j====
& V+ }& T3 [- b0 N: i用千问吧,非常稳定,非常强大。- [6 B/ \2 a" p) }& Y) K
https://chat.qwenlm.ai/3 \) a, g1 o. W1 n
====) W/ L% l# n4 U
Deepseek,API 看上去可用了,但是不给充钱。$ s+ E8 X8 T+ f6 g; u6 i

7 m3 U! v/ J" K
: y) J: M  H0 q( m6 S. @! x( ?4 q- ]) h3 I, {% k. _+ F

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    - H2 y: ~  ?8 ~% b/ ]这功能很赞呀

    6 H7 _* g  s  b8 e6 z' F简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    衰
    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13
    , o: G, H3 P/ p. i6 J( ~6 Q$ D有没有上传整本书试试
    ( b! z& K/ Y- r; ]1 s2 G  m4 T
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:02
  • 签到天数: 3915 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑 - n& g5 E2 E' n0 w0 v% E

      f8 L) Q* s7 D/ |+ J& h& W以后让deepseek 读出土的竹简
    - c( S# Y  I- l) u" A. `/ P5 b1 i8 M. H; {& M8 T# ~) ^
    还有把古文翻译成现代白话: h8 i) ]! r0 \1 l2 }
    9 G1 g7 v4 Q- q6 ~! C
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    7 天前
  • 签到天数: 3071 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    2 F5 X. U1 N1 U9 {: y3 n1 ~5 a/ Z4 o* S' Z
    " S, O. q6 J- z9 n& b, f4 f我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23& _) I7 Q. `: |# ^1 w
    请教是如何实现的?
    5 J. ]9 u: F. r* j# _. @
    ( L+ j2 I4 P8 v( W7 D8 U1 f我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    - U0 k4 _% c/ O, D' c' V1 C: Y5 R+ Z+ O. I" m0 Z! S
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    0 v* ^# g, C" U文字之类的没问题。估计deepseek现在暂时只保证主要功能。& i% \. @" a, I$ X5 W" p" f, Q
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。( A1 `- ~/ e/ k. g, `+ N  }5 x/ ]

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23( s7 G: _, c6 V, F$ c( ?# z
    请教是如何实现的?) K% L' j% [8 l1 s5 F8 i
    ) y+ D1 G0 U- H1 |% w9 l
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    & Z" G5 u- C+ B) a0 R$ J. ~; V4 thttps://chat.qwenlm.ai/
    ! u' a2 F1 B8 i& J# B. S2 R9 ?4 D试一下千问,估计美国人没有攻击他,所以资源敞开用。2 E  \7 ~) q) c. U! u
    很稳定,质量不错,好像最多一次处理15页。  L$ @2 m5 k9 t, e9 z: x
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    2026-9-24 00:03
  • 签到天数: 3177 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    , M& x& W, m. |: F* R处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。0 O) J& l& D* _9 w0 j, y
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    : A9 f8 o1 O! f: f( m7 d, |" P! M, G, {' e$ v
    https://github.com/oomol-lab/pdf-craft
    3 {; r, O, x/ W5 O  k
    7 H1 b; H# L/ M7 P' U1. 这个工具要求装 python3.10
    : f6 t' h  `& @2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    & y+ a* z  D. m  X+ ^- ]4 d9 j3. pip install pdf-craft  D7 U8 k0 b5 h# ~
    4. 把下面的内容写到一个文件里,例如 a.py
    7 Z4 y8 \7 S) }# g3 Q
    0 ~) \6 D* _% H7 O
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      / O; t* M9 r7 ^8 u1 K1 j; v8 w

    2. 2 z6 U$ ]1 J+ x6 F8 E
    3. extractor = PDFPageExtractor(
      / V- @: A1 o/ ~% L, Q
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      , T8 {7 V' \. T" V
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed2 w1 \( A/ Z. y0 ^  `& C1 S
    6. )
      9 }  x) x! W& o: F1 L
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:6 y  \) n8 U* c! ~) v1 F; a
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):: @1 {6 `& V8 [/ D
    9.     md.write(block)
    复制代码
    ! N, z( \2 c/ k4 F
    / @  h( K; S6 q# ]7 O6 x
    要修改的内容:
    ( V6 b# D  H+ Z. \* Q4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型  w! B1 t0 y, q  h& h7 K
    4.2 markdown_path:输出的 markdown 路径文件名
    3 r7 U, s) P$ f9 Z; r$ w  W  B$ Q6 N$ J4.3 /path/to/pdf/file: 输入的源PDF路径文件名# y' m( I5 ^- }3 y  `% e+ _

    ) f# o9 s5 F! @8 i( R5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    - o/ M+ i" m+ f4 {7 j& Z
    4 ^; F) W+ ?8 M6 X7 N目前为止PDF转纯文字的最佳办法。8 S" W! _( l1 W3 Z, y
    先写个小程序,把PDF按章节切成小的PDF。
    ' m5 Y2 L7 c7 P然后,把PDF一个个传到deepseek,让她抓取,除错,输出。0 D4 z: [/ w9 t3 ?  a6 b* h2 F" J
    效果非常好。
    ( [( g% z( ]5 l3 {
    " `$ |% ^) t+ d% e: ]  N' d: Cdeepseek,qwen,chatgpt 三个,deepseek是最好的。9 N! l7 O  g, y7 m

    % N) q/ k) G5 K5 B. B( G* |$ R- mdeepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。7 [* N- w0 M& x
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。$ k$ F0 N4 [; |# ]% V
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。* j* _+ O2 Z# y5 q9 h

    ; b0 C9 \1 q4 O! K, u  ~API到目前为止,差强人意,不如网页版本修得干净。
    0 W0 ?. Y  Y, S" Z% a+ R7 r8 C: |6 o' c* w% g1 n" L8 @
    deepseek可以同时开四个。
    + I5 E, F- D1 o, j% R- C

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 2 P9 f4 o- c2 _  j+ H
    ( y0 }4 T( \( S5 z5 z8 \
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26& _, t- p# a# n9 }
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    ' g6 D0 i. f; ^. r& u细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
      t. X- H+ g! ?# n细说一下,听上去很不错,多谢。

    % n4 V5 [. j& S- _; Y* r6 E( b# Z: ?直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 / g# n$ x9 c$ n$ |* Z. P

    ) J0 y# H/ t; Z8 P已经搞定.
    : \9 n7 P( J, f2 Y8 @' c
    . }$ U8 t  e' ~! G+ @% V* d7 l- ~首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    9 |# A8 A4 P3 m8 t; P2 C0 Q/ E5 y
    7 |3 b, A7 x* P( H6 @6 t1, python + pypdf 按章节拆分小的PDF1 l' `  R. P7 B2 j. O- e
    2 P( N; C* f6 J6 k
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    # R! F7 n! t2 q, K  [. y5 o! R
    + i; p, ~1 S0 `5 D" O5 r& ?; x得到text file
    4 D# z6 V& r/ Q/ l) }) \- I1 p3 z
    3, python 读取整个outputfile,丢给deepseek 矫正。
    & f- d! R6 x8 H: R* q2 X; ?  i$ V2 D
    " s" l6 N3 V" [( O% O! \# X7 h5 F* A6 P模型是 deepseek-chat% g. t5 r0 F" z+ f6 D' t
    5 B7 g+ D& Z) t
    max_tokens 最大是 8192,别的不用改。+ r) H/ b, V) g  G+ M

    ( j; F- {$ ~5 J- ~5 G参考:
    ) Y6 U, I# H# U( zhttps://api-docs.deepseek.com/api/create-chat-completion
    - k2 }: C+ |7 H$ s: X
    % G2 J3 d: H) Y9 I" |+ M4,费用:0 M. g1 n9 k& Q
    6 ?1 u: _" B; v* H2 O* M7 ~
    实测:
    : o" H4 ~( U6 M2 z1 t1 Y
    $ I- k5 z, Y3 v8 k296K 字母,用了 9 美分。
    " x# t8 @) E$ H# w
    6 d1 h5 X* E/ Y" c英文字母 到 token 用量大约 1/3. M6 l0 T- w/ P" U$ t' @
    4 r& F/ K* E1 w9 S
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899- @* [' e' z! {! e4 }) `5 z) o

    3 Z9 Q9 G" P: P. R! {8 R32899 个字母花费 11782 tokens,包含输入输出的 tokens
    : V; l! s/ x) ^! b5 h+ C9 W
    % d( ?2 s( j7 g- C% b价钱,非常非常便宜了。, x! H7 a- }2 P( e& Q, @

      w6 @, }: e+ ]  z* S! V参考如下可以计算,懒得算了。5 }& I: ^- r" U

      g9 s6 w0 a) m3 C2 D4 J" a" Yhttps://api-docs.deepseek.com/quick_start/pricing: d  Q& k# S% D: x
    4 h" t. A4 b# m' D& i
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14; j* @0 R3 R% p$ {- @/ W" b: C( z
    1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    - [0 Y* L' S0 \: M; [1M TOKENS OUTPUT(5)                                              $1.10                $2.198 M( a# f- k/ r2 E; ]5 D: {) n  f

    4 B2 W0 B0 `1 X, g5, Balance
    - R; n8 H8 l3 g, Q
    " N& ~( ~& z, ~7 q0 a$ l9 |可以在程序里调用,知道每次运行结束后,balance还剩多少。
    1 p; j( R" ], z5 w" i+ C' d& \参考:
    - ]  D/ s  @, Q$ l; `https://api-docs.deepseek.com/api/get-user-balance( X$ g  E5 P, O5 o) C1 e9 l
    ! W+ b9 u! _0 l/ q; ~  ]; d! c: e
    6, Models
    4 A0 G2 v# Q0 P9 N* c5 P5 f' f! H$ A- K
    目前就两个
    . [- }' X0 J# p2 y4 B  v* u- A/ N9 |2 i# deepseek-chat5 U- z0 R/ g3 f) `
    # deepseek-reasoner7 t7 n' C1 P4 P- Y  s4 S, ^* w7 w+ l

    7 }  F% U! a6 A+ w/ y: p  Z参考:( d& G3 Y/ T9 M* o6 z- I3 X
    https://api-docs.deepseek.com/api/list-models0 i1 [, [7 I+ j+ R! E
    : M8 Y0 n. _  L: s  l6 O
    ' H1 _# r- I/ a% Z: M
    7, 问题
    / p8 f/ O) f6 L! \
    1 [4 `) i0 ?; }* Y; g' K: Tdeepseek 会将前后两段合成一段。, P  e8 h5 g) b2 u0 A- N8 }
    特别是那种大量的对话的段落,deepseek会给你合成一大段。  Y5 F& c+ _6 G& A, k
    / ^, {- }' ]0 G
    8, 钱说了算。9 _3 ~8 o2 y8 S+ I9 F# U' Y1 `8 ~4 U
    5 v6 r6 _0 s6 l( D( u3 W
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。- }+ D9 _, p3 N
    但是API就不会出现这种情况,毕竟我们给钱了。' d6 Y" \0 }' j' d1 \7 K" |( _
    chatgpt也是这样的。) C. v, @4 N: Z/ I. q: q# v

    ! Q  G, n2 ?) g  |9 w2 M2 s' c, U- B0 v' U

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-10-9 21:15 , Processed in 0.067227 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表