设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3690|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
$ x7 R* C4 i8 O) W4 `$ X
6 W) J0 S( K) v+ i+ ^4 s5 v把PDF上传,然后让他抓取文字,并修改可能的错误。
' a) i' o4 X$ A' P然后deepseek完美的完成了任务。# F. B8 Y7 I8 A2 w% t1 |
段落清楚,列清楚,页眉页脚全部去掉。
, F( n. R2 ~; u" t9 l& o1 F$ Z我要疯掉了!+ L" {% [% }  k  r4 I
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!
% Y1 v  g7 W' \% `# X====
" v: z% L7 |' n( r) f; y. v7 \) N中文也很完美。/ `* H. T* [% G5 f+ S
经验值,每次十页比较稳定。: E4 h" `/ u& L6 _
现在我这里API还不能用,等恢复了,全自动了。
4 f( w4 G2 z& ^7 a! \; `====
2 F" S( |( L7 ]第二次疯掉了!
3 z; s7 [3 e. S# z0 ^0 A( _我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。
( i0 N' a! i, p* b, `# B====' t" Y: ~9 t7 ^+ A/ k! e. c! A
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
, G) C6 o1 q( J1 z0 }  _但是任务多了后,每次翻译的页面数是减少的。
$ Y+ B9 X0 D3 p8 p; y好吧,我五体投地,继续探索。
1 K; C5 S; V$ C9 u====9 E. O0 h3 v  E" z3 K6 r
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
- r! ~+ |! o+ x0 B' ~====
5 I2 G9 B9 V. Y& x1 j; O好吧,有些东西是不给翻译的,哈哈。4 `+ q" k, S6 G1 k* h* k

1 t8 P3 D" G- G+ |; D$ n/ A8 eSorry, that's beyond my current scope. Let’s talk about something else.
- u, d4 S; @4 H' U& y7 P4 }& q====: C5 e8 k8 Q* m+ F
然后我的英文命令也让deepseek 帮我修改,呵呵。
8 |, o* u6 Y3 ?====: t; D# k3 X# N9 r+ R  P6 P8 l( b  v
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
4 L) _; Z0 N/ v0 A# o====
/ }" R) m: W% v# ?2 ^时间段的话,北京时间的下午和晚上用比较好。
) U- ^8 x2 L3 i& s/ k后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。( g. |. S! u% }
====* S, J. M* i- ^: O# K
用千问吧,非常稳定,非常强大。/ D( }9 {7 r8 t/ s, g
https://chat.qwenlm.ai/
( U5 i; g. @9 T* k  S; [7 s====
7 I  O( f8 z! D: T4 RDeepseek,API 看上去可用了,但是不给充钱。
1 d9 ^" Y+ Z* e# E# R5 e' k& t" y
% _. j0 g" f5 ~
8 p! o: r" ~2 d- L1 i& I/ ]) ^  y; u- u: i* [) l) l1 w

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    15 小时前
  • 签到天数: 3887 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    % ?7 @+ B* V' g1 x1 f3 r这功能很赞呀
    4 o6 K6 V& }+ C' T7 [
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13
    - F4 F3 k3 }7 I& O有没有上传整本书试试

    4 I4 q$ c# T9 @目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    15 小时前
  • 签到天数: 3887 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    # L! e% n+ {6 i, e( A. _" {  s5 I- V* c! M+ p+ ]" b
    以后让deepseek 读出土的竹简5 U' T; H% f2 j

    7 \4 P9 f) L) l6 B7 b还有把古文翻译成现代白话
    & Q( q2 S! |3 S0 q# V2 T1 n
      ^  M# C1 X4 b7 ?8 k* ~& c9 |+ {以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    15 小时前
  • 签到天数: 3049 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?: K, ]# Z. `+ O( F/ c# G" ~7 k

    1 v0 X. F! w$ N, p+ N我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23' n1 C, O+ Q0 Z8 L1 |2 @+ _9 p; P
    请教是如何实现的?
    . n7 F# G- a+ v2 e4 a) f9 Z, x% m3 [* i
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    0 b; i7 [* Y+ ?% v, z0 y

    ( x: h- |& [7 y# M  \3 T我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    $ N" m6 G- v3 ?! b. W8 h+ V: p+ R: N文字之类的没问题。估计deepseek现在暂时只保证主要功能。1 @0 W0 [/ y4 n  R7 }5 c) K
    美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    " m6 \1 {) J7 o) ^$ B) o8 g

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    " @$ q) [3 R& ~' `9 A9 K6 F请教是如何实现的?
    1 g# O/ F9 J/ ~" k: m4 u9 A& }( p4 R; K2 ^( d
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    ( j3 D7 {7 c0 ]: b" A
    https://chat.qwenlm.ai/
    2 y. {4 Q' ]0 n/ j% v8 {1 e试一下千问,估计美国人没有攻击他,所以资源敞开用。/ }2 W3 Q5 A9 f  x: w- [3 O
    很稳定,质量不错,好像最多一次处理15页。
      g* l9 E" T4 h1 B9 d+ C我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    15 小时前
  • 签到天数: 3151 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    , d$ u6 G' G$ E- y处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。
      X2 A; A8 O% m+ z+ _这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    . s) f: J  g9 h& V( p; l
    7 \9 C, }% @  I1 Y8 x1 f( ?& D5 xhttps://github.com/oomol-lab/pdf-craft% \5 ^$ D+ R/ n. a& v

    7 l( H' k, a7 K0 A/ f" E! d: [9 O1. 这个工具要求装 python3.10; f0 z! S2 n1 H0 P  e& F- P
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.04 J; G1 Q2 k  H* n) i
    3. pip install pdf-craft8 L. [9 n% \' M8 ~
    4. 把下面的内容写到一个文件里,例如 a.py
    ( s* W/ g+ x4 I; O! F* ~+ x3 D( e8 b& h* ]/ Q/ h/ ^! {/ i
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      + A1 b4 g! E5 n. x
    2. 8 Q/ x- T& Q$ w4 U: Q/ T6 [+ I
    3. extractor = PDFPageExtractor(
      ( Y! X. B& e, ^7 n% i
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      " j1 C! t$ V, ]' q2 l! _
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed1 T: I, z. @" t. n5 A
    6. )
      . o  o" Z5 f5 N% E( P7 q; t' p
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      / V: u. j1 `5 d' X: |% a
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      ! v8 o0 H  ~2 U/ B& e
    9.     md.write(block)
    复制代码

    1 Q2 |1 `# M- M- a* I9 m7 R
    ) T$ e+ Z3 M3 P要修改的内容:) S- @$ k* F# Y7 z3 n
    4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    5 I: e, b: l0 G' k4.2 markdown_path:输出的 markdown 路径文件名
    : k3 |! b" G' z; x! H4.3 /path/to/pdf/file: 输入的源PDF路径文件名5 V& t9 F: `( ~; g( m

    : S- t# R, O$ U0 z+ P) k5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    ' c: M3 Y& Y  W2 M9 ?1 H+ q4 ]6 A# b# Y( p1 ~
    目前为止PDF转纯文字的最佳办法。! L, d( Q' h6 n2 j
    先写个小程序,把PDF按章节切成小的PDF。
    ) e* t8 x7 V5 l- _" N# d6 T然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    ! y3 F1 y6 U- k8 _: ?效果非常好。
    3 [! e6 K& q( p3 B, W
    ) @2 v9 p, Q, k: m5 {deepseek,qwen,chatgpt 三个,deepseek是最好的。7 ]1 s9 w4 o8 I" e& v  F
    ) N3 Y( Z$ @+ f3 _  E; f
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。- I- i, ^. f/ c
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。" [# X" o8 c1 e5 W, X% A) {8 _
    我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    ( D. [! X2 }: C
    1 N* D, ~; M! AAPI到目前为止,差强人意,不如网页版本修得干净。
    4 u6 z: M7 T8 `8 n  K
    " C4 Q4 u! v8 v( v" Pdeepseek可以同时开四个。
    " A% M% h$ R% Z3 A3 [9 {6 F/ B( L

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    " v0 B0 r" ~  ^6 \
    2 u: F- r8 v7 \2 K( R8 L, ^* j' o: a  [让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
      \6 a8 T  ~% j* l. Y让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    7 D8 B) F( P$ c9 i6 G) ]细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    ( i- o6 J7 u2 c细说一下,听上去很不错,多谢。

    / u/ u. k6 V0 D0 W% W0 v+ J直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 # @$ M* y# H) V  ~

    7 [3 M' j# `) L, o4 I) e; K4 v已经搞定.
    4 R/ s) v  A3 ?! e1 M+ ~/ J. i" ~2 I1 S  H1 N  Z
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    5 P+ c* V$ l) {: @; a' f6 v* C2 q7 A+ S* |* I' {" L$ d. S
    1, python + pypdf 按章节拆分小的PDF
    " U8 e5 }9 I9 i. p8 h" d4 ^- ?- G4 l1 l# g
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    % \/ P* X  Q4 R* h9 r, Y# F9 g& T
    得到text file
    $ r) t4 d* Q* q: M. U1 L' T
    3 F" k. ?9 A& y3, python 读取整个outputfile,丢给deepseek 矫正。0 [* D9 D1 c. U# k: K6 L3 _) Q
    8 E  B4 M# g, e& K% `3 I3 E
    模型是 deepseek-chat  W$ a  ?5 t, d

    6 N" z( S" {* X) n, r  s8 ~max_tokens 最大是 8192,别的不用改。# w& X& Z( n6 ]: o, ?

    & r7 w; G2 M8 U9 P! j  z参考:7 G, n1 H% e" Q  ~% O5 e
    https://api-docs.deepseek.com/api/create-chat-completion
    & J' _+ v1 v: M3 t/ V* f2 P  P& v5 ~6 e. `
    4,费用:; |7 W0 l( d+ ?' W0 }
    + f0 m1 Q, t5 K& _) G$ I3 H; o
    实测:! s7 I) r5 O8 ~0 a( P

    * i% V9 o2 P  q' i6 e$ N296K 字母,用了 9 美分。, c. ]- M* c/ b, k
    7 v  ?+ S: A9 G. O7 x
    英文字母 到 token 用量大约 1/3/ y* \2 e  Z# |
    + X  G9 t. ^' B; A/ {
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    9 F& U+ `1 v" I. T, }
    6 a: T( c2 G' ?, R- h32899 个字母花费 11782 tokens,包含输入输出的 tokens
    4 b" a& }* R! s# j1 r7 L4 X. e' e3 s
    价钱,非常非常便宜了。/ E2 T# x8 E: J( q1 E9 e: s
    0 z4 M2 [% g- C! l' a1 X) E
    参考如下可以计算,懒得算了。# j* W% o: s% Y" V! q; w

    + B5 \% v! x: Dhttps://api-docs.deepseek.com/quick_start/pricing& Y0 E- k( Q# X- e$ ]! {( v
    $ r% s4 a& r6 G& @5 J; X" X5 l
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    , k$ k1 d( O9 n( S1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    % G' N" o2 k( V( Z$ A' H6 a4 g1M TOKENS OUTPUT(5)                                              $1.10                $2.199 l, H3 A7 a0 a1 l+ e; H3 j
    , i1 i6 r! m3 v' _* W
    5, Balance
    * `- m$ \  {, V4 ?/ v% F- h* c
    6 P+ t2 k5 a9 Q8 U+ }+ C( k可以在程序里调用,知道每次运行结束后,balance还剩多少。# c  x4 b: i3 ?
    参考:$ s9 a" t# @+ s" M, ~- B
    https://api-docs.deepseek.com/api/get-user-balance
    + {4 L. o$ m. [6 e! y
    2 y& p' k) s6 `$ s' g: m1 T; e6, Models' P  F, l$ q& }

    9 g+ a+ l* e+ q$ _/ F* J. N  Y; F目前就两个
    $ y2 c1 t- Y' o+ a# deepseek-chat
    ! D" U! v9 X( b+ K, Z5 Z7 _/ T# deepseek-reasoner
    + F" B: p1 C' g2 w; F9 f5 z' {$ w) G
    参考:( y* \' r' r4 B7 l4 L
    https://api-docs.deepseek.com/api/list-models* H, F4 p4 G. Y8 g& K* n% V

    " _; _# `- K# o5 R) i2 p5 @6 u) a( B/ d7 W7 q9 H, F  G/ \/ e; w+ Q" g+ f7 j
    7, 问题
    4 V- m1 c; K& k4 u
    3 F; O; K8 a% x' Pdeepseek 会将前后两段合成一段。
    % Y2 R0 [5 T% B$ Q- }  k特别是那种大量的对话的段落,deepseek会给你合成一大段。6 ?5 e$ U4 o3 y/ ?- M0 M5 I

    3 D  d" q) @* d, F8, 钱说了算。
    + @/ V, D0 s+ C: d+ o0 A7 A- E* j: G, G
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。# Y3 O  Y6 Y, r, v
    但是API就不会出现这种情况,毕竟我们给钱了。
      e& w: s( S; z/ wchatgpt也是这样的。
    0 @1 T( A5 u7 l4 c* w. |) Y# |% _$ E: q8 g' [  b: N7 b

    ) I& E5 m# B/ f0 n: N

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-8-27 15:44 , Processed in 0.065662 second(s), 19 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表