设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3481|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
# [% N  Y$ H% u* Z0 J- |# X6 k& J- B8 i7 V
把PDF上传,然后让他抓取文字,并修改可能的错误。, `: G$ N3 V/ B2 P7 o/ g
然后deepseek完美的完成了任务。
9 D; k" Z. X! [$ n8 E段落清楚,列清楚,页眉页脚全部去掉。
; X9 w8 P. D. C. b( ?8 i我要疯掉了!
- i1 H9 l  L4 s/ f- J赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!  W  }3 G( ~' a6 b
====
( o0 M! {! C& _0 v* m  x2 u2 p: Y中文也很完美。) E8 @$ h: {2 y6 l( a% O: {
经验值,每次十页比较稳定。
" r" J# [. c2 R5 M: l: }! i& H现在我这里API还不能用,等恢复了,全自动了。
( n: |5 F" R  \% `: O====
5 _8 v! k( y+ i4 x第二次疯掉了!
) I/ e8 Q0 b% d# d* K7 m我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。3 [* Z8 f# N' _8 u% e+ }4 W- E. X
====
7 W( F1 R/ W! G. d) C$ k现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
' y" |' C; x& ^" Y7 h/ a但是任务多了后,每次翻译的页面数是减少的。
& Q+ `. f, H! G, ?6 T好吧,我五体投地,继续探索。
# b) @9 D+ X4 w5 V8 k" O====
* b3 Y$ {  F5 ]! u$ X: E" R为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。( W. a4 T9 o* M" P- }" l; s
====1 _0 j0 H# ]9 ?. z1 ~; R
好吧,有些东西是不给翻译的,哈哈。" m6 Z  u4 F2 `
% k; k1 ?$ B* r$ n# h, I4 `
Sorry, that's beyond my current scope. Let’s talk about something else.
7 R- G& m  z. p! f7 t====9 n2 z1 S/ [& h) B/ E+ I& a* w% g
然后我的英文命令也让deepseek 帮我修改,呵呵。
: ]5 z( V" @3 o* ]8 \8 i  ~: B====
6 j3 I% f$ U- G日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
2 j* l* a' b3 o! M====
. S5 m# a' @: m/ e/ v# }. }: F8 R5 U- U. Z时间段的话,北京时间的下午和晚上用比较好。
8 L& V/ P; w" y+ M后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
; x  ?% J$ t' z, r====
; |* d  e8 b; R9 Z5 D( s$ @用千问吧,非常稳定,非常强大。
: z: i9 f9 F6 }; U- c! s6 _, chttps://chat.qwenlm.ai/
2 T; c/ g+ G6 @3 F7 d3 h1 [. O2 \====7 |( j3 ~  A9 G* D9 D' `5 I6 r
Deepseek,API 看上去可用了,但是不给充钱。
% G9 b0 j# ^' b" n$ \
1 s+ j8 U5 a. G% A3 p3 C1 g+ q9 U2 d; e  V+ |$ U0 {

9 t& Y6 C- F& @8 h$ t9 ^/ l

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    3 小时前
  • 签到天数: 3873 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:532 I$ H, G! D+ ~, A) T: ]6 f: |3 t
    这功能很赞呀
    # K4 y' U6 M( _/ ^3 b* w3 `: z
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13( n6 P# [. f  t, h
    有没有上传整本书试试

    3 R& `. \$ o& h) v- p8 J目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    3 小时前
  • 签到天数: 3873 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    ! ]( R, m' S$ w0 @* \5 b& E5 a2 X4 t' X$ K
    以后让deepseek 读出土的竹简
    7 y  }. p0 s: R$ @8 ]0 O
    4 S2 @7 y; q7 ]! l还有把古文翻译成现代白话, K7 y- j: n; i' `* c6 G
      f, [8 x" p2 ]& L' ?7 E
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    昨天 06:28
  • 签到天数: 3033 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?! P( Q% Q, s$ ^- x
    8 p  ?& o# u7 n( ^
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    0 n/ W& d& v- f# @% j3 E请教是如何实现的?
    ( `: A5 \9 |: H+ L' y
    + a& Y* `6 c& v& q% \4 s2 U, {$ u我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    2 l: e: D  W' k+ \# d7 Z) n% X- Q3 O3 \/ \
    我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
    8 n: @  U% Q' [6 K$ Q. N, s( |文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    : ^- ?: P+ [6 j' t, @5 ^# N& c美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    % m/ a: u6 N8 @* Q% _. a

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    $ W  S  N* z, [5 n0 n$ A请教是如何实现的?
    $ S! S- I+ x  s( g* p. F( r! l
    : j# @; Y. G5 I* e+ I% ]+ r1 P我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    8 g% U1 ]- S/ ?' L; m5 ghttps://chat.qwenlm.ai/# r4 ~0 e6 ]) l/ Y
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    ) s6 B* u. s, F+ k! a; e1 V( j很稳定,质量不错,好像最多一次处理15页。
    3 O" o  A$ x, `我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    3 小时前
  • 签到天数: 3138 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。! }. V. ?2 O6 P& h& n
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。( s3 U* j* f7 n1 S3 ^
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。& T+ P( H% I3 N4 B

    : R4 i& G) D7 dhttps://github.com/oomol-lab/pdf-craft
    8 @3 j9 p+ k$ k5 F3 i* L
    ' c  D! i% W6 I- i' x( v9 G/ D2 d' e: a% w% F1. 这个工具要求装 python3.10" @) h1 L9 ^( Y' F: o
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.08 P7 B% T8 g& G: y: ~$ |
    3. pip install pdf-craft
    " g: P) Q% x' a9 [( I+ n! i4. 把下面的内容写到一个文件里,例如 a.py3 A$ D* H  P* S. q
    ( [4 ]1 F' L" \4 [
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter7 w& z( Q% K6 o6 q& k; E4 f6 H( D* `) j

    2. 1 I9 U' C; H6 _2 E
    3. extractor = PDFPageExtractor(* P( s8 B1 R/ T$ r! @
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.$ V: d/ r! w  a' f, @. R$ N
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed( n% m" z4 u6 p
    6. ). \& \3 [( d, S+ h$ c( q
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      & }+ {  |' z/ G+ S5 E+ q$ u: o
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):1 n' c9 f7 L1 F7 Y) z3 B
    9.     md.write(block)
    复制代码

    + I1 M7 h8 x3 v6 p4 l4 s
    9 L8 s6 s5 f/ M. N要修改的内容:
    # D, o, ]" [0 u4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    ( R. j" g; i1 j2 k8 ^0 R4.2 markdown_path:输出的 markdown 路径文件名3 l0 w7 h5 q7 p; f4 O0 v7 s
    4.3 /path/to/pdf/file: 输入的源PDF路径文件名
    ) i8 S6 K8 U' V6 k) I' g  Y
    0 e, Z9 m' q0 z% c: e& w5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 * T& H& k: j) Q! h

    4 j3 S7 }/ L- G1 T  N# N) `; h( ~目前为止PDF转纯文字的最佳办法。
    2 H7 T3 C! s6 i* a7 Y先写个小程序,把PDF按章节切成小的PDF。3 w& H( s  A# u( t4 |- U
    然后,把PDF一个个传到deepseek,让她抓取,除错,输出。
    % f  C0 c/ C% ^5 d1 D效果非常好。
    $ k1 F( I  b+ B6 c' E  T
    0 p; L$ l2 F+ w5 S, a+ j5 g0 Jdeepseek,qwen,chatgpt 三个,deepseek是最好的。& R1 x: ^8 h# }* _& A) O

    ! e6 r% e3 }. w/ J( vdeepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。
    % b5 W: n7 j+ y: l; W) o而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    : J: a7 B  H# U3 R, b# v我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    # a  e) C& c9 }
    , Z9 o, U  B* z" A$ dAPI到目前为止,差强人意,不如网页版本修得干净。
    0 H& R, ~) \4 o/ a2 p/ a( a' i( K' j
    deepseek可以同时开四个。
    + l' O2 e8 q# }( |& \. p

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 $ S/ |% P% Z4 _$ _3 B' R, |
    7 J+ A% }' ~5 w' \& T: V+ @
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26' D1 I7 J& }4 r' D3 c) U
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    / g. [2 z. u4 b) Z# _6 N细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
      |8 v" h. W  ]3 Q. f' c2 S细说一下,听上去很不错,多谢。
    3 A9 _( E# W7 Q2 v7 Q, V' U
    直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑
    9 A3 K( L# m7 O4 q8 g9 T. P* I
    # ~* H3 u4 D) Z5 ^# A2 N已经搞定., Z  W6 D5 v7 G- }# X
      G  r" y( w3 w4 |! g
    首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    & F/ i2 |, r) p7 ?/ ?
    . |* m' ]4 w! p" O1, python + pypdf 按章节拆分小的PDF8 k# y3 d" N! S) B
    3 {0 O9 j$ f4 S. T' O5 o
    2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    ( {# ~6 B- F$ S) Y5 Y# H: O& w9 _' o: @0 E" E
    得到text file
    6 N& A/ E9 X$ ]: H2 g3 l1 v# K8 ^1 G% i
    3, python 读取整个outputfile,丢给deepseek 矫正。7 y( b& ^7 M& w6 J6 C

    9 K, G% {, k+ y! V模型是 deepseek-chat
    * P2 i1 I5 p& ]; t) ^2 x; P* N4 N/ S$ T/ `6 b: m" }% \
    max_tokens 最大是 8192,别的不用改。/ P0 r. |7 Y' g* y: n# Q
    9 ^5 H  a9 U( m* G
    参考:
      A" T4 L0 _$ M9 thttps://api-docs.deepseek.com/api/create-chat-completion2 |) t4 X. ?; O+ V( k, S+ ^
    7 j6 H4 _; L! G, U, \! `6 P& a
    4,费用:
    + y% u! v! W- t, L2 S' u9 }) r7 x6 ~* c% u! j0 d6 u
    实测:
    9 ?5 X* @  U  x& X
    1 X: @+ s$ M) L) P5 Q" |296K 字母,用了 9 美分。9 s, ~7 D6 Z  G, k% `: b
    4 t: x9 z$ H0 |5 l
    英文字母 到 token 用量大约 1/3
    . |  |: O, \& o% v( Y; J8 y5 H$ |
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899
    " X& ^* }3 `% q' c% J5 Y" t0 C; I& y( }+ q' L8 f& k- s
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    5 J" }; o' k/ B' S/ B" N
    + z! c3 \1 }# d6 Z9 N: j; O  r价钱,非常非常便宜了。2 E% v: j/ @: @+ J
    ) ~9 i7 {0 I6 Y1 Z" L
    参考如下可以计算,懒得算了。
    * t) C( z5 Y2 P' }
    3 y# n5 M4 m0 E% U3 Z- }https://api-docs.deepseek.com/quick_start/pricing
    / ?6 e  \( O; p# q" H" ?2 w
    ( p9 `) c; n4 w& r1 Q8 c1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    : n% y* S$ O  b. z1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55, _% @) C3 H! Z- d/ {" y" p
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    7 I" d* G( L/ g, K' X2 t' j& H% u2 w/ B/ u+ k9 i2 {
    5, Balance) b9 e! A6 y, e3 e
    " S5 N: d3 O3 \5 L
    可以在程序里调用,知道每次运行结束后,balance还剩多少。" _  ~5 L1 w" u1 p
    参考:* ~8 ^- c3 L5 ^5 x$ \& G
    https://api-docs.deepseek.com/api/get-user-balance! B! `2 R, T: F+ o/ R( q
    ; I9 L6 @, q: j& x7 d$ U9 ]7 c
    6, Models4 [6 D  Z- v% m! J
    : V' g: @, a6 j  Q
    目前就两个
    ) W) f8 @# {. ]0 j+ _3 O# deepseek-chat
    . S3 Q/ P0 E7 r( |: _# deepseek-reasoner3 `$ Y% K% \% Q! Q/ Z3 P1 q2 P5 E/ F

    5 k# Q3 A- g/ v2 e7 ?4 `参考:' X9 `( q& M6 }# Q' E
    https://api-docs.deepseek.com/api/list-models
    $ b" T- ?# t; a6 Z; f- x: l8 C& Y
    / V/ e% p' a( h% a, J" e* ?. x1 i0 C; _( r1 J* J# d. Y
    7, 问题
    . r& ?" Y) \5 ]  }- j! t- E6 x1 `. t9 T8 x5 D# E1 d
    deepseek 会将前后两段合成一段。
    , K5 J) s9 Z  O特别是那种大量的对话的段落,deepseek会给你合成一大段。1 x% g: h3 e) t) B# A- ^

    9 B, R7 x3 ^  |8 k. t: E8, 钱说了算。/ E5 t! u& P! b2 R+ ~
    " U; d/ U, l5 S* U+ U) W  t
    deepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    / p# l* g# d% P7 w, W" p; P但是API就不会出现这种情况,毕竟我们给钱了。
    ' c1 _" T" v' e/ c- V: ]. @chatgpt也是这样的。
    $ j9 Z( H8 B, J" @
    2 D! M/ z/ n% t! ]6 H- H7 H( |' ]# }
    # f, h" h4 Z8 t

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-8-12 03:35 , Processed in 0.063981 second(s), 19 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表