设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3490|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑 4 Z) ^* L6 ]7 A; y: g; K; Q
5 S! Z* F+ z/ @$ H. U0 c/ P
把PDF上传,然后让他抓取文字,并修改可能的错误。
, p' f. t; Z; i* Z3 c/ H5 h然后deepseek完美的完成了任务。# |/ F( o! z, b/ ~$ i
段落清楚,列清楚,页眉页脚全部去掉。, @5 \" C2 [/ h+ ]% B6 \8 \
我要疯掉了!: F* O- L  D. C) a7 y
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!: X" g3 q; x$ d5 i4 R& c* P
====7 m' _1 Y: \1 A) o  [
中文也很完美。: v; q/ ^$ R6 [! M
经验值,每次十页比较稳定。- e+ X# s2 z' x4 F9 W9 q
现在我这里API还不能用,等恢复了,全自动了。: v& j1 ^3 m& G0 \* h
====& w: D2 X+ B. S& I
第二次疯掉了!
/ C% S9 E1 y3 v我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。; F$ S8 h. n. q6 F, F
====
1 @! R3 p% H( A1 y0 q+ E4 k现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。
0 ~# v. s6 C2 o3 w! B" B& v但是任务多了后,每次翻译的页面数是减少的。
1 L. J  B) R: l好吧,我五体投地,继续探索。
' D; U- D2 I/ }& X9 Q) r====5 P) ~% y) D7 k0 T. |
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
0 j: ~' G6 o  W2 E====3 {- v' ?, }3 c5 M3 K* Q- Q
好吧,有些东西是不给翻译的,哈哈。
  a+ g/ j$ ]0 W5 K1 S2 W
( |, ~. ~( k  s8 s! M5 nSorry, that's beyond my current scope. Let’s talk about something else.  X6 Q: o1 X9 n
====0 x8 p1 M# U( N) K+ o3 z; c
然后我的英文命令也让deepseek 帮我修改,呵呵。
& ^  z9 `/ @( }6 U! x====) j4 O) ~& `, _
日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。
; A9 [. Z8 Z! I: P9 W1 \====" V2 a$ e# \: C+ r
时间段的话,北京时间的下午和晚上用比较好。+ z% d0 o# z/ d6 w8 [) `5 M" l8 L' R
后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。* L6 |5 M2 a) H
====4 r+ l" b/ ^0 [3 a: h2 t
用千问吧,非常稳定,非常强大。: i  l. v3 R& j! l( j/ X" u
https://chat.qwenlm.ai/2 h1 t7 @7 h8 x* L1 p
====
9 @' b/ C' C+ mDeepseek,API 看上去可用了,但是不给充钱。* e& M: V8 J4 U. K, F% i, m, t- @  x

, A5 D9 q0 e& B% i" }& c' c* @: u, E$ s, c9 F! [+ d
/ |0 b1 v! p) [) \" C) ?! E3 H

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    15 小时前
  • 签到天数: 3874 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    0 K4 E6 f- T+ h  O" n4 |2 h这功能很赞呀
    " b1 ?- u6 ]  h! C1 S0 J3 l
    简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情

    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13
    + M# _# {0 n5 y+ B/ v, q- b: G有没有上传整本书试试
    ) W) Z8 }% r* A; _2 P
    目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    15 小时前
  • 签到天数: 3874 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    + u( j) x; t' w/ \* y
    3 A( u- X& R( u, T& l6 c6 L+ _& l以后让deepseek 读出土的竹简6 ^, M! z% {& e% [4 J- l
    - Q1 s5 I/ x; g! t" ^
    还有把古文翻译成现代白话/ _; E+ E" y" o& k; B3 T  \5 f* _

    ; t/ E5 V1 F3 B8 |以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    8 小时前
  • 签到天数: 3035 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
      f5 |& f( U  J4 S) d
    + _' I3 b* Z5 o# C7 ], @我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    2 m: P6 m3 N" n4 B+ t, i请教是如何实现的?# @! y: o6 ~9 W$ O% ]
    ) P  E8 c: E0 Q+ o( W
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    2 l1 h" U# @% q7 b4 }* H1 t! _

    : [& c3 v; N0 C- Y& N我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。, z$ Y* H4 _, {1 }- d& i2 x
    文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    3 R" R, f% u  T5 P8 [  j' A9 `美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。3 A1 F0 N* [" l# Z6 }. f" o

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:23* l1 E: J+ B- I. I/ C' M$ h. a
    请教是如何实现的?
    ! C  a  n' N8 K+ t6 p& ?
    - k: F- M+ W6 ?2 X/ t! Z我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    + R( `. h" d4 f; e; N- V$ S; n1 [https://chat.qwenlm.ai/8 B0 \7 h4 g$ s+ v' _
    试一下千问,估计美国人没有攻击他,所以资源敞开用。
    2 [& Q' E7 R) m' K; {很稳定,质量不错,好像最多一次处理15页。. H* h# F& ~5 h1 c3 H7 A  H
    我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    15 小时前
  • 签到天数: 3139 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。
    ( v4 B  D3 ?2 z1 \. ^处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。$ n( O3 @; b& m+ i% J; h
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
    " Q3 F/ W# Z. O% f0 [) y; S8 X
    + n/ i+ K, t( Q) Chttps://github.com/oomol-lab/pdf-craft9 x1 [( E/ p$ ^0 k+ S
    1 x) U/ ^7 F7 q: _" Q6 }
    1. 这个工具要求装 python3.100 t1 I/ Y1 Z8 [6 l9 E. U
    2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0
    0 e$ [* X( q3 Y3. pip install pdf-craft! i; r# [4 {3 z# J* A
    4. 把下面的内容写到一个文件里,例如 a.py
    1 P1 ~8 B8 d! l
    ' i  v: E: }" R8 [+ _# P% G
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter
      + T( l! e) S7 L
    2. + Y! D& p/ n! Z+ R
    3. extractor = PDFPageExtractor(
      : n* H% l- ]/ X# ^/ T. B& O# O( i
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.
      + F$ s$ d8 g6 ~+ \0 J3 _7 ?
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed
      ( t. U/ O7 Y8 |4 f7 J" D9 m
    6. )* ?) M" v7 u9 W0 Y" ~  a
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:6 g( A/ u( |( B) i/ d7 X
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):
      . J; X2 V# `5 ~/ I: }
    9.     md.write(block)
    复制代码

    - D; \5 C  r4 v0 B  W: g' t9 Z; ?4 [" I8 G4 H4 d7 I
    要修改的内容:
    , L$ U/ v% k! D% I+ p6 W* v2 X4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型* q+ O6 W5 F- H! {
    4.2 markdown_path:输出的 markdown 路径文件名
    " K7 J( S- G& s9 B# |& d4.3 /path/to/pdf/file: 输入的源PDF路径文件名: p9 Z( w3 [+ ^$ D) X. }0 y

    ( R. `- o! ~% b/ Y5 [& Y& {9 _1 d5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑 4 {# m# R8 X& }# x1 f4 N# m
    , s8 Z3 k6 j  b
    目前为止PDF转纯文字的最佳办法。
    & F/ H. r: W6 H2 O5 C1 g先写个小程序,把PDF按章节切成小的PDF。
    0 |3 l, ?/ `( Y, Z% T& W然后,把PDF一个个传到deepseek,让她抓取,除错,输出。: v7 d: t8 }" U1 }
    效果非常好。& Z& f3 B  ]$ @7 {0 ]
    / F) t$ t4 j) Q8 t
    deepseek,qwen,chatgpt 三个,deepseek是最好的。) ^1 l" \* A# T& W, A( L! Y) g

    % r" R& o6 Q8 l0 Jdeepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。5 F$ l. h  C; J# w2 i. B
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    $ N! K# ]4 f+ s我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    : @+ B$ `! V7 T% W  J# V# @8 ^( f  z$ r9 q8 h1 K" B
    API到目前为止,差强人意,不如网页版本修得干净。1 @6 H8 J  _3 F4 ^. [, b

      ^2 X1 C0 ]- D9 l2 R; ldeepseek可以同时开四个。( Y8 o9 K% O" k/ d/ D  ?1 a

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑
    # P+ p4 f4 e" H9 w" D
    ; i; R+ ^; Q3 x: q6 E让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    1 n1 A  w1 W/ f5 u$ o3 X- t7 p  f让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...
    9 h; c, ~1 ^: t. x0 T
    细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    % R7 j& {/ o( C细说一下,听上去很不错,多谢。

    2 d5 ?$ `5 k& C% K, R直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 ; ~1 t2 w5 B* O3 i- M

    * n3 B- f% N3 l) f# s% r已经搞定.  b+ |' b: [' n: }4 i3 \( S# L

    4 Q! a/ S% G2 K) N" {首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    " R7 O& j9 A* V  M0 p* l
    / _3 {( X- Q7 o) H1, python + pypdf 按章节拆分小的PDF
    ! X# D0 m- {# V1 V" z" [' x/ A
    9 ]' [" p+ d) i6 k' h( P2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile
    + `5 m: P4 m  y7 z; @# l9 \
    4 D# F( L, o$ j9 d& W得到text file
    2 }# M# H- x# s# B
    ! e& |, d( L8 [: C4 V  d3, python 读取整个outputfile,丢给deepseek 矫正。7 E( I3 H7 [1 Q! x  @
    ; w! A# K* t  G% T/ ^
    模型是 deepseek-chat* }" `+ ]! {! M6 Y! M
    * @9 }- a* i. [5 y" I" m5 ~
    max_tokens 最大是 8192,别的不用改。' I6 J/ d+ f- w
    " _1 @& ?+ ~" F4 N: n; n
    参考:
    6 P3 ^) v4 t" e' nhttps://api-docs.deepseek.com/api/create-chat-completion
    / O+ ^6 e1 |4 ^2 a
    4 u" p9 a% k9 q4,费用:/ A- r4 A% y  _# M0 T4 O( g2 B

    - W1 m7 e* d( O$ D+ N实测:
    + D7 g' P! W) L' T* `0 w3 d
    / V5 P" G' q" L# }, z' G! h8 t296K 字母,用了 9 美分。
    " W6 z9 u: w3 L; ]( t. O
    ! G" i# R+ \+ F. D9 r! R- ~' L$ v! F英文字母 到 token 用量大约 1/3
    7 B: K1 ~6 b9 U" d1 p
    * b8 L8 F' z- V3 G) U+ T7 Ktokens: total, 11782 completion,  3729 prompt,  8053 | s:  328991 y* A% M5 X- \2 Y/ H
    " c% F; C# u8 x% t
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    - ?9 }( N2 I& [, O% A
    0 q" R! c8 r1 F4 @: A* @价钱,非常非常便宜了。9 t/ i3 [" P. a
    6 ~' k2 ^  a+ h; v( b
    参考如下可以计算,懒得算了。
    % r: b# [# H; w8 C6 q9 c3 O* W4 c* M" G% V, H8 K5 R. S8 [
    https://api-docs.deepseek.com/quick_start/pricing1 B) T7 F- e6 n

    ' a% E, m; z* h  ]( a1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    . k, R* t( H2 P* J7 |1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.555 e3 B! U5 \% Y" a% H5 g
    1M TOKENS OUTPUT(5)                                              $1.10                $2.19# N+ f- [  t5 k3 ~" q

    6 k$ @# T+ C4 E# }+ D5, Balance4 U+ e& c) ]9 u: M
    # V% Z* j* r: E+ |9 \
    可以在程序里调用,知道每次运行结束后,balance还剩多少。' r, S# T( _* x; E- ?3 U
    参考:
    0 m1 d9 _: c: Thttps://api-docs.deepseek.com/api/get-user-balance
    8 G5 z9 K. t7 C$ f5 K! u8 R, Y7 \, P
    1 G. E0 b# ^4 J. K+ b( o6 t6, Models- h5 g- a" F7 M: m

    , Q. D8 D% g( w目前就两个
    & \0 b; L9 a5 \' {# J, U6 J0 C' ]: _3 L' r# deepseek-chat* Y) I  V/ E) \2 a
    # deepseek-reasoner, O2 ?% j+ U: R& ?

    $ `! Q" r1 T1 ^' q参考:
    ' j0 }! b  X7 y- O- zhttps://api-docs.deepseek.com/api/list-models
    * b( a8 @9 i  F# ~
    8 u0 n- [6 N( y4 V# e4 E
    % _- `, x: O/ R7, 问题
    % F" C, k  g/ d7 k. g* U2 h  F7 I1 S* u" W# s! X
    deepseek 会将前后两段合成一段。6 n/ t5 M" p+ B$ ?
    特别是那种大量的对话的段落,deepseek会给你合成一大段。
    3 A4 K- m% ~5 g6 H5 C
    $ A* A4 v/ K3 f$ O8 J8, 钱说了算。
    / Z+ [, P  U4 j
    2 F7 `! {. _$ F1 b2 [$ Jdeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。
    : I4 F/ L- o6 H2 ?但是API就不会出现这种情况,毕竟我们给钱了。
    / N6 }9 g0 R" ochatgpt也是这样的。
    0 v' Q1 r7 v) o/ ^8 H$ `' |4 |# C  x& C# L

    5 g9 }9 s2 n. f8 A$ |

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-8-13 15:23 , Processed in 0.081149 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表