设为首页收藏本站

爱吱声

 找回密码
 注册
搜索
查看: 3997|回复: 17
打印 上一主题 下一主题

[工程技术] 利用 Deepseek 抓取PDF的文字并矫正。

[复制链接]

该用户从未签到

跳转到指定楼层
楼主
 楼主| 发表于 2025-2-2 03:35:19 | 只看该作者 回帖奖励 |倒序浏览 |阅读模式
本帖最后由 nanimarcus 于 2025-2-6 22:17 编辑
4 v0 d3 N4 O* W2 }
; f) {; Y8 U: W: A- O把PDF上传,然后让他抓取文字,并修改可能的错误。7 ?- \" h3 g! K: }2 ~
然后deepseek完美的完成了任务。
0 Z. O: L7 E+ _9 A, W! V- ^. @段落清楚,列清楚,页眉页脚全部去掉。
) q8 b/ _8 P" ^8 v- k) l' [, h# J( w我要疯掉了!- x( ?5 v, Z/ a$ L! R& H: I& l) F: a
赶紧把自己那些成年老书给搬出来,deepseek,这是党和人民考验你的时候了!; I& v' u, L9 F/ ?4 W2 L' J" Q
====
: v0 w% {& y; z6 Z# N7 a! K中文也很完美。
8 y! u3 V% k( N( h经验值,每次十页比较稳定。
8 v" p& o! i4 Q5 @: e8 X1 y/ F现在我这里API还不能用,等恢复了,全自动了。
' h! p# N4 _# e1 z9 _. D! ~0 t====
- ^7 d$ N! h5 A1 ]3 S6 i2 S$ A第二次疯掉了!
) f, W+ ?% \1 T* o! d7 W我上传英文文件后,让他抓取文字,矫正,然让他按页划分,前面放英文,后面放中文,结果仍然完美。/ k% j$ j" z( y6 T
====1 F9 A8 n/ R7 F; C+ A
现在我让他从PDF抓取文字,矫正后,按段落翻译,可以一次翻译多个段落,每次翻译不超过一个固定数目,结果仍然完美。& B8 K7 J" _' N$ |7 Z- P7 x+ v
但是任务多了后,每次翻译的页面数是减少的。
+ k( D, @" X. j1 w. h好吧,我五体投地,继续探索。
( G) y  Z0 Y, y2 K0 C8 R3 K====; J; b, U. {5 _& U0 P- X: W
为了防止中间结束,可以告诉他必须所有页面全部处理完就可以了,我现在是应该佩服我自己呢还是应该佩服 deepseek 呢,抑或都佩服。
8 D$ F2 n* _5 Z/ o====
' e- h* Z* Z& g% c1 |2 \好吧,有些东西是不给翻译的,哈哈。
, F. `: ]5 d. \# P# c; x/ b" Z- F' B9 A# L; W8 j' |. Q: m
Sorry, that's beyond my current scope. Let’s talk about something else.
8 R3 ]4 T, e5 d" `====
4 V8 ~' K; d/ q% E% F8 g, A然后我的英文命令也让deepseek 帮我修改,呵呵。
% t% n5 T" T) U5 z====
9 e; p( Z2 N; G4 n3 }( Y: `日语的文本他也可以处理,过程一模一样的。问题也是一模一样的,假名太多,汉字很少,我不懂日语,翻出来都不知道对不对。; R  o0 l7 D9 g7 o. \
====- g8 T1 C" p. h) u' Q: C1 ]$ F  ]
时间段的话,北京时间的下午和晚上用比较好。
$ J* c9 ?1 r% w5 v后半夜和早上,美国人上班了,要么在用,要么在黑客攻击。
$ [& v4 O3 F" s  V6 e. d====
5 e7 j/ j: g1 p8 f( X) ]$ Z用千问吧,非常稳定,非常强大。  X- y9 ?* I1 O. l# R4 |1 H/ d
https://chat.qwenlm.ai/' b+ O  a+ _* o7 Y' V, k% w; d2 a
====4 {3 H! a) a5 K, @
Deepseek,API 看上去可用了,但是不给充钱。- T2 W* _& B) R9 Z& r& K. g
1 T3 v& w  @! l: Q8 o. `
) R* R% Q3 k  g
' f" T- H8 u+ [

评分

参与人数 11爱元 +102 学识 +2 收起 理由
testjhy + 10
johnsonjian + 10
helloworld + 10
laser + 10
笑羽 + 10

查看全部评分

  • TA的每日心情
    开心
    3 天前
  • 签到天数: 3915 天

    [LV.Master]无

    沙发
    发表于 2025-2-2 03:53:32 | 只看该作者
    这功能很赞呀

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    板凳
     楼主| 发表于 2025-2-2 03:56:21 | 只看该作者
    马鹿 发表于 2025-2-2 03:53
    ! a2 n, y2 @% e% W/ k+ N* h, v( z' O这功能很赞呀

    # k/ [, i5 _* `简直太赞了,我现在正在思考还有什么工作需要 deepseek 干的,现在的上限是我的上限,不是 deepseek 的上限。

    点评

    给力: 5.0 油墨: 5.0
    油菜: 5.0
    油墨: 5 油菜: 5
      发表于 2025-2-2 08:23
    给力: 5
      发表于 2025-2-2 04:41

    评分

    参与人数 2爱元 +20 收起 理由
    笑羽 + 10
    indy + 10

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    衰
    2022-1-1 00:00
  • 签到天数: 793 天

    [LV.10]大乘

    地板
    发表于 2025-2-2 04:13:28 | 只看该作者
    有没有上传整本书试试
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    5#
     楼主| 发表于 2025-2-2 04:27:15 | 只看该作者
    indy 发表于 2025-2-2 04:13  l2 q, X% o( j" P
    有没有上传整本书试试

    1 L- M. T) _9 v# I目前看来,差不多十页左右就停止了,看看还有什么诀窍不。

    评分

    参与人数 1爱元 +10 收起 理由
    indy + 10 谢谢分享

    查看全部评分

    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    3 天前
  • 签到天数: 3915 天

    [LV.Master]无

    6#
    发表于 2025-2-2 04:41:51 | 只看该作者
    本帖最后由 马鹿 于 2025-2-1 15:43 编辑
    ' ]( ^- `4 ?7 c( g+ I
    . h1 b* O5 v) r4 h" L以后让deepseek 读出土的竹简
    0 c3 \+ n; F5 S+ s) I9 a
    $ @( w  @! F; }还有把古文翻译成现代白话! j7 u- S) a* l
    & V6 ?' g- C6 k3 `* T. v  w
    以后不认识的字不查字典了, 直接问deepseek
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    奋斗
    4 天前
  • 签到天数: 3069 天

    [LV.Master]无

    7#
    发表于 2025-2-3 01:23:54 | 只看该作者
    请教是如何实现的?
    - |6 V2 g7 K' W. m' t8 ?% \- {' o+ a, {" O! J6 n2 I9 d
    我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后,发出指令提取文件中文字,始终是文件解析中。直接在DS里问如何上传PDF文件,并提取文件中文字,照做其实是一样的。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    8#
     楼主| 发表于 2025-2-3 03:06:35 | 只看该作者
    方恨少 发表于 2025-2-3 01:23
    ) W) y$ J& A( T. i% R请教是如何实现的?: }9 c2 S/ Z  O* E- ]4 r

    8 H/ D4 h0 {1 W0 S我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...

    / F4 i' B+ i# r2 t1 Z0 b
    + w' e+ n( ~- s我现在也上载不了了,"upload failed",几个小时前还好好的,应该是服务又受攻击所以功能收缩了。
      V( p4 w! K1 N% B0 J文字之类的没问题。估计deepseek现在暂时只保证主要功能。
    5 Y  T0 x  U3 g( d' o7 f, R* Y1 @美国人就这样,打不过就耍流氓,估计要等一段时间才能完全恢复。
    9 C/ y  X- @3 G( I, w2 V

    点评

    给力: 5.0 涨姿势: 5.0
    给力: 5 涨姿势: 5
      发表于 2025-2-3 03:40
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    9#
     楼主| 发表于 2025-2-5 00:15:37 | 只看该作者
    方恨少 发表于 2025-2-3 01:232 c! p9 o6 e" y' G" s" O: G8 n
    请教是如何实现的?  q/ Z) x5 B' p/ Y8 L8 D9 B

    + J% ?) b  y( t* _我在网页版和手机版都尝试了,都不行,网页版上传PDF文件始终不成功,手机版上传之后 ...
    $ t" |' J: |. u, J
    https://chat.qwenlm.ai/
    " G  ?! k% f% T; x试一下千问,估计美国人没有攻击他,所以资源敞开用。
    ! C6 y1 G* `& c* Y9 Q很稳定,质量不错,好像最多一次处理15页。
    ; w# z2 m! @) }我直接拿deepseek的指令用,没有区别。
    回复 支持 反对

    使用道具 举报

  • TA的每日心情
    开心
    3 天前
  • 签到天数: 3177 天

    [LV.Master]无

    10#
    发表于 2025-4-16 17:01:29 | 只看该作者
    试了这个工具,可以转成markdown,正确率很高,有漏行,图片会放在一个指定的目录下。, r, P; e8 _7 h. t: R. D
    处理一本100页左右的扫描版本的中文PDF,一份某行业的接口标准,纯CPU,几分钟时间。( u* A# Y' {, B" J; y0 e
    这个工具不能处理表格,我把文件拖到豆包里,“把这个文件中的表格转换成 markdown。只是表格,不需要其它内容”,表格多的话,要发好多次“请继续”。
      f8 J7 [$ a1 e& b2 o6 ~' @7 I% {* A7 {( p( ]* ~. Z3 v5 g7 c  E2 u
    https://github.com/oomol-lab/pdf-craft2 V2 d6 H# N7 l+ y9 r

    9 M( I* p; m6 |- p1. 这个工具要求装 python3.10
    : {8 @' ~; I" \4 ], y& O2. pip install onnxruntime==1.21.0, 有英伟达的卡:pip install onnxruntime-gpu==1.21.0" u7 ?$ G$ M5 j/ t1 B  J6 n6 T
    3. pip install pdf-craft2 X; T% |+ u3 R
    4. 把下面的内容写到一个文件里,例如 a.py& ]! Q: G1 u6 a: T9 o

    + g: a0 Q% v6 l9 R" r$ U
    1. from pdf_craft import PDFPageExtractor, MarkDownWriter9 x1 P/ [5 D) g" I! r, ?( \: w- K

    2. 6 q% P1 n' }& C1 ?" t) z, b
    3. extractor = PDFPageExtractor(3 s3 D5 ]0 [. O
    4.   device="cpu", # If you want to use CUDA, please change to device="cuda" format.- ~8 k9 b5 L0 Y( W
    5.   model_dir_path="/path/to/model/dir/path", # The folder address where the AI ​​model is downloaded and installed2 c4 Z) W, K5 s! L
    6. )6 k2 g& z3 y) I5 J
    7. with MarkDownWriter(markdown_path, "images", "utf-8") as md:
      5 Q. [) i- q2 I( O* \
    8.   for block in extractor.extract(pdf="/path/to/pdf/file"):* Z' K+ q5 e+ O& A- E3 C4 g
    9.     md.write(block)
    复制代码
    ; g; V6 `( C7 w( o

    ! N" Q8 W/ o& p3 A) d要修改的内容:
    / A8 |! t+ |/ V+ Z2 c* ]; C) |4.1 /path/to/model/dir/path:存放模型的路径。第一次运行这个脚本会从 huggingface.co 下一个模型,国内的要科学上网,国内的镜像上没这个模型
    5 t: f7 j; l' \/ O3 ~$ V, U; H4.2 markdown_path:输出的 markdown 路径文件名
    / u0 h. z) p8 z* d; y4.3 /path/to/pdf/file: 输入的源PDF路径文件名$ c( c1 b, b. Y; v6 i/ F
    8 ~) e, X+ r9 A) K
    5. 运行 python3 a.py

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 1 反对 0

    使用道具 举报

    该用户从未签到

    11#
     楼主| 发表于 2025-4-16 19:47:30 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-16 19:50 编辑
    / I: M% f" I9 t0 G) @' z/ ]  I
    % ]" ^" Q* @' }- C) r: G% k目前为止PDF转纯文字的最佳办法。
    ; T: W9 W  y6 k4 m# {  l& W/ @先写个小程序,把PDF按章节切成小的PDF。
    3 l$ e9 _& u6 N. K然后,把PDF一个个传到deepseek,让她抓取,除错,输出。) t, b' i; J, F& o! J; g- N
    效果非常好。) q7 o: a$ g  {. c" K9 T
    ; T; C8 b/ B/ ?* \
    deepseek,qwen,chatgpt 三个,deepseek是最好的。3 Y, A' w) V+ F0 r. P1 j6 i, F3 M
    - m. Q8 ^3 N6 t4 ~1 p
    deepseek 把页脚页眉页号全给去除干净了,跨页的段落也给你修好了。4 ]2 P+ N, {! h: E: ]
    而且deepseek不会加戏,chatgpt有时候会想当然的加上没有的文字,让句子看上去想那么回事。
    2 I: ]" [2 G1 P+ {我曾经修一个历史文章,chatgpt给我活活加了三段,真是文豪。
    / ~/ r2 m% o6 T4 c# n2 p5 Q; a9 ?/ I& ?9 |5 e
    API到目前为止,差强人意,不如网页版本修得干净。* x0 d! E$ M1 b, I" a

    2 ^" p1 [# T1 x4 `0 Q" Cdeepseek可以同时开四个。
    ' L9 Z, N5 d. n$ }3 d9 b

    评分

    参与人数 1爱元 +4 收起 理由
    唐家山 + 4

    查看全部评分

    回复 支持 反对

    使用道具 举报

    该用户从未签到

    12#
    发表于 2025-4-17 12:26:23 | 只看该作者
    本帖最后由 三力思 于 2025-4-17 12:27 编辑 2 T$ b. n/ `) d
    ! t/ `; Z# b) V4 s: v" D
    让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    13#
     楼主| 发表于 2025-4-17 16:33:20 | 只看该作者
    三力思 发表于 2025-4-17 12:26
    + _8 {/ Q, z  H3 `  T# m让Deepseek给你开发本地架构的抓取PDF软件,并负责上传,下载。 AI监工AI。 LOL ...

    ( i9 @8 s: T9 N0 r细说一下,听上去很不错,多谢。
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    14#
    发表于 2025-4-17 21:22:24 | 只看该作者
    nanimarcus 发表于 2025-4-17 16:33
    0 n, h" l' ?4 j* c. M5 {细说一下,听上去很不错,多谢。

    4 y5 ^  X, x) r+ ^6 E9 l" |直接问DS,“用C#,JAVA语言开发把PDF分成单页PDF并上传DS程序的源代码”
    回复 支持 反对

    使用道具 举报

    该用户从未签到

    15#
     楼主| 发表于 2025-4-17 21:55:57 | 只看该作者
    本帖最后由 nanimarcus 于 2025-4-18 15:39 编辑 + r+ o+ G& H; e$ n; x6 |* V
    $ @+ E8 V3 q1 ^
    已经搞定.
    ) V+ F. {# E  O& C+ x2 ?
    ; {9 z6 B' p; _$ r; v) |首先 PDF 本身已经OCR了,Adobe Acrobat Pro中自带这个功能。
    * e, X$ Q6 H3 o5 T; _- `: L. [7 |7 @
    1, python + pypdf 按章节拆分小的PDF" }, N# Y; E$ q& Y/ i

    . J' b/ r/ ]; V2, pdftotext -enc UTF-8 -nopgbrk -eol dos input outputfile2 j) E& Q+ w, b5 v; ?- H& ], U

    7 {# d/ T; a0 g( f& w' W3 l# y0 e得到text file8 N2 e5 S! b' J( C6 G2 D0 J* |
    9 a' b" Z2 V5 I6 H. `, H
    3, python 读取整个outputfile,丢给deepseek 矫正。
    6 m, S% K( I# t
    % \& a) w1 o4 R2 q9 v: Z模型是 deepseek-chat5 l% ]  a. l8 {/ r' y; ?
    , P% l4 E* d% c/ |
    max_tokens 最大是 8192,别的不用改。' T/ h9 y, [1 E) q5 r# ^' q! ~9 N

    2 D- Q. ~3 Z% }" O8 T参考:
    8 ~- N/ c3 e" `7 K5 vhttps://api-docs.deepseek.com/api/create-chat-completion
    / K' N0 d$ u% L3 Z
    % |( y- y2 b+ r7 j! D' e4,费用:) {: o; W. ?3 W1 X/ D
    , W: `: i( }  `  ]8 g
    实测:3 @+ {/ N& ?$ t0 O0 W, |
    # R$ _" r6 \0 }
    296K 字母,用了 9 美分。
    $ ^" y2 S- r0 Q) U2 C2 N2 j1 f$ x" d- V: e
    英文字母 到 token 用量大约 1/36 `" K6 }: B& B0 g: O8 r
    , z7 G2 K# p4 M* S9 T2 Q
    tokens: total, 11782 completion,  3729 prompt,  8053 | s:  32899& r7 b2 }+ z$ D5 Y, P' q  L
    : l( N5 s( |1 }8 A% l/ K9 c# B8 `" ?
    32899 个字母花费 11782 tokens,包含输入输出的 tokens
    6 T' i7 g* o; f; D* V* t2 v8 m) U2 i5 _, Q
    价钱,非常非常便宜了。
    6 q4 ^: X+ g& V/ _8 u* B6 a0 t/ J6 ^
    参考如下可以计算,懒得算了。
      Z& j! l# e. N3 l
    : m& g7 U- a! D; x! @6 F) P8 L' g/ Ahttps://api-docs.deepseek.com/quick_start/pricing1 T' J; F  H$ p  @! `, m$ q+ q- g
    . H: s" |* E- s+ c; b& d
    1M TOKENS INPUT (CACHE HIT)(4)                $0.07                $0.14
    7 `& m+ m- R" _, X) n  Y. @1M TOKENS INPUT (CACHE MISS)                  $0.27                $0.55
    5 K) F0 S7 u" h0 A/ _; \. g1M TOKENS OUTPUT(5)                                              $1.10                $2.19
    5 y  `1 w; q) p1 E  b. M  a
    ; y5 [" i2 [& o' H$ |3 D( e5, Balance
    5 h2 T: o. j2 C6 Z  T# z/ [2 ]+ h3 L9 P8 m6 [* t7 u4 c9 c8 I* K$ p
    可以在程序里调用,知道每次运行结束后,balance还剩多少。- q& F( l3 |/ I: r  P
    参考:( ^1 [! b. Y1 v6 r  j* v% H
    https://api-docs.deepseek.com/api/get-user-balance  O8 d( k& b# n( p  a8 g5 h
    . k/ f- r7 H- ]  g: {6 |
    6, Models
    * }0 k  d* Q/ z. I' B$ A
    5 [5 B# ?7 E/ w0 D" _* k7 G目前就两个+ H9 g. c9 D! `) i: T
    # deepseek-chat7 v4 ^9 d4 a2 f" i7 Y3 T# E% v) M, y
    # deepseek-reasoner
    $ K7 Q% q1 F+ }1 p4 M5 f& }) V! A# ^
    参考:! l8 _! ?0 s1 Z; T0 [6 _: J7 D4 `
    https://api-docs.deepseek.com/api/list-models
    5 M3 ]; t. ?8 f8 y& ~0 `# {
    + B) a) W) ~" x" [0 s) O% b# G  g* m; x9 c0 Q: d! a
    7, 问题
    + ?' C8 x& U4 t8 u. X) E( F& f' |$ \
    deepseek 会将前后两段合成一段。+ z% y+ f7 a6 x) d" e! b1 z
    特别是那种大量的对话的段落,deepseek会给你合成一大段。0 I: h5 o" f. x) \6 ~

    $ m2 n0 d  K' [; q. c4 \8, 钱说了算。, U- a; [! b0 L4 G# ]5 |

    * n. M6 N5 F- Mdeepseek 如果是免费的网页版,有时候会出现超出范围的提示,不干了。3 Y+ i% @& \. P" r
    但是API就不会出现这种情况,毕竟我们给钱了。
    ! @% f& P2 |; \/ n) @chatgpt也是这样的。2 B" U% E8 v& p3 I: V& ~& M

      a) p6 R  p) Y7 r- f4 y5 [5 ]5 W1 l" k$ K: i) R

    评分

    参与人数 2爱元 +14 学识 +2 收起 理由
    唐家山 + 4
    老票 + 10 + 2 给力

    查看全部评分

    回复 支持 反对

    使用道具 举报

    手机版|小黑屋|Archiver|网站错误报告|爱吱声   

    GMT+8, 2026-9-27 14:53 , Processed in 0.082863 second(s), 18 queries , Gzip On.

    Powered by Discuz! X3.2

    © 2001-2013 Comsenz Inc.

    快速回复 返回顶部 返回列表