前言
在用了一段时间的AI编程工具(比如Claude Code、OpenCode、Codex等)之后,我发现AI在阅读PDF、图片、Office文件的时候还是有些困难,虽然说AI会自己编写Python脚本或者调用相关skills、mcp以及插件来完成阅读,但依旧非常不方便。因此本文介绍一个相对来说较为方便的方法,其可以将非结构化文档(PDF、图片、Office 文件等)转换为机器可读的Markdown和JSON,提高效率。
本文参考的GitHub仓库地址为:https://github.com/opendatalab/MinerU-Ecosystem
该仓库讲了很多使用方法,本次主要讲的是skill的方式,因为Claude Code等AI编程工具能够便捷的使用。
安装
首先需要确保安装了nodejs和npm,可以在命令行中输入下面的命令检查:
node -v
npm -v
能够成功输出版本号就代表安装成功,如果没有安装请自行去官网下载nodejs。
然后使用下面的命令来安装mineru-open-api:
npm install -g mineru-open-api
然后用下面的命令来验证下载是否成功:
mineru-open-api version
如果能成功显示版本,则代表下载成功。
使用
快速使用(token free模式)
基础用法
mineru-open-api flash-extract 你的文件.pdf
直接转换的结果默认是输出在命令行中,如果想指定输出目录,可以用下面的命令:
mineru-open-api flash-extract 文件.pdf -o ./输出目录
该方式用限制,可能会限制pdf的大小和页数,具体请看原仓库。
高级使用
想要没有上述限制,可以去官网获取一个API Tokens,个人每天免费解析文件数5000,优先解析页数1000,个人使用完全足够。
创建完API Tokens后,在命令行输入下面的命令进行登录:
mineru-open-api auth
然后粘贴刚才的API Tokens,回车即可。然后就可以进行高精度提取文件了。
mineru-open-api extract 文件.pdf -o ./out -f md,docx
可以使用上面的命令进行验证。
skill配置
下面将该技能添加进Claude Code中,在原仓库中可以看到代码里存在一个叫skills的文件夹,可以直接将该文件夹下载下来,然后复制到对应的技能文件夹下,比如说Claude Code的全局技能文件夹就在C:\Users\你的用户名\.claude\skills中,直接复制到该文件夹下即可。
你也可以叫AI帮你完成这个工作。更多高级用法请自行前往了解。
结语
相关地址如下:
MinerU官网:https://mineru.net
GitHub仓库:https://github.com/opendatalab/MinerU
利用MinerU将PDF等文件转换成Markdown
本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。
评论交流
欢迎留下你的想法