前言

在用了一段时间的AI编程工具(比如Claude Code、OpenCode、Codex等)之后,我发现AI在阅读PDF、图片、Office文件的时候还是有些困难,虽然说AI会自己编写Python脚本或者调用相关skills、mcp以及插件来完成阅读,但依旧非常不方便。因此本文介绍一个相对来说较为方便的方法,其可以将非结构化文档(PDF、图片、Office 文件等)转换为机器可读的Markdown和JSON,提高效率。

本文参考的GitHub仓库地址为:https://github.com/opendatalab/MinerU-Ecosystem

该仓库讲了很多使用方法,本次主要讲的是skill的方式,因为Claude Code等AI编程工具能够便捷的使用。

安装

首先需要确保安装了nodejs和npm,可以在命令行中输入下面的命令检查:

node -v
npm -v

能够成功输出版本号就代表安装成功,如果没有安装请自行去官网下载nodejs。

然后使用下面的命令来安装mineru-open-api

npm install -g mineru-open-api

然后用下面的命令来验证下载是否成功:

mineru-open-api version

如果能成功显示版本,则代表下载成功。

使用

快速使用(token free模式)

基础用法

mineru-open-api flash-extract 你的文件.pdf

直接转换的结果默认是输出在命令行中,如果想指定输出目录,可以用下面的命令:

mineru-open-api flash-extract 文件.pdf -o ./输出目录

该方式用限制,可能会限制pdf的大小和页数,具体请看原仓库。

高级使用

想要没有上述限制,可以去官网获取一个API Tokens,个人每天免费解析文件数5000,优先解析页数1000,个人使用完全足够。

创建完API Tokens后,在命令行输入下面的命令进行登录:

mineru-open-api auth

然后粘贴刚才的API Tokens,回车即可。然后就可以进行高精度提取文件了。

mineru-open-api extract 文件.pdf -o ./out -f md,docx

可以使用上面的命令进行验证。

skill配置

下面将该技能添加进Claude Code中,在原仓库中可以看到代码里存在一个叫skills的文件夹,可以直接将该文件夹下载下来,然后复制到对应的技能文件夹下,比如说Claude Code的全局技能文件夹就在C:\Users\你的用户名\.claude\skills中,直接复制到该文件夹下即可。

你也可以叫AI帮你完成这个工作。更多高级用法请自行前往了解。

结语

相关地址如下:

MinerU官网:https://mineru.net
GitHub仓库:https://github.com/opendatalab/MinerU