PDF转文本

在线提取 PDF 中的文字:逐页提取并保留原有的行和段落,可直接复制或下载为 .txt 文件。免费、私密,文件不会上传到任何地方。

文件由你的浏览器读取,不会发送到任何地方。没有上传,也没有存储。

它做什么


这个工具读取 PDF 中的文字,并以纯文本形式返回,你可以复制、编辑或保存为 .txt 文件。行和段落会根据页面上文字的位置重建,还可以标记每一页的开头位置。适用于任何包含真实文字的 PDF,例如从文字处理软件导出的文档;扫描页面是图像,没有可提取的文字。

使用方法


  1. 选择 PDF。
  2. 点击“提取文字”。较长的文档需要几秒钟。
  3. 复制文字或将其下载为 .txt 文件。

常见问题


为什么在我的 PDF 中找不到文字?
因为页面是图像,例如扫描的文档或保存为 PDF 的照片。这种情况下 PDF 里没有文字,只有像素,要读取它需要文字识别(OCR)。

排版会保留吗?
文字会保留行和段落,但不保留字体、分栏或图片。在双栏文档中,每行文字可能混合两栏的内容;表格会变成单元格之间以空格分隔的文字行。

我的文件安全吗?
安全。PDF 由你的浏览器读取,从不发送到服务器,因此可以用于私人文件。

支持所有语言吗?
支持,只要 PDF 包含真实文字,且其字体正确映射了字符。一些旧的或制作不当的 PDF 在屏幕上显示正常,但提取时会出现乱码;这是文件本身的问题,只有 OCR 才能恢复。

Wikipedia — PDF
Wikipedia — Optical character recognition