免费在线 PDF 工具

PDF 提取文字 文件处理,更简单

把现有文字层导出为方便检查、复制和编辑的普通文本。

免费使用 · 无需注册 · 文件在浏览器内处理

浏览器内处理

提取 PDF 中已有的文字

只读取现有文字层;扫描图片不会自动识别为文字。

添加一份 PDF

最多 30 MB、200 页。

从设备中选择文件 · 仅在浏览器内处理

尚未选择 PDF。

添加 PDF 后查看提取计划。

注意:无文字层的扫描页会列为“无可提取文字”,不是文件损坏。多栏、表格和分散文本框的顺序可能与视觉阅读顺序不同;请核对输出。本工具不提供 OCR 或表格转 CSV。

用更简单的方式,提取文字

清晰的操作步骤,实用的文件工具,从选择到完成都更从容。

让 PDF 文字更方便使用

提取选中页面的已有文字层,检查后复制或下载 UTF-8 文本。扫描页需要另行进行 OCR。

从文档页面提取已有文字

完成处理,下载后就能使用

导出结果可以继续阅读、打印或分享。根据工具选择 PDF、图片、文本、电子表格或 ZIP 格式;重要文件请在常用阅读器中复核。

检查提取文字与原文

打开浏览器,随时开始

无需安装应用,也无需创建账户。电脑、平板和手机均可访问;文件大小和页数限制会在各工具中明确说明。

复制或下载可编辑文本

需要的功能,清晰地安排好

专注完成一个任务,让每一步都更清楚。

按需要调整

选择页码、顺序或输出设置,让结果符合这一次的任务。

开始使用

确认后再生成

根据当前工具查看预览、处理摘要或输出检查信息。

开始使用

浏览器内处理

所选文件在当前浏览器内读取与处理,无需上传文档。

开始使用

直接下载结果

完成后保存新文件,输出格式由所选工具决定。

开始使用

保留原始文件

每次处理都会生成新结果,不会直接覆盖源文件。

开始使用

适配不同设备

电脑、平板与手机都可以访问,大小限制在工具中列明。

开始使用

从文件到结果,只需三步

无需账户,无需安装,让日常文档处理更简单。

01

选择文件与工具

找到要完成的任务,从设备中选择 PDF 或图片。每个工具都会说明支持的文件与大小限制。

  • 无需注册
开始使用
02

调整设置并检查

设置页码、顺序、尺寸或样式。根据工具查看页面预览或处理摘要,确认操作范围。

  • 清晰的设置
开始使用
03

处理并下载结果

在浏览器内生成结果,保存到自己的设备。重新打开重要文件,检查内容与页面顺序。

  • 浏览器内处理
开始使用

使用指南与常见问题

了解操作方法、文件限制与结果检查。

把 PDF 中已有文字提取为普通文本

课程资料、工作报告或电子合同常以 PDF 交付,阅读方便,摘录却可能费时。若文件本来含有可选中的文字层,本工具可按页面提取文字,在浏览器中检查、复制,并下载 UTF-8 编码的 TXT。可选择全部页面、某一文件页码或明确范围,也能标明每段文字来自哪一页。整个提取过程在浏览器中完成,所选 PDF 不会提交给文档处理接口;页面程序仍需从本站加载。

这项功能只读取现成文字层,不把图片中的字识别出来。扫描纸张得到的 PDF,页面看起来有清楚文字,却可能只是像素图。此时工具会列出“无可提取文字”的页码,不会因此称文件损坏。OCR 是分析图像并识别字符的另一项工作,本批工具不提供。多栏文章、表格和分散文本框也可能出现文字顺序变化,下载前请把结果和原页对照。

怎样从 PDF 提取文字
  1. 添加一份文件。 选择不超过 30 MB、共 1—200 页的 PDF。程序先核对文件及页数;需要密码、损坏或不受支持的文件会报错。
  2. 指定页面。 可提取全部、单页,或输入 1-3,5 这类页码范围。这里采用 PDF 内的实际顺序,从第一张纸算作第 1 页。重复、空项和越界范围会被拒绝。
  3. 选择换行方式。 “保留检测到的行”尽量依照阅读器给出的断行和位置输出;“适度合并连续行”让普通段落更紧凑。两者都不能还原作者在 Word 等源文件中的真正段落结构。
  4. 决定是否标明来源页。 勾选后,每页有独立页头和分隔,便于以后核对引文位置。取消勾选后,只保留提取出的正文;无文字页仍在结果提示里列明。
  5. 检查、复制或下载。 在结果框阅读文字和无文字页列表。可以复制全文,也能下载 UTF-8 TXT。涉及姓名、数字或正式引用时,务必回到原 PDF 复核。
“保留换行”和“合并连续行”的实际区别

PDF 页面往往存储为许多放在具体坐标上的短文字片段,而不是完整的可编辑段落。“保留检测到的行”根据文字片段的换行提示和纵向位置,组织成一行一行的文本。若源文件把同一句话拆成几个坐标片段,工具会参考片段距离补空格;中文相邻片段会尽量避免多余的英文空格。布局异常时仍可能发生断行不准、片段连接不自然等情况,所以这种模式也不是原版式的逐字还原。

“适度合并连续行”先得到检测到的行,再把看起来相连的行接起来;遇到简单的句末符号或列表开头则保留分行。这样在读长段落或粘贴到笔记时可能更顺畅。它不会自动理解标题层级、脚注、双栏、引文格式,也不能判定作者当初在哪里按下回车。中文句子若在行末、行首连续出现,连接时不额外加入英文空格;其他语言通常以一个空格连接。需要核对排版位置时,优先使用保留行的模式。

文件页码、范围顺序与分隔符

工具里的“第几页”指 PDF 文件中从前往后的纸张位置,不一定等于纸面印刷数字,也不一定等于阅读器工具栏显示的内部页面标签。例如封面后第一张正文印着“1”,它在文件里可能是第 2 页。输入 4,1-2,会先提取文件第 4 页,再提取第 1、2 页。这适合按自己的顺序摘录,但如果要引用来源,最好保留自动生成的页头。

开启页码分隔后,每个选中页面会以明确的来源页头开头。没有文字层的页面会显示提示,避免在长篇输出中被误认为根本没有这一张纸。页头是本工具生成的标签,不是从原稿里读出的句子。关闭分隔时,无文字页不会贡献正文,但结果区仍会指出它的页码。如果一个资料包同时有扫描页和电子文字页,保留分隔有助于发现空白段落究竟对应哪一页。

为什么看得见字却提取不出来

纸质材料经扫描后,PDF 可能只保存一幅或多幅页面照片。人眼能看到“文字”,程序看到的却是图像数据,没有可复制的字符。此工具会如实报告该页没有可提取文字;这并不表示图片空白,也不说明 PDF 已损坏。要把扫描图变成可搜索的文字,需要 OCR 识别,再由人检查识别出的姓名、数字、标点和专业术语。某些文件还把字转换为矢量轮廓,视觉效果像字体,却同样缺少普通文字编码。

也有扫描件已经附带隐藏的 OCR 文字层。此时提取可能得到内容,但这些字来自现有识别结果,错误仍会原样带入。请把关键信息与可见页面对照。少数文件含有字体编码问题,导致阅读器能显示字形,却很难还原正确字符;若原 PDF 明明可选中而这里结果为空或乱码,可用另一款 PDF 阅读器复查。本工具不会凭图像自行编造文字,也不会把无文字页误判为坏文件。

多栏、文本框、表格的顺序限制

人从左栏读完再读右栏,不代表 PDF 按这个顺序保存文字。文件可能先写右栏,再写左栏,也可能把两栏的句子交叉写入。页眉、页脚、旁注、图注、脚注和单独的文本框也会打乱片段顺序。本工具沿用 PDF 阅读器交出的文字片段,只做有限的行组织和段落合并,不根据页面区域重建可靠的双栏阅读路线。正式引用或交给其他系统处理之前,要把提取结果放在原页旁逐段确认。

表格除了字,还依赖行列位置、边框和单元格归属。纯 TXT 没有单元格概念。即便所有数字都被提取,原来属于哪个表头、哪一行仍可能不清楚。本工具不把普通文本输出冒充表格转 CSV,也不承诺自动保留表格结构。如果后续要做计算或形成电子表格,应选专门的表格识别方法,并逐列核对单位、合计与空白值。

复制、UTF-8 下载和文件上限

下载文件使用 UTF-8 编码,并带有方便常见桌面编辑器识别编码的标记。它包含结果框中的文字,以及你选择保留的来源页头。只要来源文字层能被正确读取,中文、英文和其他 Unicode 字符都可以写进普通 TXT。点击复制会尝试把全文放进剪贴板;若浏览器权限不允许自动复制,页面会选中结果文字,提示使用键盘复制快捷键。也可以在结果框中自行选择一小段。

单份输入上限为 30 MB、200 页;提取出的 TXT 内容上限为 12 MB,以控制内存和意外大文件。处理按页推进,有进度和取消按钮。取消后不会提供半成品下载,可以调整范围重试。没有文字的页面也计入页数,并在结果中报告。来源 PDF 不会被修改。TXT 不保存图片、字体、颜色、批注、链接、页面尺寸或可交互表单,因此不能把它当作新 PDF 或原排版的备份。

何时要人工复核

普通电子资料的提取结果可用于快速搜索和整理笔记,但正式材料中的一个数字、一处负号或顺序颠倒都可能改变含义。引用法律、科研、医疗或财务文本时,应重新打开原 PDF 检查目标句子。特别留意范围的首尾页是否在结果中、中文标点是否保留,以及扫描页是否被列出。工具提供可直接检查的结果框和无文字页列表,却无法判断句子在业务上的真伪或完整性。

加密或损坏文件不会被假装转换成功。特殊字体缺少字符映射时,抽出的字可能为空或错误,即使页面显示正常。导出的只是普通文本,不会反向给原扫描件增加文字层,也不会让旧 PDF 自动变成可搜索文件。若你的真正目标是识别扫描图,请使用 OCR 流程,并认真校对识别结果。

PDF 上明明有字,为什么结果显示没有可提取文字?

页面可能是扫描图片、字形轮廓,或采用难以还原的特殊字体编码。本工具读取现有文字层,会列出无文字的文件页码,方便你判断是否需要 OCR 或换阅读器复查。

怎样尽量保留原来的换行?

选择“保留检测到的行”。它依照文字片段的换行标志和位置组织输出,但 PDF 不一定存有真正的段落边界。重要排版仍需对照原页。

双栏文章提取后为什么句子顺序乱了?

PDF 的绘制顺序可能与人眼阅读顺序不同。本工具不重建复杂栏目或表格。可以缩小范围,按原页手工校正顺序。

中文能下载为 TXT 吗?

可以,只要来源 PDF 有可提取的中文字符。下载采用 UTF-8。纯扫描图片不会被识别成中文文字。

TXT 会带上图片和表格结构吗?

不会。TXT 只有提取出的字符和可选页码标签,图像、页面布局及表格单元格关系不会保留。

下一份文档,从这里开始

无需账户,无需安装。

选择文件,调整设置,下载你需要的结果。

免费使用 · 文件在浏览器内处理