按需要调整
选择页码、顺序或输出设置,让结果符合这一次的任务。
浏览器内处理
只读取现有文字层;扫描图片不会自动识别为文字。
添加一份 PDF
最多 30 MB、200 页。
尚未选择 PDF。
添加 PDF 后查看提取计划。
注意:无文字层的扫描页会列为“无可提取文字”,不是文件损坏。多栏、表格和分散文本框的顺序可能与视觉阅读顺序不同;请核对输出。本工具不提供 OCR 或表格转 CSV。
了解操作方法、文件限制与结果检查。
课程资料、工作报告或电子合同常以 PDF 交付,阅读方便,摘录却可能费时。若文件本来含有可选中的文字层,本工具可按页面提取文字,在浏览器中检查、复制,并下载 UTF-8 编码的 TXT。可选择全部页面、某一文件页码或明确范围,也能标明每段文字来自哪一页。整个提取过程在浏览器中完成,所选 PDF 不会提交给文档处理接口;页面程序仍需从本站加载。
这项功能只读取现成文字层,不把图片中的字识别出来。扫描纸张得到的 PDF,页面看起来有清楚文字,却可能只是像素图。此时工具会列出“无可提取文字”的页码,不会因此称文件损坏。OCR 是分析图像并识别字符的另一项工作,本批工具不提供。多栏文章、表格和分散文本框也可能出现文字顺序变化,下载前请把结果和原页对照。
PDF 页面往往存储为许多放在具体坐标上的短文字片段,而不是完整的可编辑段落。“保留检测到的行”根据文字片段的换行提示和纵向位置,组织成一行一行的文本。若源文件把同一句话拆成几个坐标片段,工具会参考片段距离补空格;中文相邻片段会尽量避免多余的英文空格。布局异常时仍可能发生断行不准、片段连接不自然等情况,所以这种模式也不是原版式的逐字还原。
“适度合并连续行”先得到检测到的行,再把看起来相连的行接起来;遇到简单的句末符号或列表开头则保留分行。这样在读长段落或粘贴到笔记时可能更顺畅。它不会自动理解标题层级、脚注、双栏、引文格式,也不能判定作者当初在哪里按下回车。中文句子若在行末、行首连续出现,连接时不额外加入英文空格;其他语言通常以一个空格连接。需要核对排版位置时,优先使用保留行的模式。
工具里的“第几页”指 PDF 文件中从前往后的纸张位置,不一定等于纸面印刷数字,也不一定等于阅读器工具栏显示的内部页面标签。例如封面后第一张正文印着“1”,它在文件里可能是第 2 页。输入 4,1-2,会先提取文件第 4 页,再提取第 1、2 页。这适合按自己的顺序摘录,但如果要引用来源,最好保留自动生成的页头。
开启页码分隔后,每个选中页面会以明确的来源页头开头。没有文字层的页面会显示提示,避免在长篇输出中被误认为根本没有这一张纸。页头是本工具生成的标签,不是从原稿里读出的句子。关闭分隔时,无文字页不会贡献正文,但结果区仍会指出它的页码。如果一个资料包同时有扫描页和电子文字页,保留分隔有助于发现空白段落究竟对应哪一页。
纸质材料经扫描后,PDF 可能只保存一幅或多幅页面照片。人眼能看到“文字”,程序看到的却是图像数据,没有可复制的字符。此工具会如实报告该页没有可提取文字;这并不表示图片空白,也不说明 PDF 已损坏。要把扫描图变成可搜索的文字,需要 OCR 识别,再由人检查识别出的姓名、数字、标点和专业术语。某些文件还把字转换为矢量轮廓,视觉效果像字体,却同样缺少普通文字编码。
也有扫描件已经附带隐藏的 OCR 文字层。此时提取可能得到内容,但这些字来自现有识别结果,错误仍会原样带入。请把关键信息与可见页面对照。少数文件含有字体编码问题,导致阅读器能显示字形,却很难还原正确字符;若原 PDF 明明可选中而这里结果为空或乱码,可用另一款 PDF 阅读器复查。本工具不会凭图像自行编造文字,也不会把无文字页误判为坏文件。
人从左栏读完再读右栏,不代表 PDF 按这个顺序保存文字。文件可能先写右栏,再写左栏,也可能把两栏的句子交叉写入。页眉、页脚、旁注、图注、脚注和单独的文本框也会打乱片段顺序。本工具沿用 PDF 阅读器交出的文字片段,只做有限的行组织和段落合并,不根据页面区域重建可靠的双栏阅读路线。正式引用或交给其他系统处理之前,要把提取结果放在原页旁逐段确认。
表格除了字,还依赖行列位置、边框和单元格归属。纯 TXT 没有单元格概念。即便所有数字都被提取,原来属于哪个表头、哪一行仍可能不清楚。本工具不把普通文本输出冒充表格转 CSV,也不承诺自动保留表格结构。如果后续要做计算或形成电子表格,应选专门的表格识别方法,并逐列核对单位、合计与空白值。
下载文件使用 UTF-8 编码,并带有方便常见桌面编辑器识别编码的标记。它包含结果框中的文字,以及你选择保留的来源页头。只要来源文字层能被正确读取,中文、英文和其他 Unicode 字符都可以写进普通 TXT。点击复制会尝试把全文放进剪贴板;若浏览器权限不允许自动复制,页面会选中结果文字,提示使用键盘复制快捷键。也可以在结果框中自行选择一小段。
单份输入上限为 30 MB、200 页;提取出的 TXT 内容上限为 12 MB,以控制内存和意外大文件。处理按页推进,有进度和取消按钮。取消后不会提供半成品下载,可以调整范围重试。没有文字的页面也计入页数,并在结果中报告。来源 PDF 不会被修改。TXT 不保存图片、字体、颜色、批注、链接、页面尺寸或可交互表单,因此不能把它当作新 PDF 或原排版的备份。
普通电子资料的提取结果可用于快速搜索和整理笔记,但正式材料中的一个数字、一处负号或顺序颠倒都可能改变含义。引用法律、科研、医疗或财务文本时,应重新打开原 PDF 检查目标句子。特别留意范围的首尾页是否在结果中、中文标点是否保留,以及扫描页是否被列出。工具提供可直接检查的结果框和无文字页列表,却无法判断句子在业务上的真伪或完整性。
加密或损坏文件不会被假装转换成功。特殊字体缺少字符映射时,抽出的字可能为空或错误,即使页面显示正常。导出的只是普通文本,不会反向给原扫描件增加文字层,也不会让旧 PDF 自动变成可搜索文件。若你的真正目标是识别扫描图,请使用 OCR 流程,并认真校对识别结果。
页面可能是扫描图片、字形轮廓,或采用难以还原的特殊字体编码。本工具读取现有文字层,会列出无文字的文件页码,方便你判断是否需要 OCR 或换阅读器复查。
选择“保留检测到的行”。它依照文字片段的换行标志和位置组织输出,但 PDF 不一定存有真正的段落边界。重要排版仍需对照原页。
PDF 的绘制顺序可能与人眼阅读顺序不同。本工具不重建复杂栏目或表格。可以缩小范围,按原页手工校正顺序。
可以,只要来源 PDF 有可提取的中文字符。下载采用 UTF-8。纯扫描图片不会被识别成中文文字。
不会。TXT 只有提取出的字符和可选页码标签,图像、页面布局及表格单元格关系不会保留。