免费在线 PDF 工具

PDF OCR 文字识别 文件处理,更简单

把扫描 PDF 转为可搜索 PDF,保留页面外观;也可以校对文字后下载 TXT。

免费使用 · 无需注册 · 文件在浏览器内处理

浏览器内处理

PDF OCR 文字识别

把扫描 PDF 转为可搜索 PDF,保留页面外观;也可以校对文字后下载 TXT。

添加一份或多份 PDF

每份最多 30 MB、30 页。

批量最多 8 份,输入与输出分别不超过 120 MB。共用设置,逐份处理,成功文件打包为 ZIP。

从设备中选择文件 · 仅在浏览器内处理

尚未选择 PDF。

可搜索 PDF 为无文字页面添加不可见文字层,已有文字页保留原样。不提供 Word 转换或无障碍标签结构。TXT 校对不会修改 PDF 文字层,请复核 OCR 姓名和数字。

用更简单的方式,PDF OCR 文字识别

清晰的操作步骤,实用的文件工具,从选择到完成都更从容。

PDF OCR 文字识别

把扫描 PDF 转为可搜索 PDF,保留页面外观;也可以校对文字后下载 TXT。

为中文印刷资料准备扫描识别

完成处理,下载后就能使用

导出结果可以继续阅读、打印或分享。根据工具选择 PDF、图片、文本、电子表格或 ZIP 格式;重要文件请在常用阅读器中复核。

核对识别结果中的数字与标点

打开浏览器,随时开始

无需安装应用,也无需创建账户。电脑、平板和手机均可访问;文件大小和页数限制会在各工具中明确说明。

校对后整理成便于编辑的文字笔记

需要的功能,清晰地安排好

专注完成一个任务,让每一步都更清楚。

按需要调整

选择页码、顺序或输出设置,让结果符合这一次的任务。

开始使用

确认后再生成

根据当前工具查看预览、处理摘要或输出检查信息。

开始使用

浏览器内处理

所选文件在当前浏览器内读取与处理,无需上传文档。

开始使用

直接下载结果

完成后保存新文件,输出格式由所选工具决定。

开始使用

保留原始文件

每次处理都会生成新结果,不会直接覆盖源文件。

开始使用

适配不同设备

电脑、平板与手机都可以访问,大小限制在工具中列明。

开始使用

从文件到结果,只需三步

无需账户,无需安装,让日常文档处理更简单。

01

选择文件与工具

选择一份或最多八份扫描件,每份不超过 30 页。

  • 无需注册
开始使用
02

调整设置并检查

按文件内容选择英文、简体中文或中英混合识别。

  • 清晰的设置
开始使用
03

处理并下载结果

选择可搜索 PDF 并在阅读器中验证搜索,或校对 TXT 文字后下载。

  • 浏览器内处理
开始使用

详细指南与常见问题

结合实际使用场景,了解操作、限制与结果检查方法。

扫描 PDF 里的字看得见,却复制不了怎么办?

扫描件常把整页保存成图片,人眼能读到文字,文件里却没有可复制的字符。文字识别会分析这些像素,生成可以编辑的文本。本工具支持印刷体简体中文、英文及中英混合,可以选择可搜索 PDF,为扫描页添加不可见文字层;也可以在页面上校对文字后下载 UTF-8 TXT。

如果原 PDF 已有可靠文字层,建议先用普通提取文字工具,避免多做一次识别而引入错误。TXT 输出纯文本;可搜索 PDF 默认保留原页面图像并叠加文字,启用扫描调整时指定无文字页会重建。两种模式都不是 Word 排版转换。

中文资料应该选择哪种语言?

纯英文资料选 English,以简体中文为主的资料选简体中文,含英文型号、缩写、参考文献的中文材料可以选“简体中文 + 英文”。使用中文模型生成可搜索 PDF 时,会嵌入完整字体以支持连续词搜索,文件可能明显增大。语言模型要与原稿相符,不能因为字形接近,就把一种语言当成另一种语言处理。

繁体中文、日文、手写字、数学符号和特殊字体不在本页的可靠识别承诺范围内。即使偶尔识别出部分内容,也应逐项核对,不要把看起来通顺的结果直接当作准确原文。

怎样识别并导出 TXT?

添加文件,选语言,开始处理。工具逐页读取,结果中带有来源页标记,便于回看原稿。完成后直接修改下方文本框,下载内容会随修改更新。

建议先拿一份有代表性的短文件试用,挑包含姓名、数字、标点的一段比对。不要只看有没有输出大段文字;少一个小数点、把 0 识别成 O,都可能改变含义。

为什么中文、数字或标点识别错了?

扫描模糊、倾斜、阴影、浅色印刷、压缩噪点和纸张污渍都会影响判断。生僻人名、专业术语、编号等没有明显语言上下文的内容,也更容易出错。

优先校对身份证明编号、日期、金额、单位、小数点和负号。对于表格,还要核对数字属于哪一行、哪一列。原稿本身看不清时,重新获取清晰扫描通常比反复识别同一张模糊图更有用。

怎样准备更适合识别的扫描件?

页面尽量摆正,光线均匀,纸面平整,不要切掉边缘笔画。手机斜拍可能需要先做透视校正;书籍中缝弯曲和黑影也应在扫描阶段尽量减少。

识别前不要为了减小体积先把小字压糊。保留清晰原稿做 OCR,需要分享时再另做压缩副本。本工具不自动修复折痕、褪色或曲面,也不能恢复原图中已经缺失的笔画。

表格、多栏文章和手写内容能保留吗?

本工具面向印刷体文字。手写字可能漏识别或误识别,多栏文章可能需要人工调整阅读顺序。图注、旁注和页脚也可能混进正文。

TXT 没有真正的单元格结构,因此不能承诺表格的行列关系。本页不输出 Excel 或 CSV。涉及账目或统计表时,应使用适合表格识别的流程,再逐格核对数据。

怎样把扫描 PDF 转为可搜索 PDF?

在输出格式中选择“可搜索 PDF”,按内容设置识别语言,再开始处理。工具检查每页是否已有文字;已有文字的页面保留原样,不叠加第二份文字。无文字页完成识别后,新增不可见字符层,未启用扫描调整时,原始扫描图像、页序和页面边界保留。旋转角度与裁剪区域会参与文字层的位置映射。

下载后在阅读器中搜索一个有代表性的词,选中一小段文字,核对选中区域是否与画面对应。尤其检查旋转页,以及姓名、金额和编号。没有识别出字符的页不会增加文字层,结果摘要会说明新增和保留的页数。已有但编码错误的文字层不会自动修复,仍应另用合适的 OCR 编辑流程。

TXT 校对可以同步改掉 PDF 里的识别错误吗?

不能。这是两种独立输出:文本框修改会更新 TXT 下载,但不会重写可搜索 PDF 的字符或位置。PDF 文字层使用识别引擎结果。若姓名或数字错误,可以改善原稿后重新识别,或使用支持校对 PDF 文字层的编辑器。不要把修正后的 TXT 当作另一份 PDF 已经同步修正的证明。

原扫描画面仍是核对依据。OCR 把一个字认错,搜索时可能漏掉这一处,即使画面看起来没有问题。复杂表格和多栏内容也可能出现不理想的复制顺序。工具不生成 Word、Excel 或 CSV,也不把纸面表格变成真实单元格。

书签、链接和无障碍结构会怎样处理?

未启用扫描调整时,可搜索模式在原 PDF 上添加文字,不重建页面。原有页面、图片、尺寸和普通导航对象保留,依赖书签或链接时仍需下载验证。含签名字段、数字认证或 XFA 的文件不支持此模式,因为重写可能影响其特殊功能。

新增文字层不等于已完成无障碍 PDF:阅读顺序、标题标签、图片说明和表格结构仍需单独检查。OCR 也不是永久遮盖敏感内容。后续如果用仅保留图像的压缩方式处理,可搜索文字层可能丢失;完成最后一次处理后,要再次验证搜索和选择文字。

首次加载慢、取消任务或识别失败怎么办?

首次需要从本站加载识别引擎和语言模型,之后由设备处理。网络影响模型加载,设备性能和页数影响识别速度;手机上处理长扫描件可能更慢。

每次支持不超过 30 MB、最多 30 页的未加密 PDF,输出最多 120 MB,单页渲染还有像素上限。可以取消后改用更短文件。失败会提示错误,不会把空文件当作成功结果;TXT 中没有识别出文字的页面会明确标注;PDF 中则保留该页,不添加新文字层。下载前请逐页检查,尤其是后续要引用的段落。

扫描 PDF 有点歪,怎样纠偏?

勾选“识别前调整扫描页面”,填写需要调整的实际页码,再选择预览页。手动角度范围是 −5° 到 5°,正值按屏幕方向顺时针旋转。也可以启用轻微倾斜角度估计,但文字太少、表格线或背景噪声可能让估计不准确,必须先看对照预览。

轻微纠偏不是 90° 旋转,也不会修复透视变形或书脊附近的弯曲文字。为了不切掉四角,调整会把页面内容缩放到原可见边界内,可能稍微缩小内容并增加白边。请同时检查页边与正文,不只看中间一行是否水平。

怎样提高清晰度,又不弄丢印章和浅色笔迹?

亮度与对比度可在 −30 到 30 之间调整,也可以选择灰度。过度调整可能让浅色印章或细笔画消失,工具不会判断这些痕迹是否重要。请比较前后画面,从较小变化开始;颜色承载信息时保留彩色。重置调整会清零角度、亮度和对比度,并关闭自动估计及灰度,确认勾选也会取消。

启用后,可搜索 PDF 中指定的无文字扫描页以 144 DPI 重建,不再保留这些页原图片的字节;重建页上的链接和批注移除。其余页面保持原样,已有文字页不做扫描调整。带交互字段的表单不支持启用调整。调整是可选功能,默认关闭。

能只调整几页,其余页面保持原样吗?

可以填写“1,3-5”这样的范围。不同页的亮度和倾斜可能不同,请检查各部分的代表页;需要不同设置时,可分批处理。结果摘要会报告实际重建的扫描页数。TXT 模式只把调整后的图像用于识别,下载仍是纯文本,不是增强扫描 PDF。

完成可搜索 PDF 后,检查调整页的边缘、印章和小字,并验证搜索与文字选择位置。扫描调整不是永久删除隐私的工具,原文档仍可能含隐藏对象和属性;需要分享前删除敏感内容,请使用单独的永久遮盖工具。

多份扫描 PDF 能一起做 OCR 吗?

在文件选择框中同时选两到八份 PDF,工具就会逐份处理。识别语言和输出格式共用,每份仍限制 30 MB、30 页,整批输入及成功输出分别不超过 120 MB。损坏、加密或超页数的文件单独标为失败,其余文件继续。

可以逐份下载成功结果,也可以下载 ZIP。包内 manifest.json 记录原文件名、状态和输出名,同名输入不会互相覆盖。批量 TXT 请在文字编辑器中逐份校对,不会合成一段混杂的识别结果。可搜索 PDF 保持各自页数及已有文字页。扫描调整限单文件模式,方便预览并确认外观。取消任务会清除队列结果;更换文件或设置后,需要重新处理。

接下来还可以怎样处理?

按你的下一步需求选择工具,并检查每次输出。

下一份文档,从这里开始

无需账户,无需安装。

选择文件,调整设置,下载你需要的结果。

免费使用 · 文件在浏览器内处理