PDF 提取文字时,文件和密码会上传服务器吗?
不会。PDF.js 在当前浏览器读取文件与打开密码,逐页取得 PDF 已有文字层;搜索、复制、TXT、Markdown、JSON 和 ZIP 也都在本机生成。页面不会为了提取文字把文档发送给第三方服务。
PDF TEXT TOOL
从原生 PDF 的文字层提取可编辑文本,并保留分页信息。文件只在当前浏览器读取;扫描图片需要 OCR,不会被误报为已识别。
文件
未选择
总页数
0
已提取字符
0
无文字页
0
选择带有文字层的 PDF 后,可按页提取可编辑文本。
EXTRACTED TEXT
0 页 · 0 字符 · 约 0 个中英文词元
RELATED TOOLS
USE & REVIEW
不会。PDF.js 在当前浏览器读取文件与打开密码,逐页取得 PDF 已有文字层;搜索、复制、TXT、Markdown、JSON 和 ZIP 也都在本机生成。页面不会为了提取文字把文档发送给第三方服务。
很多扫描件只是把纸张拍成图片,肉眼看得到字,但 PDF 内没有可选择的文字层。当前工具不是 OCR,因此会把这类页面明确标记为“无文字”,而不会猜测内容。可以先把需要的页面转成图片,再交给可信 OCR 工具识别。
按视觉行会根据文字在页面上的坐标组合同行内容,适合表格、票据和版式明确的页面;内容流遵循 PDF 内部对象顺序,通常更适合正文。双栏、浮动文本、脚注和复杂公式可能在两种模式下都需要人工校对。
PDF 保存的是绘制指令,不一定保存正常段落。特殊字体可能缺少可靠字符映射,某些文件按单字定位,双栏排版也可能交错。工具能重组常见文本层,但无法从所有 PDF 恢复原始 Word 结构;应切换顺序模式并抽查关键页面。
有“打开密码”的 PDF 可以输入密码后尝试读取,密码只在本地交给解析器。证书加密、DRM、损坏文件或禁止访问内容的权限策略仍可能无法处理。工具不会移除安全限制,也不会保存密码。
TXT 适合复制、搜索和一般存档;Markdown 用二级标题和分隔线标记页码,适合继续整理文章;JSON 保存页码、每页文本、行数和统计数据,便于程序处理;逐页 ZIP 则适合把每个页面交给不同人员或后续流程。