PDF 到 Markdown

PDF 到 Markdown 可让您使用扫描文档的 ocr 将 pdf 转换为 Markdown 文本。 支持孟加拉语、英语等。 直接在您的浏览器中进行安全的服务器处理。

Your files are processed securely and automatically deleted after processing. We do not permanently store your files.

Drag & drop files here, or click to browse

Max size: 500 MB

OCR languages (122 supported)

All Tesseract OCR languages are listed. Your server must have the matching .traineddata files installed.

Key capabilities

  • 使用扫描文档的 OCR 将 PDF 转换为 Markdown 文本。 支持孟加拉语、英语等。
  • 安全服务器处理
  • 免费使用

使用方法

  1. 上传您的 PDF(文本或扫描件)。
  2. 为扫描页面选择自动(推荐)、仅文本或 OCR。
  3. 选择 OCR 语言 — 例如 双语文件的英语 + 孟加拉语。
  4. 单击“处理”并下载 .md 文件。

How this tool works

  1. 上传您的 PDF(文本或扫描件)。
  2. 为扫描页面选择自动(推荐)、仅文本或 OCR。
  3. 选择 OCR 语言 — 例如 双语文件的英语 + 孟加拉语。
  4. 单击“处理”并下载 .md 文件。

Recommended settings

  • 首先使用默认选项,然后根据需要进行调整

Supported formats

application/pdf

File size and limits

  • 最大上传大小在站点设置中控制(通常为 50–100 MB,具体取决于管理员配置)。
  • 非常大或大量扫描的 PDF 可能需要更长的时间来处理。

Privacy

文档工具在我们的安全服务器上处理文件。 上传的内容仅临时存储,并在您下载结果后或保留超时(默认 30 分钟)后删除。

Common use cases

  • 随时使用 PDF 转 Markdown:使用扫描文档的 OCR 将 PDF 转换为 Markdown 文本。 支持孟加拉语、英语等。

Troubleshooting

处理失败或超时

尝试较小的文件、较少的页面或较低的压缩/质量设置。 刷新并重新上传。

下载链接已过期

结果是暂时的。 重新运行该工具并立即下载。

常见问题

你们存储我的文件吗?

不会。文件会被临时处理并自动删除。 我们绝不会永久存储您上传的内容。

文件保存多长时间?

下载结果后或短暂超时(默认 30 分钟)后(以先到者为准),文件将被删除。

它支持孟加拉语和其他语言吗?

是的。 对于扫描的 PDF,请选择孟加拉语 (ben)、英语 (eng) 或多种语言。 服务器上必须安装 Tesseract 语言包。

自动和 OCR 有什么区别?

自动读取可用的嵌入文本,并回退到扫描页面的 OCR。 OCR 始终对每页图像运行光学字符识别。

Educational guides

相关工具