PDF в Markdown
PDF в Markdown позволяет конвертировать PDF в текст Markdown с помощью OCR для отсканированных документов. поддерживает бангла, английский и многое другое. прямо в вашем браузере с безопасной обработкой на сервере.
Drag & drop files here, or click to browse
Max size: 500 MB
OCR languages (122 supported)
All Tesseract OCR languages are listed. Your server must have the matching .traineddata files installed.
Key capabilities
- Конвертируйте PDF в текст Markdown с помощью оптического распознавания символов для отсканированных документов. Поддерживает бенгальский, английский и другие языки.
- Безопасная обработка данных на сервере
- Бесплатное использование
Как пользоваться
- Загрузите свой PDF-файл (текстовый или отсканированный).
- Выберите «Авто» (рекомендуется), «Только текст» или «OCR» для отсканированных страниц.
- Выберите языки распознавания — например. Английский + бенгальский для двуязычных документов.
- Нажмите «Обработать» и загрузите файл .md.
How this tool works
- Загрузите свой PDF-файл (текстовый или отсканированный).
- Выберите «Авто» (рекомендуется), «Только текст» или «OCR» для отсканированных страниц.
- Выберите языки распознавания — например. Английский + бенгальский для двуязычных документов.
- Нажмите «Обработать» и загрузите файл .md.
Recommended settings
- Сначала используйте параметры по умолчанию, затем при необходимости измените их.
Supported formats
application/pdf
File size and limits
- Максимальный размер загрузки контролируется в настройках сайта (часто 50–100 МБ в зависимости от конфигурации администратора).
- Обработка очень больших или тщательно отсканированных PDF-файлов может занять больше времени.
Privacy
Инструменты для работы с документами обрабатывают файлы на наших защищенных серверах. Загрузки сохраняются только временно и удаляются после загрузки результата или по истечении времени хранения (по умолчанию 30 минут).
Common use cases
- Используйте PDF в Markdown, когда вам нужно: Преобразуйте PDF в текст Markdown с помощью оптического распознавания символов для отсканированных документов. Поддерживает бенгальский, английский и другие языки.
Troubleshooting
Обработка не удалась или истекло время ожидания
Попробуйте использовать файл меньшего размера, меньшее количество страниц или более низкие настройки сжатия/качества. Обновите и загрузите снова.
Срок действия ссылки для скачивания истек
Результаты временные. Перезапустите инструмент и сразу загрузите.
FAQ
Вы храните мои файлы?
Нет. Файлы обрабатываются временно и автоматически удаляются. Мы никогда не храним ваши загрузки постоянно.
Как долго хранятся файлы?
Файлы удаляются после загрузки результата или по истечении небольшого таймаута (по умолчанию 30 минут), в зависимости от того, что наступит раньше.
Поддерживает ли он бангла и другие языки?
Да. Для отсканированных PDF-файлов выберите бангла (бен), английский (англ) или несколько языков. Языковые пакеты Tesseract должны быть установлены на сервере.
В чем разница между Auto и OCR?
Автоматически считывает встроенный текст, если он доступен, и возвращается к распознаванию текста для отсканированных страниц. OCR всегда выполняет оптическое распознавание символов на каждом изображении страницы.
