Dkphhh

Поддерживаемые форматы файлов в Read PDF Aloud

Read PDF Aloud поддерживает куда больше, чем PDF. Все форматы файлов, которые можно загрузить и прослушать, от электронных книг до документов Office.

Несмотря на название, Read PDF Aloud работает не только с PDF-файлами. Инструмент поддерживает множество форматов документов и подходит для озвучивания практически любых текстов.

Все форматы, которые можно загрузить:

  • PDF (.pdf) — стандартные PDF-документы и сканы
  • EPUB (.epub) — открытый формат электронных книг
  • MOBI (.mobi) — старый формат электронных книг Amazon Kindle
  • AZW3 / KF8 (.azw3, .kf8) — Amazon Kindle Format 8
  • Word (.docx) — документы Microsoft Word
  • PowerPoint (.pptx) — презентации Microsoft PowerPoint
  • OpenDocument Text (.odt) — текстовые документы LibreOffice / OpenOffice
  • OpenDocument Presentation (.odp) — слайды LibreOffice / OpenOffice
  • Rich Text Format (.rtf) — кроссплатформенные документы с форматированием
  • Plain Text (.txt) — обычные текстовые файлы
  • Markdown (.md) — документы Markdown

Кроме того, в Read PDF Aloud есть режим ввода текста: вставьте любой текст напрямую, и он будет озвучен, загружать файл не нужно.

PDF

Текст из PDF извлекается постранично, при этом исходная вёрстка сохраняется настолько, насколько это возможно. Каждая страница остаётся отдельной единицей, поэтому навигация по страницам во время воспроизведения повторяет структуру исходного документа.

OCR для сканированных PDF

Для сканированных PDF (документов-картинок без текстового слоя) в Read PDF Aloud есть распознавание текста (OCR) на базе AI. Когда обнаруживается скан, сервис предложит включить OCR. Это премиум-функция со следующими ограничениями:

  • Максимальный размер файла: 50 МБ
  • Максимальное количество страниц: 1 000

Результаты OCR возвращаются в виде структурированного текста, разбитого по страницам.

Как определяются сканированные PDF

Read PDF Aloud вычисляет плотность текста в PDF, то есть среднее количество символов на страницу. Если плотность ниже порога (50 символов на страницу), документ помечается как скан. Так сервис не тратит ресурсы на файлы, из которых нечего извлекать.

Форматы электронных книг

Электронные книги (EPUB, MOBI, AZW3/KF8) обрабатываются поглавно. Исходное HTML-содержимое каждой главы извлекается и преобразуется в обычный текст, поэтому книга прослушивается с правильной структурой и темпом.

Учтите, что AZW3 и KF8 обозначают один и тот же формат (Amazon Kindle Format 8), поэтому обрабатываются одинаково.

Документы Office

Документы Office (DOCX, PPTX, ODT, ODP, RTF) разбираются в обычный текст. В этих форматах, в отличие от PDF, нет встроенного разбиения на страницы, поэтому извлечённый текст группируется в логические сегменты по 20 строк для плавного воспроизведения.

Парсер Office подгружается по мере необходимости и никак не влияет на работу сайта, пока вы не загрузите файл Office.

Обычный текст и Markdown

Текстовые файлы и документы Markdown обрабатываются проще всего. Они читаются построчно, пустые строки и лишние пробелы удаляются, после чего текст группируется в логические сегменты для воспроизведения.

Конвейер обработки

Независимо от входного формата все файлы проходят один и тот же конвейер:

  1. Определение формата — по расширению файла
  2. Извлечение текста — с помощью логики парсинга для конкретного формата
  3. Генерация хеша — вычисляется SHA-256 для дедупликации и кеширования
  4. Локальное хранение — извлечённый текст и метаданные сохраняются локально в браузере

Вся обработка текста происходит локально на вашем устройстве, поэтому ваши документы остаются в полной приватности и безопасности.

Теги
pdfttsформатыгайдфайлы