Распознать текст с фото и PDF: ИИ-нейросеть для OCR онлайн

Распознать текст с фото и PDF — ИИ-инструмент нейросети Аливия, который переводит фото, скан или PDF в редактируемый текст. Сохраняет абзацы, нумерованные списки и таблицы для Excel, в рукописи помечает слова, в которых не уверен, и по запросу переводит результат. Загрузите снимок или скан страницы, укажите язык оригинала и нужный формат результата.

Работает онлайнРусский и другие языкиТест бесплатно, без регистрацииБез VPNДоступ 24/7Голосовой ввод и файлы

АливияИИ-ассистент20 000 символов бесплатно20 000 символов доступны сразу — без карты и без регистрации.
Зарегистрируйтесь и подтвердите почту — начислим ещё 30 000 символов на 30 дней.Зарегистрироваться
Онлайн
Примеры запросов — нажмите, и текст подставится в чат:

Бизнес · ИИ-инструмент нейросети Аливия

Конструктор распознавания текста

Выберите, что сделать с текстом с фото или PDF, — бот распознает его и сохранит таблицы и списки.

Что сделать
Исходник
Ещё настройкисомнительные места, разбивка строк, формат таблицы, оригинал рядом
Сомнительные места
Разбивка строк
Оригинал рядом
Ваш запрос

Запрос подставится в поле чата — его можно поправить перед отправкой.

Что такое распознавание текста нейросетью

Распознавание текста с фото и PDF — это перевод изображения страницы в редактируемый текст, который можно скопировать, исправить и вставить в Word или Excel. Такую задачу называют OCR. Аливия делает её нейросетью: модель смотрит на картинку целиком и восстанавливает не только буквы, но и структуру — абзацы, списки, строки и столбцы таблиц.

Классические OCR-программы разбивают страницу на строки и символы и сравнивают их с образцами. Нейросеть читает контекст, поэтому лучше справляется с фотографиями под углом, смешанными шрифтами и рукописью. Обратная сторона — она может «додумать» неразборчивое слово по смыслу. Поэтому в рукописи инструмент помечает слова, в которых не уверен, а не подставляет их молча.

Что можно прислать: фото с телефона, скриншот, скан в PNG или JPEG, документ PDF. На выходе — чистый текст, таблица для Excel или текст с переводом на нужный язык. Чат работает без регистрации, понимает русский и другие языки, доступен круглосуточно и без VPN из России.

Как превратить фото или скан в текст: шаги

  1. Сфотографируйте или отсканируйте страницу. Держите телефон параллельно листу, без бликов и тени от руки. Один лист — один снимок.
  2. Загрузите файл в чат. Подойдут PNG, JPEG и PDF. Если страниц несколько, присылайте их по порядку и нумеруйте в сообщении.
  3. Укажите язык и формат результата. Конструктор запроса под чатом спросит язык оригинала, нужен ли перевод и в каком виде отдать результат: сплошной текст, сохранение разметки или таблица.
  4. Попросите дословную передачу. Особенно для документов с цифрами: «перепиши дословно, ничего не исправляй, неразборчивое отметь».
  5. Проверьте помеченные места. Сомнительные слова выделены, рядом — варианты прочтения. Исправьте их по оригиналу.
  6. Заберите результат. Текст скопируйте в редактор, таблицу — в Excel или Google Таблицы. Если нужен перевод, попросите его в том же диалоге.

Готовая формулировка запроса: «Распознай текст на фото дословно, сохрани абзацы и нумерацию пунктов. Таблицу на второй половине страницы выведи отдельно, столбцы раздели табуляцией. Слова, в которых не уверен, отметь квадратными скобками и предложи вариант».

Нейросеть, OCR-программа или ручной набор: что выбрать

У каждого способа своя сильная сторона. Нейросеть удобна, когда страница «живая»: фото с телефона, рукопись, таблица с объединёнными ячейками, текст на иностранном языке. Классический OCR предсказуем на чистых сканах больших объёмов. Ручной набор остаётся запасным вариантом для коротких и очень неразборчивых записей.

КритерийНейросеть АливииКлассическая OCR-программаНабор вручную
Фото под углом, с теньюОбычно читает, качество падает с наклономНужно выровнять и обрезать заранееЗависит только от глаз
ТаблицыСобирает строки и столбцы, отдаёт для ExcelЗависит от программы и чёткости линийДолго, но точно
РукописьЧитает разборчивый почерк, помечает сомнительноеКак правило, слабое местоЛучший вариант для трудного почерка
Риск «исправления» текстаЕсть: может подставить слово по смыслуНет, ошибается посимвольноОпечатки при наборе
Перевод и пересказВ том же диалогеОтдельным сервисомОтдельно
Большие архивы, сотни страницНеудобно: по одной страницеПакетная обработкаНереально

Если документ состоит в основном из таблиц и дальше будет обрабатываться в Excel, после распознавания удобно перейти в генератор таблиц для Excel и Google Docs: он поможет переразложить столбцы, посчитать итоги и выгрузить в нужном формате.

Почему фото распознаётся плохо и как это исправить

Качество результата во многом определяется исходником. Разработчики открытого движка Tesseract пишут, что распознавание лучше всего работает на изображениях с разрешением не ниже 300 dpi, а перекос страницы заметно ухудшает разбивку на строки. Для нейросетей правила похожие: в документации к моделям OpenAI сказано, что модель может неверно прочитать повёрнутый или перевёрнутый текст и точнее работает, когда мелкий текст увеличен.

  • Плохой свет. Тень от телефона, жёлтая лампа и блики на глянцевой бумаге съедают буквы. Снимайте у окна днём или с двумя источниками света.
  • Мелкий шрифт. Сноски, условия договора «мелким шрифтом», чеки. Снимите фрагмент крупнее или разделите страницу на две части.
  • Наклон и изгиб. Страница книги у корешка изогнута, строки «плывут». Прижмите разворот или снимайте каждую страницу отдельно.
  • Сжатие. Фото, пересланное через мессенджер, теряет детали. Загружайте оригинал из галереи.
  • Фон и рамки. Тёмные поля скана могут прочитаться как символы. Обрежьте лишнее перед загрузкой.

Сложный почерк, выцветшие чернила и старые документы с дореформенной орфографией нейросеть читает с ошибками. Она может уверенно выдать правдоподобное, но неверное слово, особенно в фамилиях, названиях и цифрах. Для таких текстов просите отмечать каждое сомнительное место и сверяйте результат с оригиналом построчно.

Рукописный текст: как нейросеть помечает сомнения

Рукопись — главная причина, по которой ИИ-распознавание ценнее обычного OCR. Конспект, записка врача, письмо бабушки, анкета, заполненная от руки: модель учитывает контекст фразы и разбирает многие слова, которые посимвольный движок не прочтёт.

Чтобы контекст не подменил оригинал, инструмент работает в режиме пометок. Слово, в котором нейросеть не уверена, выводится в квадратных скобках с вариантами: «[Корнилов? Корнилова?]». Полностью нечитаемый фрагмент заменяется меткой «[неразборчиво]», а не догадкой. Так вы видите, где именно нужно посмотреть в оригинал.

Если распознанный конспект нужно сократить до главного, продолжите в генераторе конспектов лекций — он соберёт тезисы и определения из готового текста.

Таблицы, счета и списки: что сохраняется

Для бухгалтерии и офиса важнее всего структура. Нейросеть переносит таблицу построчно: шапку, номера строк, объединённые ячейки разворачивает в отдельные значения. Результат можно получить с разделителями табуляцией — при вставке в Excel он сам разложится по столбцам.

  • Счета и акты: наименования, количество, цена, сумма, ИНН и КПП реквизитов.
  • Прайсы и ведомости: многостраничные таблицы с продолжением шапки.
  • Нумерованные списки и пункты договора: нумерация сохраняется как в оригинале, включая подпункты «2.1», «2.1.1».
  • Формы и анкеты: пары «поле — значение», удобные для переноса в базу.

Сверьте итог: попросите нейросеть сложить суммы по столбцу и сравните с итоговой строкой документа. Расхождение сразу покажет строку, где цифра прочитана неверно.

Как распознать текст и сразу перевести

Распознавание и перевод делаются в одном диалоге: сначала текст на языке оригинала, потом перевод. Порядок важен — вы проверяете исходник, а не только готовый перевод, и видите, где ошибка распознавания исказила смысл.

Для латиницы и кириллицы качество обычно высокое. Для языков с иероглифами и нелатинскими алфавитами, как отмечает OpenAI, модель может работать хуже — например, с японским или корейским текстом. Для меню в ресторане есть отдельный переводчик меню по фото, который объясняет блюда и ингредиенты, а для деловых писем и инструкций на английском — профессиональный переводчик с английского.

Как проверить распознанный текст

  1. Цифры — первыми. Суммы, даты, номера счетов, ИНН, телефоны. Одна неверная цифра в реквизитах дороже десятка опечаток в словах.
  2. Имена собственные. Фамилии, названия улиц и организаций нейросеть иногда «нормализует» до знакомого слова.
  3. Помеченные места. Все слова в квадратных скобках — по оригиналу.
  4. Полнота. Сравните первую и последнюю строку каждой страницы, количество пунктов и строк таблицы: не выпало ли что-то при переносе.
  5. Контрольная сумма. В таблицах попросите посчитать итог и сравните с документом.

Для юридически значимых документов распознанный текст — рабочая копия, а не замена оригиналу. Если документ содержит паспортные данные или реквизиты карт, подумайте, нужны ли они в тексте: часто достаточно закрыть их на фото до загрузки.

Распознать текст с фото и PDF: частые вопросы

Как распознать текст с фото бесплатно?
Загрузите фото в чат Аливии и попросите переписать текст — бесплатный доступ работает без регистрации, с дневным лимитом сообщений. Для лучшего результата снимайте страницу ровно, при хорошем свете и без бликов.

Можно ли распознать рукописный текст?
Да, разборчивый почерк нейросеть читает хорошо. Слова, в которых она не уверена, выводятся в квадратных скобках с вариантами, а нечитаемое помечается как [неразборчиво]. Трудный почерк и выцветшие чернила всё равно требуют проверки по оригиналу.

Как перевести PDF в текст?
Загрузите PDF в чат и укажите, что нужно: сплошной текст, сохранение разметки или таблица. Если PDF — это скан без текстового слоя и результат вышел неполным, пришлите страницы картинками PNG или JPEG.

Сохранится ли таблица при распознавании?
Нейросеть переносит строки и столбцы и может отдать таблицу с разделителями табуляцией — при вставке в Excel или Google Таблицы она разложится по ячейкам. Объединённые ячейки разворачиваются в отдельные значения, поэтому сверьте итоговую строку.

Можно ли сразу перевести распознанный текст?
Да, в том же диалоге: сначала текст на языке оригинала, затем перевод. Так вы видите, не исказила ли ошибка распознавания смысл. Лучше всего результат на текстах латиницей и кириллицей.

Почему текст распознаётся с ошибками?
Чаще всего из-за исходника: тень, блики, наклон, мелкий шрифт, сжатие при пересылке через мессенджер. Переснимите страницу ровно и при дневном свете, мелкий фрагмент — крупным планом, и загрузите оригинал из галереи.

Как вытащить текст с картинки или скриншота?
Скриншот загружается как обычное изображение PNG или JPEG. Попросите переписать текст дословно или, например, собрать надписи со слайдов в список тезисов — нейросеть сохранит порядок блоков на экране.

Можно ли загрузить сразу много страниц?
Присылайте страницы по порядку и нумеруйте их в сообщении — так текст соберётся без перепутанных фрагментов. Для архивов из сотен страниц удобнее программы пакетного OCR, а нейросеть — для сложных отдельных страниц.

Правильно ли нейросеть распознаёт цифры?
Обычно да, но цифры — главное, что нужно проверять: суммы, даты, ИНН, номера счетов. Попросите сложить суммы по столбцу и сравнить с итогом в документе — расхождение укажет на ошибку.

Какие форматы файлов поддерживаются?
Чат принимает изображения PNG и JPEG, документы PDF, а также Word, Excel, TXT и CSV. Для распознавания с бумаги подходят фото с телефона, сканы и скриншоты.

Итог

Инструмент «Распознать текст с фото и PDF» превращает снимок, скан или скриншот в редактируемый текст с сохранёнными абзацами, списками и таблицами и по запросу переводит его. В рукописи нейросеть помечает сомнительные слова вместо догадок. Качество зависит от исходника: ровная съёмка при хорошем свете и крупный план мелкого шрифта решают большую часть проблем, а цифры и имена стоит проверить по оригиналу.

Автор и редактор страницы

Аливия Кирсанова

Основатель и руководитель сервиса «Аливия». Настраивает инструменты под задачи, подбирает модели и проверяет ответы по методике сайта.

  • В проекте с 2024 года
  • 350 инструментов настроено
Опубликовано:
Оцените материал