Как извлечь текст из изображений и снимков экрана
Нужно скопировать текст со скриншота, отсканировать документ или оцифровать распечатанную страницу? Технология OCR делает это мгновенным, а с Presend это происходит полностью в вашем браузере.
Что такое ОКР?
OCR (оптическое распознавание символов) — это технология, которая преобразует изображения текста в машиночитаемый текст. Это то, что позволяет вам:
- Скопируйте текст со скриншота веб-сайта, который блокирует выбор
- Поиск по отсканированным PDF-файлам
- Оцифруйте печатные документы без перепечатки
- Извлечение данных из фотографий квитанций, форм или вывесок
- Переведите текст в изображениях, предварительно извлекая его
Риск конфиденциальности облачного OCR
Большинство сервисов OCR — Google Vision, Azure Computer Vision, Amazon Textract — требуют загрузки вашего изображения в их облако. Это проблематично для:
- Медицинские записи— Данные пациентов защищены HIPAA/GDPR.
- Юридические документы— Адвокатская тайна, NDA
- Финансовая отчетность— Банковские реквизиты, налоговые документы
- Конфиденциальная информация— Внутренние заметки, скриншоты исходного кода.
- Личная переписка— Личные сообщения, электронная почта
Даже службы, которые заявляют о немедленном удалении файлов, по-прежнему обрабатывают их в своей инфраструктуре, создавая контрольные журналы и потенциально подвергая риску.
Как работает Tesseract.js
Тессеракт.js— это чистый порт JavaScript механизма распознавания текста Tesseract от Google, скомпилированный в WebAssembly. Он полностью работает в вашем браузере:
- Языковая модель (обученные данные) загружается один раз для каждого языка (~4 МБ для английского языка).
- Изображение обрабатывается локально с использованием вашего процессора или графического процессора.
- Распознанный текст возвращается непосредственно на веб-страницу.
- Ничего не передается на внешний сервер
Tesseract — это тот же движок, который поддерживает Google Книги, функцию камеры Google Translate и бесчисленное множество приложений для сканирования документов. Он поддерживает100+ языковвключая такие сценарии, как арабский, китайский, японский, деванагари и кириллица.
Поддерживаемые методы ввода
- Перетащите— Перетащите любое изображение в инструмент
- Выбор файла— Нажмите, чтобы просмотреть и выбрать изображение.
- Вставить из буфера обмена— Нажмите Ctrl+V (или Cmd+V) в любом месте страницы, чтобы вставить снимок экрана напрямую.
Советы по точности
- Разрешение имеет значение— Изображения с более высоким разрешением дают лучшие результаты. Разрешение 300 DPI идеально подходит для отсканированных документов.
- Контраст – это ключ к успеху— Лучше всего смотрится темный текст на светлом фоне. Инвертированные цвета или низкий контраст снижают точность.
- Минимизировать перекос— Прямой, не повернутый текст легче распознать.
- Чистые изображения— Удалите шум, складки и тени, если это возможно.
- Правильный язык— Выберите нужный язык из раскрывающегося списка. Текст на разных языках работает, но может иметь меньшую точность.
Варианты использования
- Студенты— Копирование текста с фотографий учебника или слайдов лекций.
- Разработчики— Извлечение кода из снимков экрана или сообщений об ошибках
- Журналисты— Цитировать текст из изображений документов
- Исследователи— Оцифровка печатных статей и статей.
- Администраторы— Преобразование отсканированных форм в редактируемый текст
- Путешественники— Читать вывески, меню и документы на иностранных языках
Пошаговое руководство
- Откройте инструмент— Иди вСкриншот в текст
- Выберите язык— Выберите язык текста на вашем изображении
- Загрузите или вставьте— Перетащите изображение, щелкните, чтобы выбрать, или нажмите Ctrl+V, чтобы вставить его из буфера обмена.
- Ждите признания— Обработка занимает несколько секунд в зависимости от размера изображения
- Просмотр и редактирование— Проверьте извлеченный текст на наличие ошибок.
- Скопируйте или скачайте— Сохранить как файл .txt или скопировать в буфер обмена.
Ограничения
- Почерк— Тессеракт лучше всего работает с печатным текстом. Рукописный или неряшливый почерк имеет меньшую точность.
- Сложные планировки— Текст, таблицы и формы, состоящие из нескольких столбцов, могут потребовать переформатирования вручную.
- Декоративные шрифты— Стилизованный или художественный текст может быть не распознан.
- Очень маленький текст— Текст размером менее 10 пикселей может быть пропущен.