画像やスクリーンショットからテキストを抽出する方法
スクリーンショットからテキストをコピーしたり、文書をスキャンしたり、印刷されたページをデジタル化したりする必要がありますか? OCR テクノロジーにより、それが瞬時に行われます。Presend を使用すると、ブラウザ内ですべてが行われます。
OCRとは何ですか?
OCR (光学文字認識) は、テキストの画像を機械可読テキストに変換するテクノロジーです。これにより、次のことが可能になります。
- 選択をブロックする Web サイトのスクリーンショットからテキストをコピーする
- スキャンした PDF を検索する
- 印刷した文書を再入力せずにデジタル化
- 領収書、フォーム、または看板の写真からデータを抽出する
- 画像内のテキストを最初に抽出して翻訳します
クラウド OCR のプライバシー リスク
ほとんどの OCR サービス (Google Vision、Azure Computer Vision、Amazon Textract) では、画像をクラウドにアップロードする必要があります。これは次の場合に問題になります。
- 医療記録— HIPAA/GDPR によって保護される患者データ
- 法的文書— 弁護士と依頼者の特権、NDA
- 財務諸表— 銀行口座情報、税務書類
- 機密情報— 内部メモ、ソースコードのスクリーンショット
- 私信— プライベートメッセージ、電子メール
ファイルをすぐに削除すると主張するサービスであっても、依然としてインフラストラクチャ上でファイルを処理しており、監査証跡が作成され、漏洩の可能性があります。
Tesseract.js の仕組み
Tesseract.jsは、Google の Tesseract OCR エンジンの純粋な JavaScript ポートであり、WebAssembly にコンパイルされています。完全にブラウザ内で実行されます。
- 言語モデル (traineddata) は言語ごとに 1 回ダウンロードされます (英語の場合は最大 4MB)。
- 画像は CPU または GPU を使用してローカルで処理されます
- 認識されたテキストは Web ページに直接返されます。
- 外部サーバーには何も送信されません
Tesseract は、Google ブックス、Google 翻訳のカメラ機能、および無数のドキュメント スキャン アプリを動かしているエンジンと同じです。サポートします100以上の言語アラビア語、中国語、日本語、デヴァナーガリー文字、キリル文字などの文字が含まれます。
サポートされている入力方法
- ドラッグアンドドロップ— 任意の画像をツールにドロップします
- ファイルピッカー— クリックして画像を参照して選択します
- クリップボードから貼り付け— ページ上の任意の場所で Ctrl+V (または Cmd+V) を押して、スクリーンショットを直接貼り付けます。
精度のヒント
- 解決策が重要— 画像の解像度が高いほど、より良い結果が得られます。 300 DPI はスキャンされたドキュメントに最適です。
- コントラストが鍵— 明るい背景に暗いテキストが最適です。色が反転したり、コントラストが低いと精度が低下します。
- スキューを最小限に抑える— 回転していないまっすぐなテキストが最も認識しやすい
- きれいな画像— 可能な場合は、ノイズ、しわ、影を除去します。
- 正しい言語— ドロップダウンから適切な言語を選択します。混合言語テキストは機能しますが、精度が低下する可能性があります
ユースケース
- 学生— 教科書の写真や講義スライドからテキストをコピーする
- 開発者— スクリーンショットまたはエラーメッセージからコードを抽出する
- ジャーナリスト— 文書の画像からテキストを引用する
- 研究者— 印刷された論文や記事をデジタル化する
- 管理者— スキャンしたフォームを編集可能なテキストに変換します
- 旅行者— 外国語の標識、メニュー、文書を読む
ステップバイステップのガイド
- ツールを開く— に移動スクリーンショットをテキストに変換
- 言語を選択してください— 画像内のテキストの言語を選択します
- アップロードまたは貼り付け— 画像をドラッグするか、クリックして選択するか、Ctrl+V を押してクリップボードから貼り付けます
- 認識されるまで待ちます— 画像サイズによっては処理に数秒かかります
- レビューと編集— 抽出されたテキストにエラーがないか確認します
- コピーまたはダウンロード— .txt ファイルとして保存するか、クリップボードにコピーします
制限事項
- 手書き— Tesseract は印刷されたテキストで最もよく機能します。筆記体や乱雑な手書き文字は精度が低くなります。
- 複雑なレイアウト— 複数列のテキスト、表、フォームは手動で再フォーマットする必要がある場合があります。
- 装飾フォント— 様式化されたテキストや芸術的なテキストは認識されない場合があります。
- 非常に小さなテキスト— 10px未満のテキストは欠落する可能性があります。