
dots.ocr: 多言語文書レイアウト解析のための統一された視覚言語モデル
dots.ocr 是一个强大的多语言文档解析工具,基于 1.7B 参数的视觉-语言模型(VLM),能够同时进行布局检测和内容识别。它在 OmniDocBench 等基准测试中展现了最先进的性能,特别是在文本、表格和阅读顺序解析方面表现出色。...

SnippAI:AIを使ってスクリーンショットの内容を認識・分析するツール
Snippai 是一个基于人工智能的截图工具,旨在通过先进的AI算法提升截图体验。它不仅能捕捉屏幕内容,还能对截图中的公式、文本、表格、图像等进行智能分析和转换。用户可以通过Snippai将复杂的视觉信息转化为可编辑的格式,如LaTeX公式...

AI Fast Station:ワンクリックでOCRモデルを比較できる文書解析ツール
AI快站是一个免费的开源OCR模型竞技场,专注于文档和图片的智能解析。用户可以上传PDF或图片文件,通过一键对比七大主流OCR模型,快速找到适合的解析方案。网站支持多种格式文件,操作简单,无需复杂安装。AI快站提供高精度识别、快速处理和安全...

OCRmyPDF: スキャンしたPDFをオープンソースツールの検索可能なテキストへ
OCRmyPDF 是一个开源的命令行工具,专门用于为扫描的PDF文件添加光学字符识别(OCR)文本层,使其变为可搜索、可复制的文档。它基于Python开发,使用Tesseract OCR引擎,能准确识别图像中的文字,并将其嵌入PDF中,保持...

Docstrange: ドキュメントや画像からデータを抽出し、複数のフォーマットに変換するツール。
Docstrangeは、複数のフォーマットの文書や画像からデータを抽出し、Markdown、JSON、CSV、HTMLなどのフォーマットに変換することに重点を置いたオープンソースの文書処理ツールです。人工知能と高度なOCR技術を使用し、PDF、Word文書、Exce...

Guava Intelligent Document Recognition: オフライン文書・フォームのインテリジェント認識ツール
Guavaインテリジェント文書認識(intelligent_document_recognition)は、開発者のjiangnanboyによって開発されたオープンソースのデスクトップソフトウェアで、GitHubでホストされています。このソフトウェアは、光学式文字認識(OCR)とフォームジャンクションを統合しています...

OCRFlux: PDFや画像をMarkdownに変換する軽量ツール
OCRFluxは、PDFファイルや画像をクリアなMarkdownフォーマットに変換することに特化した、オープンソースの軽量ツールです。ChatDOCチームによって開発され、3Bのパラメータを持つ大規模なマルチモーダルモデル上に構築され、GTX 3090のような一般的なハードウェア上で実行することができます。このツールは、複雑なドキュメント・レイアウトの扱いに優れています。

VOP: 複雑な図や数式を抽出するOCRツール
Versatile OCR Program 是一个开源的光学字符识别(OCR)工具,专门为处理复杂的学术和教育文档设计。它能从PDF、图像等文件中提取文本、表格、数学公式、图表和示意图,并生成适合机器学习训练的结构化数据。支持多语言,包括英...

PDFコンテンツを自動的に解析し、オープンソースサービスのテキストとテーブルを抽出します。
它能自动分析PDF文档的布局,识别页面中的文字、标题、图片、表格、公式等元素,并判断它们的正确顺序。工具支持OCR功能,可以把扫描PDF转为可搜索文本。它基于Docker运行,提供两种模型:视觉模型(Vision Grid Transfor...

ボブ
BobはmacOSプラットフォーム用に設計された翻訳・OCR(光学式文字認識)ソフトウェアです。Bobは、Volcano、Tencent、Ali、Baidu、Youdao、Apple、Google、Microsoft、...など、さまざまな翻訳サービスに対応しており、あらゆるアプリケーションで翻訳とOCR操作を行うことができます。

Ollama OCR: Ollamaの視覚モデルを使った画像からのテキスト抽出
Ollama OCR是一个强大的光学字符识别(OCR)工具包,它利用Ollama平台提供的最先进视觉语言模型来从图像中提取文本。该项目既可作为Python包使用,也提供了用户友好的Streamlit网页应用程序界面。它支持多种视觉模型,包括...

ドック2X
Doc2X 是一款功能强大的文档图片公式识别与转换工具,致力于提供高效智能的文档处理解决方案。无论是学术科研论文、教辅书籍、企业文档还是财报研报,Doc2X 都能精准识别 PDF 中的表格和公式,并一键转换为 Word、LaTeX、HTML...

STranslate
STranslate 是一个由 WPF 开发的即用即走的翻译和 OCR 工具。该工具旨在提供高效、便捷的翻译和光学字符识别(OCR)功能,适用于各种语言和文本类型。STranslate 是开源项目,用户可以自由下载和使用,同时也接受定制开发...

Llama OCR: 3行のコードで画像をMarkdownに変換するOCRライブラリ。
Llama OCRは、Llama 3.2 VisionをベースにしたOCR(光学式文字認識)ライブラリで、文書をMarkdown形式に変換します。このライブラリーはNutlopeによって開発され、Together AIがグラフ用に提供する無料のLlama 3.2インターフェースを使用しています。

イージーディクト
Easydict 是一个专为 macOS 用户设计的简洁优雅的词典翻译应用。它支持多种翻译服务和离线 OCR 识别,能够轻松优雅地查找单词或翻译文本。Easydict 开箱即用,支持输入翻译、划词翻译和截图翻译,提供便捷的多语言翻译体验。 ...

Datalab:専用のOCR認識AIモデル、PDF to Markdown(オープンソース/API)
Datalabは、OCR、レイアウト分析、PDFからMarkdownへの変換などに焦点を当てた高度なAIモデルを幅広く提供しています。これらのモデルは高性能であるだけでなく、使いやすくオープンソースです。プラットフォーム上のMarkerモデルは、表や数式を含むPDFを素早く正確にMarkdownに変換することができます。

TTime
TTime 是由 InkTimeRecord 发布在 GitHub 上的项目,是一款简洁高效的翻译软件。它主要提供输入、截图、划词及悬浮球翻译等功能,支持多种翻译源和文字识别服务,让用户能够快速进行语言转换和文字识别。此外,TTime 也具...
トップに戻る