下に引いて戻る
SGOCR:空間的に接地されたOCR中心のパイプライン&V1データセット [P]

SGOCR:空間的に接地されたOCR中心のパイプライン&V1データセット [P]

SGOCR: A Spatially-Grounded OCR-focused Pipeline & V1 Dataset [P]

皆さんこんにちは!小型だけど強力なビジョン言語モデル(VLM)を独立して研究開発していて、あるギャップに気づきました。既存のビジュアルデータセットは、モデルにテキストの内容や場面の推論を理解させようとしていますが、画像内のテキストの位置を単純に特定することを教えるものがないんです。そこで2週間かけてSGOCRを開発しました。これは、空間的に接地されたOCR中心のVQAタプルを生成するオープンソースのデータセットパイプラインで、様々なVLMトレーニングをサポートする豊富なメタデータが含まれています。