아래로 당겨서 돌아가기
SGOCR: 공간 기반 OCR 중심 파이프라인 및 V1 데이터셋 [P]

SGOCR: 공간 기반 OCR 중심 파이프라인 및 V1 데이터셋 [P]

SGOCR: A Spatially-Grounded OCR-focused Pipeline & V1 Dataset [P]

안녕하세요! 저는 소형이지만 강력한 비전 언어 모델(VLM)을 독립적으로 연구 개발하고 있었는데, 기존 시각 데이터셋에 큰 문제가 있다는 걸 발견했습니다. 모두 모델에게 텍스트 내용이나 장면 추론을 이해하도록 가르치고 있지만, 이미지 속 텍스트의 위치를 단순히 찾도록 가르치는 데이터셋이 없었거든요. 그래서 2주간 SGOCR을 개발했습니다. 이것은 공간적으로 기반된 OCR 중심의 VQA 튜플을 생성하는 오픈소스 데이터셋 파이프라인으로, 다양한 VLM 훈련을 지원하는 풍부한 메타데이터가 포함되어 있습니다.