往下拉回到首頁
有人終於做了一個「讀懂圖片裡文字位置」的 AI 訓練資料集

有人終於做了一個「讀懂圖片裡文字位置」的 AI 訓練資料集

SGOCR: A Spatially-Grounded OCR-focused Pipeline & V1 Dataset [P]

欸你知道嗎,現在大多數的 AI 模型在看圖片時,都被訓練成要去「理解」文字的意思或整個場景在講什麼,但其實沒有人教它們最基本的技能——就是「這個字在圖片的哪個位置」。一個開發者發現這個問題後,花了兩週時間自己做了 SGOCR,簡單來說就是一個開放資料集工具,可以自動產生大量「圖片 + 文字位置 + 問答」的訓練資料。這樣 AI 模型就能學會在圖片裡精準定位文字,而且還附帶一堆額外資訊讓訓練更有效。說真的,這種基礎但被忽視的功能,對很多實務應用來說超重要的。