پروژه FineBooks، همکاری Hugging Face و EleutherAI، با اجرای 14 مدل OCR متن‌باز روی 2,165 صفحه از کتاب‌های تاریخی نشان داد متن‌های استخراج‌شده قدیمی تا چه اندازه کیفیت آموزش مدل‌های زبانی را کاهش می‌دهند و چگونه مدل‌های جدید می‌توانند این افت را جبران کنند.

نتایج کلیدی و اهمیت پروژه

FineBooks به بررسی مشکلی پرداخت که از زمان دیجیتال‌سازی کتاب‌ها وجود دارد: خروجی OCRهای قدیمی پرخطا هستند و استفاده از آن‌ها در مجموعه‌داده‌های آموزشی موجب افت عملکرد مدل‌های زبانی می‌شود. تحلیل‌های پیشین مانند پروژه Common Pile نشان داده‌اند مدلی که با متن‌های OCR قدیمی آموزش می‌بیند به‌طور قابل‌توجهی ضعیف‌تر از مدلی است که با رونویسی‌های انسانی آموزش شده است.

مشخصات ارزیابی

  • مجموعه آزمون: 2,165 صفحه از کتاب‌های تاریخی متعلق به Biodiversity Heritage Library (BHL).
  • مدل‌ها: 14 مدل OCR متن‌باز که روی سخت‌افزار محلی اجرا شده‌اند؛ بدون نیاز به کلید API.
  • معیار سنجش: نرخ خطای کاراکتری (Character Error Rate یا CER) در دو حالت «دیپلماتیک» و «خوانشی».
  • مرجع حقیقت: رونویسی‌های پروژه‌های IMPACT و BHL-Europe با نرخ خطای تقریباً 1 کاراکتر در هر 2,000 کاراکتر به‌عنوان خروجی دقیق مورد استفاده قرار گرفتند.

مدل‌های کوچک در موارد تاریخی عملکرد بهتری نشان دادند

یافته برجسته این است که اندازهٔ مدل همیشه شاخص دقت OCR روی اسناد تاریخی نیست. برای نمونه، مدل dots.mocr با 3 میلیارد پارامتر به دقت کاراکتری 97.6% رسید، در حالی که برخی مدل‌های بزرگ‌تر دقت کمتری داشتند. خلاصهٔ عملکرد چند مدل به صورت زیر است:

  • dots.mocr — سایز: 3B — دقت: 97.6% — هزینه: $1.94/1,000 صفحه
  • OvisOCR2 — سایز: 0.9B — دقت: 96.9% — هزینه: $0.46/1,000 صفحه
  • PaddleOCR-VL-1.6 — سایز: 1B — دقت: 96.1% — هزینه: $0.34/1,000 صفحه
  • olmOCR-2 — سایز: 8.3B — دقت: 95.7% — هزینه: $0.45/1,000 صفحه

این نتایج نشان می‌دهند پردازش مجدد میلیون‌ها صفحه حوزهٔ عمومی با انتخاب مدل مناسب هم فنیِ ممکن و هم اقتصادی است.

نمونه خروجی OCR مدل‌ها و نمودار مقایسه دقت

محدودیت‌ها و چالش‌های عملی

ارزیابی فعلی محدود به فونت‌های Antiqua و چهار زبان لاتین بوده و حوزه‌هایی مانند Fraktur، اسناد غیرلاتین و نوشتارهای دست‌نویس را در بر نمی‌گیرد. علاوه بر این، آزمایش‌ها صرفاً روی صفحات تک‌ستونی انجام شده‌اند.

مشکل ادغام با جریان‌های کاری کتابخانه‌ای

بسیاری از زیرساخت‌های کتابخانه‌ای بر قالب ALTO XML تکیه دارند که موقعیت کلمات و ساختار صفحه را حفظ می‌کند؛ در مقابل خروجی برخی مدل‌های جدید متن ساده یا Markdown است و اطلاعات موقعیت را ارائه نمی‌دهد. بنابراین حتی در صورت دستیابی به دقت کاراکتری مناسب، نیاز به تبدیل و نگاشت متادیتا برای ادغام در جریان‌های کاری کتابخانه‌ای وجود دارد.

کفایت متن‌ها برای پژوهش

برای اهداف آموزش مدل‌های زبانی، نتایج امیدوارکننده است: خطاهای مدل‌های جدید به‌طور محسوسی کمتر از OCRهای قدیمی‌اند و هزینهٔ بازپردازش مجموعه‌هایی مانند BHL منطقی به‌نظر می‌رسد. با این حال برای رونویسی‌های پژوهشی دقیق هنوز محدودیت‌هایی هست؛ از جمله اصلاحات پنهانی کاراکتری (مانند جایگزینی ſ با s یا تغییر لیگاتورها) که می‌تواند بازنمایی‌های تاریخی متن را تغییر دهد.

گام بعدی پروژه

تیم FineBooks قصد دارد حدود 200,000 سند حوزهٔ عمومی از مجموعه BHL را با یکی از مدل‌های برتر بازپردازش کند و خروجی را به‌صورت مجموعه‌دادهٔ باز منتشر نماید. همچنین چارچوب ارزیابی و فهرست رتبه‌بندی مدل‌ها به‌صورت پیوسته به‌روزرسانی خواهد شد تا مدل‌های جدید افزوده و دامنهٔ ارزیابی گسترده‌تر شود.

جمع‌بندی برای توسعه‌دهندگان و کتابخانه‌ها

بازپردازش متون OCR قدیمی راهی سریع و مقرون‌به‌صرفه برای بهبود کیفیت مجموعه‌داده‌های متنی است. انتخاب مدل مناسب می‌تواند هم هزینه‌ها را کاهش دهد و هم دقت را افزایش دهد، ولی برای استفادهٔ آکادمیک و ادغام در زیرساخت‌های کتابخانه‌ای لازم است فرایندهای تبدیل، نگهداری موقعیت و حفظ ویژگی‌های تاریخی متن توسعه یابند.

منابع مرتبط