سه داوطلب پاکستانی پس از یک دهه و با مجموعاً 902,000 بار فشردن شاتر و ثبت بیش از 526,000 عکس دوصفحه‌ای، مجموعه «کتابخانه دیجیتال ابتداء» را ساختند تا 1,800 عنوان نادر اردو را دیجیتال کنند. این تجربه عملی نمونه‌ای قابل‌استفاده برای توسعه آرشیو دیجیتال اردو در سطح محلی و داوطلبی است.

چالش‌هایی که پشت هر صفحه پنهان بود

تیم بدون بودجه رسمی و با خرید کتاب‌ها از جیب خود، کار را با یک Nikon D5300، چراغ‌های LED و یک ورق شیشه از دستگاه فتوکپی آغاز کرد. ثبت تصاویر نسبتاً سریع انجام می‌شد، اما پس‌پردازش زمان‌بر و دقیق بود: تثبیت حاشیه‌ها، اصلاح پرسپکتیو، هم‌راستا کردن متن و یکسان نگه داشتن اندازه قلم در سراسر یک عنوان از ضروریات یک نسخه دیجیتال آرشیوی بود.

نمونه صفحات لیتوگرافی اُردو در پروژه ابتداء

مجموعه شامل چاپ‌های متداول، لیتوگرافی‌های چندصدساله و یادداشت‌های دست‌نویس بود. خط اردو، به‌ویژه نمونه‌های نستعلیق، مملو از نقاط، اعراب و نشانه‌های ظریف است که جداسازی نویز عکس از حروف واقعی را دشوار می‌سازد. این تنوع موجب شد هر کتاب عملاً یک «حالت ویژه» داشته باشد و روش‌های استاندارد بینایی‌ماشین به‌تنهایی کافی نباشند.

از OpenCV تا ایده مبتکرانه استفاده از برچسب‌های دستی

پس از ناکامی روش‌های کلاسیک، یکی از اعضای تیم به اتوماسیون با OpenCV پرداخت. ایده کلیدی این بود که صفحات ویرایش‌شده در فتوشاپ به‌عنوان برچسب (label) عمل کنند: محاسبه هموگرافی بین تصویر خام و نسخه ویرایش‌شده، داده‌ای هدفمند برای آموزش یک شبکه عصبی فراهم کرد.

مشکلات فنی کلیدی

  • تطبیق مرز برش: حروف فشرده و الگوهای ستون در اردو باعث می‌شد مرز برش با علائم صفحات مجاور اشتباه گرفته شود.
  • شناسایی ناحیه قابل‌مشاهده و جداسازی «گاتر» (gutter): جدول‌ها و سایه‌های عمیق در وسط صفحات تشخیص را پیچیده می‌کرد.
  • پاک‌سازی لکه‌ها و حاشیه‌نویسی‌ها: یادداشت‌های دستی و لکه‌ها باید از متن اصلی تفکیک می‌شدند بدون آن‌که اطلاعات متنی آسیب ببیند.
جلسه کار با دوربین و شیشه فتوکپی برای فشار دادن صفحات

رویکرد یادگیری ماشینی با برچسب‌های واقعی

تجربه تیم نشان داد افزایش صرف مدل‌ها یا افزودن داده‌های پراکنده همیشه به ارتقای دقت منجر نمی‌شود؛ نبود الگوی ثابت بین کتاب‌ها گاهی کیفیت را کاهش می‌داد. برای هر عنوان جدید تقریباً به ۱۰ برش کالیبراسیون دستی نیاز بود تا مدل عملکرد قابل‌قبولی ارائه دهد؛ سطح کاری که در برابر دیجیتال‌سازی کامل یک کتاب منطقی است.

نمونه‌ی فایل‌های پردازش‌شده در فتوشاپ که به‌عنوان برچسب استفاده شدند

ذخیره‌سازی، قابلیت ردیابی و یکپارچگی داده‌ها

فایل‌های نهایی در یک استخر ZFS نگهداری شد و از هش‌های BLAKE3 برای مانفیست‌ها استفاده گردید تا تمامی تصاویر و ویرایش‌ها قابل ردیابی و بررسی باشند. این رویکرد تضمین می‌کند هر اثر دیجیتال با بهره از نشانگرهای معتبر ذخیره شود و تغییرات شفاف ثبت گردد.

دردسرها و درس‌های کاربردی برای پروژه‌های محلی

پروژه ابتداء نشان داد با هزینه کم و تجهیزات ساده می‌توان بخش مهمی از میراث فرهنگی را نجات داد، اما اتکا به نیروی انسانی در مقیاس بزرگ غیرعملی است. ترکیب ویرایش دستی به‌عنوان برچسب و یادگیری ماشینی، مسیر مؤثری برای تسریع فرایندهای پس‌پردازش فراهم می‌کند.

صفحات خطی و لیتوگرافی که نیاز به بازبینی دستی دارند

نکات اجرایی برای تیم‌های داوطلبی

  • پیش از خودکارسازی کامل، چندین نمونه ویرایش‌شده دستی برای هر عنوان تولید کنید تا برچسب‌های دقیق در اختیار مدل قرار گیرد.
  • یک روند کالیبراسیون استاندارد برای برش صفحات و اصلاح پرسپکتیو تدوین کنید تا تنوع بین عناوین قابل کنترل شود.
  • از سیستم‌های فایل مقاوم (مانند ZFS) و هش‌های قابل‌ردیابی استفاده کنید تا یکپارچگی داده‌ها حفظ شود.
  • اسناد و نمونه‌های آموزشی را در مخازن عمومی منتشر کنید تا روش‌ها توسط دیگر گروه‌ها قابل بازتولید و بهبود باشد.

دسترسی عمومی و ادامه‌پذیری

نسخه‌های دیجیتال و اطلاعات پروژه در آرشیو گروه در Internet Archive منتشر شده‌اند تا پژوهشگران و علاقه‌مندان بتوانند نمونه‌ها را بررسی و روش‌ها را دنبال کنند. تیم ابتداء امید دارد ایده محاسبه هموگرافی از ویرایش‌های فتوشاپ و آموزش شبکه عصبی به‌عنوان الگوی عملی توسط دیگر آرشیویست‌های داوطلب به‌کار گرفته و تکامل یابد.

منابع مرتبط

برای مطالعه بیشتر درباره مفاهیم فنی به صفحات OpenCV، مستندات ZFS و توضیحات BLAKE3 مراجعه کنید. معرفی خط اردو در ویکی‌پدیا نیز می‌تواند درک بهتری از ویژگی‌های متنی این مجموعه فراهم کند.

تجربه این پروژه نشان می‌دهد حفاظت از میراث فرهنگی دیجیتال با خلاقیت، صبر و تلفیق روش‌های دستی و خودکار قابل دستیابی است.