در تاریخ هوش مصنوعی، کمتر دستاوردی به اندازه ایمیجنت (ImageNet) تأثیری عمیق داشته است. این مجموعهداده عظیم شامل بیش از 14 میلیون عکس برچسبگذاریشده است و به شالوده اصلی شکلگیری بینایی ماشین مدرن تبدیل شده است. پشت این پروژه بزرگ، فیفی لی (Fei-Fei Li) قرار دارد؛ دانشمند علوم کامپیوتر که باوری خلاف جریان رایج در آن زمان داشت. او معتقد بود دادهها، نه الگوریتمها، کلید اصلی گشودن قفل ادراک ماشینی هستند. همین بینش، انقلاب یادگیری عمیق را در دهه 2010 شعلهور کرد.
از چنگدو تا پرینستون؛ مسیر پرفراز و نشیب یک آیندهنگر
فیفی لی در سال 1976 در پکن چین متولد شد و در چنگدو بزرگ شد. زمانی که 12 سال داشت، پدرش به ایالت نیوجرسی مهاجرت کرد و چند سال بعد، لی نیز به همراه مادرش به ایالات متحده پیوست. سالهای نخست زندگی او در آمریکا با تلاش فراوان در کنار تحصیل همراه بود. او هنگام تحصیل در دبیرستان، آخر هفتهها در خشکشویی خانوادگیشان کار میکرد و پس از فارغالتحصیلی در سال 1995، تحصیلات کارشناسی خود را در رشته فیزیک در دانشگاه پرینستون ادامه داد.
حتی در دوران تحصیل در پرینستون نیز لی بیشتر آخر هفتهها به خانه بازمیگشت تا به اداره خشکشویی خانواده کمک کند و برای تأمین هزینهها، مشاغلی مانند ظرفشویی را نیز انجام دهد. پس از دریافت مدرک کارشناسی در سال 1999، به مؤسسه فناوری کالیفرنیا (Caltech) رفت و مدرک کارشناسی ارشد و دکترای مهندسی برق خود را در سالهای 2001 و 2005 دریافت کرد. رساله دکتری او با عنوان «بازشناسی بصری: مدلهای محاسباتی و روانفیزیک انسانی»، نشاندهنده شیفتگی اولیه او به نحوه درک جهان بصری توسط ماشینها و انسانها بود.
پژوهشهای تشنه داده در دنیای هوش مصنوعی
پس از یک دوره کوتاه تدریس در دانشگاه ایلینوی، لی در سال 2007 بهعنوان استادیار به گروه علوم کامپیوتر دانشگاه پرینستون پیوست. در همان دوره بود که یکی از تأثیرگذارترین ایدههای تاریخ هوش مصنوعی شکل گرفت.
در آن زمان، پژوهشهای بینایی ماشین مرتباً با موانع یکسانی روبهرو میشدند. مجموعهدادههای آموزشی بسیار کوچک بودند و در بهترین حالت تنها چند هزار تصویر داشتند؛ در نتیجه مدلها با دادههایی بسیار اندک آموزش میدیدند. باور غالب آن دوره نیز بر این مسئله استوار بود که الگوریتمها از خود دادهها بسیار مهمترند. اما فیفی لی دقیقاً به عکس این موضوع باور داشت؛ او معتقد بود حجم عظیمی از دادههای دنیای واقعی میتواند دقت الگوریتمها را به شکل چشمگیری افزایش دهد. این بینش در عین سادگی انقلابی بود: ساختن مجموعهدادهای که از نظر مقیاس و تنوع با خود جهان بصری برابری کند.
«تغییر پارادایمی در تفکر ایمیجنت این است که در حالی که افراد زیادی به مدلها توجه میکنند، بیایید ما به دادهها توجه کنیم. دادهها شیوه فکر کردن ما درباره مدلها را از نو تعریف خواهند کرد.»
الهام از زبانشناسی؛ الگوی وردنت (WordNet)
چارچوب فکری ایمیجنت از یک منبع کاملاً غیرمنتظره، یعنی زبانشناسی، الهام گرفت. در سال 1985، جورج ای. میلر و تیمش در دانشگاه پرینستون کار روی پروژهای به نام وردنت را آغاز کردند. وردنت پایگاه دادهای واژگانی برای زبان انگلیسی بود که چیزی میان فرهنگ لغت و اصطلاحنامه عمل میکرد و مفاهیم را در یک درخت سلسلهمراتبی سازماندهی میکرد (مثلاً از مفهوم کلی «حیوان» تا نژاد خاصی از سگها).
تا سال 2006، وردنت به بلوغ کامل رسیده بود. هنگامی که لی با کریستیانه فلباوم، از پژوهشگران ارشد این پروژه ملاقات کرد، تصمیم گرفت از پایگاه واژگان و ساختار درختی وردنت بهعنوان چارچوب دستهبندی پایگاه داده تصویری خود استفاده کند. هدف او روشن بود: پوشش دادن تمام گستره مفاهیم بصری که انسانها قادر به نامگذاری آنها هستند.
تأثیرات بنیادین بر فناوریهای نوین
توسعه ایمیجنت به سرعت مسیر پیشرفت فناوری را تغییر داد. این مجموعهداده عظیم نقطه عطفی برای رقابتهای بزرگی نظیر چالش بینایی ماشین (ILSVRC) شد و به محیطی ایدهآل برای آموزش شبکههای عصبی پیچشی (CNN) تبدیل گردید. امروزه، نوآوریهای این حوزه زیربنای بسیاری از سیستمهای حیاتی در دنیای مدرن، از سیستمهای تشخیص چهره و تصویربرداری پزشکی تا نرمافزارهای پیشرفته پردازش تصویر در خودروهای خودران محسوب میشوند.
تأکید فیفی لی بر اهمیت کیفیت و کمیت دادهها، امروز نیز یکی از اصول نانوشته اما قطعی در مهندسی داده به شمار میرود و نشان میدهد که چگونه یک تغییر رویکرد ساده میتواند صنعت فناوری را برای دهههای پیش رو بازتعریف کند.





