در اواخر اکتبر 2018، تیم تحقیقاتی هوش مصنوعی گوگل مدلی را معرفی کرد که مسیر پردازش زبان طبیعی (NLP) را برای همیشه تغییر داد. مدل BERT که مخفف «بازنماییهای دوسویه رمزگذارها از ترنسفورمرها» (Bidirectional Encoder Representations from Transformers) است، تحت لایسنس متنباز Apache 2.0 منتشر شد و به سرعت به نقطه عطفی در آزمایشهای یادگیری ماشین تبدیل گردید. نوآوری جذاب این مدل در پرهیز از خواندن خطی متن بود؛ BERT جملهها را یکباره میخواند و از هر دو سوی یک واژه، زمینهای کامل را استخراج میکند.
مدل BERT چیست؟
BERT یک مدل زبانی است که با بهرهگیری از یادگیری ماشین خودنظارتی، متن را به دنبالهای از بردارهای ریاضی تبدیل میکند. این معماری صرفاً روی بخش رمزگذار (Encoder) شبکههای ترنسفورمر تمرکز دارد و دقیقاً به همین دلیل برای درک و تحلیل متن بهینه شده است، نه برای تولید محتوای جدید. تاثیر این مدل تا حدی بود که شاخه پژوهشی جدیدی به نام BERTology پدیدار شد تا مکانیزمهای دقیق یادگیری آن را کالبدشکافی کند.
غلتک خوردن از پردازش یکسویه به دوطرفه
پیش از ظهور این معماری، شبکههای عصبی بازگشتی (RNN) متن را بهصورت تکجهته (از چپ به راست یا برعکس) پردازش میکردند. این محدودیت مانع از درک دقیق زمینه و مفهوم کامل کلمات میشد. هرچند معماری ترنسفورمر با استفاده از مکانیزمهای توجه به خود (Self-Attention) توانست ارتباط کلمات را فارغ از جایگاهشان بسنجد، اما هنوز با چالشی بزرگ روبرو بود: اگر مدل همزمان به آینده و گذشته کلمه نگاه میکرد، در واقع پاسخ را میدید و یادگیری بیمعنی میشد.
طراحان BERT با معرفی تکنیک «مدلسازی زبانی نقابگذاری شده» (Masked Language Modeling) این چالش را دور زدند. آنها کلمه هدف را کاملاً پنهان کردند تا مدل مجبور شود برای بازسازی آن، به کلمات پیرامونی تکیه کند. همین ترفند ساده اما هوشمندانه باعث شد BERT در سال 2018 تمام رکوردها را در بنچمارکهای معتبری نظیر GLUE و SQuAD بشکند.
دیاfrافiciente معماری BERT و چهار ماژول اصلی
ساختار درونی این مدل از چهار بخش کلیدی تشکیل شده است که وظیفه تبدیل یک متن خام به خروجی مفهومی را بر عهده دارند:
- توکنساز (Tokenizer): متن ورودی را به قطعات کوچکتری به نام توکن تفکیک میکند. BERT از روش WordPiece با دایره واژگانی شامل 30,000 کلمه استفاده میکند و کلمات ناشناخته را با تگ [UNK] علامتگذاری میکند.
- تعبیهسازی (Embedding): توکنهای عددی را به بردارهایی در یک فضای اقلیدسی نگاشت میکند تا компьютер بتواند به ارتباطات ریاضی بین آنها پی ببرد.
- رمزگذار (Encoder): هسته مرکزی شامل پشتهای از بلوکهای ترنسفورمر است که موازیسازی دادهها را انجام داده و هر توکن را با تمام توکنهای دیگر ارتباط میدهد.
- سر وظیفه (Task Head): در لایه نهایی، بردارها را به توزیعهای احتمالی تبدیل کرده و خروجی مدل را برای وظایف طبقهبندی یا پیشبینی آماده میکند.
پیدایش مدل BERT نقطه آغاز 义项پذیری گسترده پیشآموزش شبکههای عصبی روی کلاندادهها بود و مسیر را برای توسعه نسل جدیدی از دستیاران هوشمند هموار کرد. با گذشت سالها، اگرچه مدلهای قدرتمندتر و پارامتریکی همچون GPT-4 پا به عرصه ظهور گذاشتهاند، اما همچنان ایده خواندن دوسویه متن در بسیاری از سامانههای درک محتوا و موتورهای جستجو حرف اول را میزند.





