مدل زبانی بزرگ

از ایران پدیا
نسخهٔ تاریخ ‏۳۰ سپتامبر ۲۰۲۶، ساعت ۰۹:۳۹ توسط Alireza k h (بحث | مشارکت‌ها) (صفحه‌ای تازه حاوی «{{جعبه اطلاعات مفهوم | نام = مدل زبانی بزرگ | نام اصلی = Large Language Model | نام‌های دیگر = LLM، مدل بزرگ زبانی | تصویر = | اندازه تصویر = | توضیح تصویر = | حوزه = هوش مصنوعی، یادگیری ماشین، یادگیری عمیق، پرداز...» ایجاد کرد)
(تفاوت) → نسخهٔ قدیمی‌تر | نمایش نسخهٔ فعلی (تفاوت) | نسخهٔ جدیدتر ← (تفاوت)
پرش به ناوبری پرش به جستجو
مدل زبانی بزرگ
شناسنامه
نام‌های دیگرLLM، مدل بزرگ زبانی
حوزههوش مصنوعی، یادگیری ماشین، یادگیری عمیق، پردازش زبان طبیعی، زبان‌شناسی رایانشی
خاستگاهمدل‌سازی آماری زبان، شبکه‌های عصبی مصنوعی، یادگیری عمیق، یادگیری خودنظارتی، پردازش زبان طبیعی و معماری ترنسفورمر
اندیشه و تاریخ
مفاهیم کلیدیتوکن، پارامتر، پیش‌آموزش، استنتاج، پیش‌بینی توکن، ترنسفورمر، توجه، پنجرهٔ زمینه، پرامپت، تنظیم دقیق، هم‌ترازی، تعبیه، مقیاس‌پذیری
جریان‌های مرتبطمدل زبانی، ترنسفورمر، مدل بنیادین، هوش مصنوعی مولد، پردازش زبان طبیعی، یادگیری خودنظارتی، یادگیری تقویتی
تأثیرپذیرفته ازآمار، زبان‌شناسی رایانشی، شبکه عصبی مصنوعی، یادگیری عمیق، یادگیری انتقالی، یادگیری خودنظارتی و معماری ترنسفورمر
تأثیرگذار برهوش مصنوعی مولد، دستیارهای هوشمند، موتورهای جست‌وجو، ترجمهٔ ماشینی، تولید محتوا، برنامه‌نویسی، آموزش، پژوهش و تعامل انسان و رایانه
نقد و ارزیابی

مدل زبانی بزرگ (به انگلیسی: Large Language Model و به اختصار LLM) نوعی مدل هوش مصنوعی و یادگیری ماشین است که با استفاده از حجم بزرگی از داده‌های زبانی و تعداد زیادی پارامتر آموزش می‌بیند تا ساختارها و الگوهای زبان را مدل‌سازی کند. چنین مدل‌هایی می‌توانند بر اساس ورودی زبانی، متن تولید کنند و در وظایفی مانند پاسخ به پرسش، خلاصه‌سازی، ترجمه، استخراج اطلاعات، طبقه‌بندی متن و تولید یا توضیح کد مورد استفاده قرار گیرند.[۱]

بسیاری از مدل‌های زبانی بزرگ امروزی بر ترنسفورمر استوارند؛ معماری شبکهٔ عصبی‌ای که در سال ۲۰۱۷ در مقالهٔ Attention Is All You Need معرفی شد. ترنسفورمر با استفاده از سازوکار «توجه» امکان مدل‌سازی روابط میان بخش‌های مختلف یک دنباله را فراهم کرد و نسبت به بسیاری از معماری‌های بازگشتی پیشین قابلیت موازی‌سازی بیشتری در آموزش داشت.[۲]

مدل‌های زبانی بزرگ را نباید پایگاه داده‌ای دانست که پاسخ‌های آماده را در خود ذخیره کرده‌اند. این مدل‌ها در فرایند آموزش پارامترهای خود را بر اساس الگوهای موجود در داده تنظیم می‌کنند و هنگام تولید متن، خروجی را بر اساس روابط آماری آموخته‌شده ایجاد می‌کنند. در بسیاری از مدل‌های مولد، فرایند بنیادی شامل پیش‌بینی توکن بعدی با توجه به توکن‌های قبلی است. همین سازوکار می‌تواند خروجی‌هایی بسیار پیچیده ایجاد کند، اما تضمینی برای صحت واقعی محتوای تولیدشده فراهم نمی‌کند.[۳]

مدل زبانی چیست؟

مدل زبانی مدلی محاسباتی برای بازنمایی احتمال یا ساختار دنباله‌های زبان است.

یکی از مسائل بنیادی در مدل‌سازی زبان این است که با داشتن بخشی از یک دنباله، احتمال ادامه‌های ممکن محاسبه شود.

برای نمونه، اگر دنباله‌ای با عبارت «امروز هوا بسیار...» آغاز شود، مدل می‌تواند احتمال ادامه‌های مختلف را بر اساس الگوهایی که در داده‌های آموزشی آموخته است تخمین بزند.

مدل‌های زبانی پیش از پیدایش یادگیری عمیق نیز وجود داشتند و روش‌هایی مانند مدل‌های n-gram برای محاسبهٔ احتمال دنباله‌های واژگانی به کار می‌رفتند.

بنابراین مدل زبانی بزرگ ادامهٔ تاریخی حوزه‌ای قدیمی‌تر در پردازش زبان طبیعی است، نه مفهومی که ناگهان با ظهور هوش مصنوعی مولد ایجاد شده باشد.

مدل‌های آماری زبان

مدل‌های زبانی اولیه عمدتاً از روش‌های آماری استفاده می‌کردند.

در مدل n-gram احتمال یک واژه با توجه به تعداد محدودی از واژه‌های پیشین تخمین زده می‌شد.

این روش‌ها برای کاربردهایی مانند تشخیص گفتار و ترجمهٔ ماشینی اهمیت داشتند، اما با محدودیت‌هایی روبه‌رو بودند.

یکی از مشکلات اصلی آن بود که با افزایش طول دنباله، تعداد ترکیب‌های ممکن بسیار زیاد می‌شد و بسیاری از ترکیب‌ها در دادهٔ آموزشی مشاهده نشده بودند.

مدل‌های عصبی بعدها راه دیگری برای بازنمایی زبان ارائه کردند.

مدل‌های زبانی عصبی

در مدل‌های زبانی عصبی، واژه‌ها و دیگر واحدهای زبان می‌توانند به بازنمایی‌های عددی چندبعدی تبدیل شوند.

این بازنمایی‌ها به مدل اجازه می‌دهند شباهت‌ها و روابط میان عناصر زبان را به شکلی پیوسته‌تر یاد بگیرد.

پژوهش‌های مربوط به مدل‌های زبانی عصبی در دههٔ ۲۰۰۰ زمینهٔ مهمی برای تحول بعدی پردازش زبان طبیعی فراهم کردند.

با افزایش قدرت محاسباتی و داده، شبکه‌های عصبی بزرگ‌تر و پیچیده‌تر شدند و به‌تدریج بخش مهمی از روش‌های آماری سنتی را در بسیاری از وظایف کنار زدند.

شبکه‌های عصبی بازگشتی

پیش از گسترش ترنسفورمر، شبکه عصبی بازگشتی یا RNN و گونه‌هایی مانند LSTM نقش مهمی در پردازش زبان داشتند.

این شبکه‌ها برای پردازش داده‌های دنباله‌ای طراحی شده بودند و اطلاعات مراحل قبلی را هنگام پردازش مرحلهٔ جدید حفظ می‌کردند.

با این حال آموزش آنها روی دنباله‌های بسیار طولانی دشوار بود و ماهیت ترتیبی پردازش، موازی‌سازی را محدود می‌کرد.

این محدودیت‌ها یکی از زمینه‌های اهمیت معماری‌های مبتنی بر توجه و سپس ترنسفورمر بود.

سازوکار توجه

سازوکار توجه به مدل اجازه می‌دهد هنگام پردازش یک بخش از داده، اهمیت بخش‌های دیگر را به‌طور متفاوت وزن‌دهی کند.

در زبان، معنای یک واژه ممکن است به واژه‌ای در فاصلهٔ زیادی از آن وابسته باشد.

توجه امکان می‌دهد مدل روابط میان بخش‌های مختلف دنباله را مستقیم‌تر بررسی کند.

این ایده پیش از ترنسفورمر نیز در مدل‌های عصبی استفاده می‌شد، اما ترنسفورمر آن را به عنصر مرکزی معماری تبدیل کرد.

ترنسفورمر

در سال ۲۰۱۷ گروهی از پژوهشگران مقالهٔ Attention Is All You Need را منتشر کردند و معماری Transformer را معرفی کردند.

معماری پیشنهادی برخلاف بسیاری از مدل‌های غالب آن دوره، برای پردازش دنباله به شبکه‌های بازگشتی یا کانولوشنی متکی نبود و اساس آن بر سازوکار توجه قرار داشت.[۴]

توانایی پردازش موازی‌تر داده و مدل‌سازی روابط دور در دنباله باعث شد ترنسفورمر به یکی از معماری‌های اصلی پردازش زبان طبیعی تبدیل شود.

بسیاری از مدل‌های زبانی بزرگ نسل جدید، از جمله خانواده‌های GPT و BERT یا معماری‌های مشتق‌شده از آنها، بر ایده‌های ترنسفورمر استوارند.[۵]

توکن

مدل زبانی معمولاً متن را مستقیماً به شکل «واژه» به معنای انسانی آن پردازش نمی‌کند.

متن ابتدا به واحدهایی به نام توکن تقسیم می‌شود.

توکن ممکن است یک واژهٔ کامل، بخشی از واژه، علامت نگارشی یا واحد دیگری باشد.

برای نمونه یک واژهٔ طولانی ممکن است به چند توکن تقسیم شود.

روش تقسیم متن به توکن بر اندازهٔ ورودی، کارایی مدل و نحوهٔ پردازش زبان‌های مختلف اثر می‌گذارد.

توکن‌سازی

فرایند تبدیل متن به توکن توکن‌سازی نام دارد.

پس از توکن‌سازی، هر توکن به یک شناسهٔ عددی تبدیل می‌شود که مدل می‌تواند آن را پردازش کند.

روش‌های توکن‌سازی مختلفی وجود دارند.

در مدل‌های چندزبانه، طراحی واژگان توکن‌ها اهمیت ویژه‌ای دارد؛ زیرا زبان‌ها دارای ساختارهای واژگانی و نوشتاری متفاوت‌اند.

یک سامانهٔ توکن‌سازی ممکن است یک عبارت را در یک زبان با تعداد توکن کمتر و همان مقدار اطلاعات را در زبانی دیگر با تعداد بیشتری توکن نمایش دهد.

تعبیه

توکن‌ها معمولاً به بردارهای عددی تبدیل می‌شوند که تعبیه یا Embedding نام دارند.

این بردارها بازنمایی ریاضی عناصر ورودی‌اند.

مدل در فرایند آموزش روابط میان این بازنمایی‌ها را یاد می‌گیرد.

تعبیه‌ها به مدل اجازه می‌دهند روابط آماری و معنایی پیچیده را در فضایی چندبعدی بازنمایی کند.

پارامتر

پارامتر مقدار عددی قابل تنظیم در مدل است که طی آموزش تغییر می‌کند.

شبکه‌های عصبی بزرگ می‌توانند میلیون‌ها یا میلیاردها پارامتر داشته باشند.

واژهٔ «بزرگ» در LLM تعریف عددی ثابت و جهانی ندارد.

مدلی که در یک دوره بسیار بزرگ محسوب می‌شد ممکن است چند سال بعد در مقایسه با مدل‌های جدید کوچک تلقی شود.

بنابراین LLM بیش از آنکه به آستانهٔ عددی مشخصی اشاره کند، اصطلاحی برای مدل‌های زبانی دارای مقیاس زیاد از نظر پارامتر، داده و محاسبات است.

آموزش

در مرحلهٔ آموزش، مدل حجم بزرگی از داده را پردازش می‌کند و پارامترهای خود را به‌گونه‌ای تنظیم می‌کند که خطای پیش‌بینی کاهش یابد.

برای یک مدل زبانی مولد، یکی از اهداف متداول یادگیری پیش‌بینی بخش بعدی دنباله است.

این فرایند میلیون‌ها یا میلیاردها بار تکرار می‌شود.

در نتیجه مدل الگوهای آماری پیچیده‌ای دربارهٔ ساختار زبان، روابط میان مفاهیم و شکل‌های مختلف متن می‌آموزد.

پیش‌آموزش

پیش‌آموزش مرحله‌ای است که مدل روی مجموعهٔ بزرگی از داده‌ها آموزش می‌بیند تا قابلیت‌های عمومی زبانی به دست آورد.

مدل در این مرحله الزاماً برای یک کاربرد خاص مانند ترجمه، خلاصه‌سازی یا پاسخ به پرسش آموزش داده نمی‌شود.

هدف ایجاد مدلی عمومی است که بعداً بتوان آن را برای کاربردهای متعدد استفاده یا سازگار کرد.

این رویکرد یکی از پایه‌های اصلی مدل‌های بنیادین است.

مرکز پژوهش مدل‌های بنیادین استنفورد مدل بنیادین را مدلی تعریف می‌کند که روی داده‌های گسترده، معمولاً با خودنظارتی در مقیاس بزرگ، آموزش می‌بیند و سپس می‌تواند برای طیف گسترده‌ای از وظایف پایین‌دستی سازگار شود.[۶]

یادگیری خودنظارتی

یادگیری خودنظارتی امکان می‌دهد دادهٔ خام خود بخشی از سیگنال آموزشی را فراهم کند.

برای مثال، در مدل‌سازی زبان می‌توان بخشی از متن را ورودی و بخش دیگری را هدف پیش‌بینی قرار داد.

این روش نیاز به برچسب‌گذاری دستی همهٔ نمونه‌ها را کاهش می‌دهد.

وجود حجم عظیم متن دیجیتال یکی از عواملی بود که استفاده از خودنظارتی در مدل‌های زبانی بزرگ را امکان‌پذیر کرد.

پیش‌بینی توکن بعدی

بسیاری از مدل‌های زبانی مولد به‌طور بنیادی برای پیش‌بینی توکن بعدی آموزش می‌بینند.

فرض کنیم دنباله‌ای از توکن‌ها به مدل داده شده است.

مدل برای توکن بعدی مجموعه‌ای از احتمال‌ها محاسبه می‌کند.

یک توکن بر اساس این توزیع انتخاب می‌شود و سپس فرایند برای توکن بعدی تکرار می‌شود.

به این ترتیب متن می‌تواند توکن‌به‌توکن تولید شود.

NIST نیز در توضیح یکی از منشأهای خطاهای مدل‌های مولد اشاره می‌کند که LLMها توکن یا واژهٔ بعدی را پیش‌بینی می‌کنند و خروجی آنها تقریب آماری از توزیع داده‌های آموزشی است.[۷]

استنتاج

پس از آموزش، استفاده از مدل برای پردازش ورودی جدید استنتاج نامیده می‌شود.

کاربر ورودی یا پرامپتی به مدل می‌دهد و مدل بر اساس پارامترهای آموخته‌شده خروجی تولید می‌کند.

استنتاج معمولاً بسیار کم‌هزینه‌تر از آموزش اولیهٔ یک مدل بزرگ است، اما ارائهٔ سرویس به میلیون‌ها کاربر همچنان می‌تواند منابع محاسباتی قابل توجهی مصرف کند.

پرامپت

پرامپت ورودی‌ای است که کاربر یا سامانه برای هدایت مدل ارائه می‌کند.

پرامپت می‌تواند پرسش، دستور، متن، نمونه یا ترکیبی از اطلاعات باشد.

از آنجا که مدل‌های زبانی بزرگ می‌توانند طیف وسیعی از وظایف را از طریق زبان طبیعی دریافت کنند، پرامپت به نوعی رابط میان انسان و مدل تبدیل شده است.

تغییر نحوهٔ بیان یک دستور می‌تواند بر خروجی مدل اثر بگذارد.

مهندسی پرامپت

مهندسی پرامپت به طراحی و سازمان‌دهی ورودی برای دستیابی به خروجی مناسب‌تر از مدل گفته می‌شود.

این کار می‌تواند شامل مشخص‌کردن وظیفه، زمینه، قالب خروجی و نمونه‌ها باشد.

اهمیت مهندسی پرامپت از آنجا ناشی می‌شود که مدل‌های عمومی برای وظایف بسیار متنوع استفاده می‌شوند و رفتار آنها می‌تواند نسبت به نحوهٔ صورت‌بندی درخواست حساس باشد.

پنجره زمینه

پنجره زمینه مقدار اطلاعاتی است که مدل می‌تواند در یک نوبت پردازش در نظر بگیرد.

این مقدار معمولاً بر حسب توکن اندازه‌گیری می‌شود.

هرچه پنجرهٔ زمینه بزرگ‌تر باشد، مدل می‌تواند متن بیشتری را به‌طور هم‌زمان دریافت کند.

با این حال ظرفیت زمینه به معنای حافظهٔ دائمی یا فهم کامل همهٔ اطلاعات موجود در آن نیست.

تنظیم دقیق

تنظیم دقیق یا Fine-tuning فرایندی است که در آن یک مدل ازپیش‌آموزش‌دیده با داده یا هدف دیگری آموزش بیشتری می‌بیند.

تنظیم دقیق می‌تواند مدل را برای حوزه یا وظیفهٔ مشخصی سازگار کند.

برای مثال مدلی عمومی ممکن است با داده‌های تخصصی برای کاربرد حقوقی، علمی یا فنی تنظیم شود.

این روش معمولاً نسبت به آموزش یک مدل بزرگ از ابتدا به منابع کمتری نیاز دارد.

تنظیم دستور

تنظیم دستور یا Instruction Tuning نوعی سازگارسازی مدل است که با مجموعه‌ای از دستورها و پاسخ‌های مطلوب انجام می‌شود.

هدف آن افزایش توانایی مدل در پیروی از درخواست‌های بیان‌شده به زبان طبیعی است.

این مرحله یکی از عوامل تبدیل مدل خام پیش‌آموزش‌دیده به سامانه‌ای مناسب‌تر برای گفت‌وگو و انجام وظایف کاربر است.

هم‌ترازی

هم‌ترازی هوش مصنوعی در معنای گسترده به تلاش برای سازگارکردن رفتار سامانه‌های هوش مصنوعی با اهداف، ارزش‌ها یا ترجیحات مورد نظر اشاره دارد.

در مدل‌های زبانی، روش‌های مختلفی برای کاهش پاسخ‌های نامطلوب و افزایش پیروی از دستورها استفاده می‌شوند.

این حوزه فقط یک مسئلهٔ فنی نیست؛ تعیین اینکه «رفتار مطلوب» چیست می‌تواند مسائل اخلاقی، فرهنگی و اجتماعی ایجاد کند.

یادگیری تقویتی از بازخورد انسانی

یادگیری تقویتی از بازخورد انسانی یا RLHF یکی از روش‌هایی است که برای سازگارکردن رفتار برخی مدل‌های زبانی با ترجیحات انسانی استفاده شده است.

در این رویکرد، انسان‌ها پاسخ‌های مختلف را ارزیابی یا مقایسه می‌کنند و این بازخورد برای آموزش سامانه به کار می‌رود.

RLHF تنها روش هم‌ترازی مدل‌های زبانی نیست و روش‌های دیگری نیز برای استفاده از بازخورد انسانی یا مصنوعی توسعه یافته‌اند.

مدل بنیادین

مدل بنیادین و مدل زبانی بزرگ مترادف کامل نیستند.

مرکز پژوهش مدل‌های بنیادین استنفورد، مدل بنیادین را مدلی می‌داند که بر داده‌های گسترده آموزش می‌بیند و قابلیت سازگارشدن با وظایف متعدد را دارد.[۸]

مدل‌های زبانی بزرگ بخش مهمی از مدل‌های بنیادین هستند، اما مدل بنیادین می‌تواند برای تصویر، صوت، پروتئین، مولکول یا چند نوع داده ساخته شود.

بنابراین مفهوم مدل بنیادین از LLM گسترده‌تر است.[۹]

هوش مصنوعی مولد

هوش مصنوعی مولد نیز مفهومی گسترده‌تر از مدل زبانی بزرگ است.

هوش مصنوعی مولد شامل سامانه‌هایی است که می‌توانند محتوای جدید مانند متن، تصویر، صوت یا ویدئو تولید کنند.

LLM عمدتاً بر زبان متمرکز است، هرچند بسیاری از مدل‌های جدید توانایی پردازش چند نوع داده را نیز دارند.

بنابراین هر LLM مولد را می‌توان بخشی از هوش مصنوعی مولد دانست، اما همهٔ سامانه‌های هوش مصنوعی مولد مدل زبانی بزرگ نیستند.

مدل‌های چندوجهی

مدل‌های چندوجهی می‌توانند بیش از یک نوع داده را پردازش کنند.

برای مثال سامانه‌ای ممکن است متن و تصویر را دریافت کند و بر اساس هر دو پاسخ تولید کند.

برخی مدل‌های جدید علاوه بر زبان، تصویر، صوت یا ویدئو را نیز پردازش می‌کنند.

این تحول مرز سنتی میان «مدل زبانی» و دیگر مدل‌های هوش مصنوعی را پیچیده‌تر کرده است.

توانایی‌های مدل‌های زبانی بزرگ

مدل‌های زبانی بزرگ می‌توانند برای مجموعهٔ گسترده‌ای از وظایف استفاده شوند.

از جمله:

  • پاسخ به پرسش؛
  • خلاصه‌سازی؛
  • ترجمه؛
  • بازنویسی و ویرایش؛
  • طبقه‌بندی متن؛
  • استخراج اطلاعات؛
  • تولید کد؛
  • توضیح کد؛
  • تولید محتوای نوشتاری؛
  • تحلیل اسناد؛
  • تعامل مکالمه‌ای.

یکی از ویژگی‌های مهم این مدل‌ها آن است که یک مدل واحد می‌تواند برای وظایف بسیار متفاوت به کار رود.

این قابلیت عمومی و سازگاری گسترده یکی از ویژگی‌هایی است که مدل‌های بنیادین را از بسیاری از مدل‌های تخصصی نسل‌های پیشین متمایز می‌کند.[۱۰]

یادگیری درون‌زمینه‌ای

برخی مدل‌های زبانی بزرگ می‌توانند با دریافت چند نمونه در پرامپت، الگوی مورد نظر را بدون تغییر پارامترهای اصلی مدل دنبال کنند.

این پدیده یادگیری درون‌زمینه‌ای یا In-context Learning نامیده می‌شود.

برای مثال می‌توان چند نمونه از تبدیل ورودی به خروجی را در پرامپت قرار داد و سپس از مدل خواست نمونهٔ جدیدی را به همان شیوه پردازش کند.

در این حالت وزن‌های مدل تغییر نمی‌کنند؛ اطلاعات نمونه‌ها تنها در زمینهٔ همان تعامل مورد استفاده قرار می‌گیرند.

Zero-shot و Few-shot

اگر مدل وظیفه‌ای را بدون دریافت نمونهٔ عملی انجام دهد، این وضعیت معمولاً Zero-shot نامیده می‌شود.

اگر چند نمونه در اختیار مدل قرار گیرد، اصطلاح Few-shot به کار می‌رود.

توانایی انجام وظایف با تعداد اندکی نمونه یکی از ویژگی‌هایی بود که توجه زیادی را به مدل‌های زبانی بزرگ جلب کرد.

این قابلیت نشان داد که یک مدل عمومی می‌تواند بدون آموزش جداگانه برای هر مسئله در مجموعه‌ای از وظایف به کار گرفته شود.

مقیاس

یکی از عوامل اصلی توسعهٔ LLMها افزایش مقیاس بوده است.

مقیاس می‌تواند شامل:

  • تعداد پارامترها؛
  • حجم دادهٔ آموزشی؛
  • میزان محاسبات؛
  • اندازهٔ زمینه؛
  • منابع سخت‌افزاری

باشد.

با این حال بزرگ‌ترشدن مدل به‌تنهایی تضمین‌کنندهٔ کیفیت نیست.

کیفیت داده، معماری، روش آموزش، ارزیابی و سازگارسازی نیز اهمیت دارند.

قابلیت‌های نوظهور

در ادبیات مربوط به مدل‌های بزرگ، اصطلاح قابلیت نوظهور برای توانایی‌هایی استفاده شده است که در مدل‌های کوچک‌تر آشکار نیستند یا با افزایش مقیاس به شکل محسوسی ظاهر می‌شوند.

مرکز پژوهش مدل‌های بنیادین استنفورد نیز افزایش مقیاس را با ظهور قابلیت‌های جدید در مدل‌های بنیادین مرتبط دانسته است.[۱۱]

با این حال نحوهٔ تعریف و اندازه‌گیری «نوظهور بودن» این توانایی‌ها موضوع بحث پژوهشی است و نباید آن را بدون معیار مشخص به معنای جهش ناگهانی به هوش انسانی دانست.

استدلال

مدل‌های زبانی بزرگ در برخی آزمون‌ها قادر به انجام وظایفی هستند که به استدلال چندمرحله‌ای نیاز دارند.

با این حال دربارهٔ ماهیت این توانایی اختلاف نظر وجود دارد.

عملکرد موفق در یک مسئله لزوماً نشان نمی‌دهد مدل فرایند شناختی مشابه انسان دارد.

همچنین عملکرد مدل می‌تواند با تغییر صورت مسئله، داده یا زمینه تغییر کند.

از این رو ارزیابی استدلال در LLMها یکی از حوزه‌های فعال پژوهشی است.

دانش

مدل‌های زبانی در جریان آموزش الگوهای فراوانی دربارهٔ جهان را از متن می‌آموزند.

این امر به آنها امکان می‌دهد به پرسش‌های متعدد پاسخ دهند.

اما «دانش» مدل با پایگاه دادهٔ سنتی متفاوت است.

اطلاعات به شکل مجموعه‌ای ساده از رکوردهای قابل بازیابی ذخیره نشده‌اند، بلکه در پارامترهای شبکه به‌صورت توزیع‌شده بازنمایی می‌شوند.

همین ویژگی می‌تواند بازیابی دقیق منشأ یک ادعا را دشوار کند.

بازیابی افزوده

یکی از روش‌های کاهش برخی محدودیت‌های مدل، تولید افزوده با بازیابی یا Retrieval-Augmented Generation (RAG) است.

در این روش، سامانه پیش از تولید پاسخ اطلاعات مرتبط را از منابع خارجی مانند اسناد یا پایگاه داده بازیابی می‌کند و آن اطلاعات را در اختیار مدل قرار می‌دهد.

این روش می‌تواند دسترسی به اطلاعات تازه یا تخصصی را بهبود دهد.

با این حال RAG نیز صحت پاسخ را تضمین نمی‌کند؛ کیفیت بازیابی، منبع و نحوهٔ استفادهٔ مدل از اطلاعات همچنان اهمیت دارند.

استفاده از ابزار

مدل زبانی می‌تواند بخشی از سامانه‌ای بزرگ‌تر باشد که به ابزارهای خارجی دسترسی دارد.

برای مثال مدل ممکن است:

  • موتور جست‌وجو را فراخوانی کند؛
  • محاسبه‌ای انجام دهد؛
  • پایگاه داده را جست‌وجو کند؛
  • کد اجرا کند؛
  • از نرم‌افزار دیگری استفاده کند.

در چنین سامانه‌ای باید میان توانایی خود مدل و توانایی کل سامانه تمایز گذاشت.

اگر پاسخ دقیق از پایگاه دادهٔ خارجی به دست آمده باشد، نباید آن را صرفاً «دانش داخلی مدل» تلقی کرد.

عامل هوش مصنوعی

هنگامی که یک مدل زبانی با ابزار، حافظه، برنامه‌ریزی و امکان اجرای مجموعه‌ای از اقدامات ترکیب شود، می‌تواند بخشی از یک عامل هوش مصنوعی باشد.

عامل ممکن است هدفی دریافت کند، مراحل انجام آن را تعیین کند، ابزارهایی را فراخوانی کند و بر اساس نتایج مراحل بعدی را انتخاب کند.

مدل زبانی در این حالت جزء مرکزی سامانهٔ تصمیم‌گیری یا ارتباطی است، اما خود LLM و عامل هوش مصنوعی یک مفهوم نیستند.

خطای ساختگی

یکی از محدودیت‌های شناخته‌شدهٔ مدل‌های زبانی مولد تولید اطلاعات ظاهراً معتبر اما نادرست است.

NIST برای این پدیده اصطلاح Confabulation را به کار می‌برد و اشاره می‌کند که در زبان عمومی اصطلاح‌هایی مانند «hallucination» نیز استفاده می‌شوند.[۱۲]

مدل ممکن است:

  • رویدادی را که رخ نداده توصیف کند؛
  • نام کتاب یا مقاله‌ای غیرواقعی بسازد؛
  • نقل‌قولی نادرست ایجاد کند؛
  • منبع یا نشانی جعلی ارائه دهد؛
  • داده‌ای عددی را با اطمینان بیان کند که صحیح نیست.

این رفتار تا حدی با ماهیت مولد مدل ارتباط دارد: مدل برای تولید ادامهٔ محتمل آموزش دیده است، نه برای تضمین حقیقت هر جمله.

جعل منبع

جعل منبع یکی از شکل‌های مهم خطای ساختگی است.

مدل ممکن است ساختار یک ارجاع علمی را به‌درستی تقلید کند اما عنوان، نویسنده، شمارهٔ صفحه یا حتی کل مقاله وجود خارجی نداشته باشد.

NIST نیز هشدار می‌دهد که مدل‌های مولد ممکن است استدلال یا استنادهایی ساختگی تولید کنند که ظاهراً پاسخ را توجیه می‌کنند.[۱۳]

به همین دلیل در پژوهش دانشگاهی و دانشنامه‌ای، منابع ارائه‌شده توسط مدل باید مستقلاً بررسی شوند.

سوگیری

مدل‌های زبانی از داده‌هایی آموزش می‌بینند که محصول جوامع انسانی‌اند.

این داده‌ها ممکن است حاوی کلیشه‌ها، عدم توازن و سوگیری‌های تاریخی باشند.

مدل می‌تواند بخشی از این الگوها را بازتولید کند.

سوگیری همچنین ممکن است از انتخاب داده، روش آموزش، تنظیم مدل یا معیارهای ارزیابی ناشی شود.

بنابراین کاهش سوگیری صرفاً با افزایش اندازهٔ مدل تضمین نمی‌شود.

زبان‌های کم‌منبع

عملکرد مدل‌های زبانی در همهٔ زبان‌ها یکسان نیست.

زبان‌هایی که دادهٔ دیجیتال آموزشی کمتری دارند ممکن است کمتر در مجموعه‌های آموزشی نمایندگی شوند.

همچنین کیفیت داده، نظام نوشتاری و روش توکن‌سازی می‌توانند بر عملکرد اثر بگذارند.

گزارش مرکز پژوهش مدل‌های بنیادین استنفورد نیز تفاوت میان زبان‌ها، گویش‌ها و گونه‌های زبانی و محدودیت داده در برخی از آنها را از چالش‌های مهم مدل‌های بنیادین زبانی می‌داند.[۱۴]

این مسئله برای زبان فارسی و دیگر زبان‌هایی که نسبت به انگلیسی سهم کوچک‌تری از داده‌های دیجیتال باکیفیت دارند نیز از نظر پژوهشی اهمیت دارد.

حریم خصوصی

داده‌های آموزشی ممکن است شامل اطلاعات شخصی باشند.

این مسئله پرسش‌هایی دربارهٔ گردآوری داده، رضایت، امکان بازتولید اطلاعات حساس و حفاظت از حریم خصوصی ایجاد می‌کند.

همچنین کاربران ممکن است هنگام استفاده از یک سامانه اطلاعات محرمانه‌ای را در پرامپت وارد کنند.

بنابراین حریم خصوصی هم در مرحلهٔ آموزش و هم در مرحلهٔ استفاده از مدل مطرح است.

مالکیت فکری

استفاده از کتاب‌ها، مقاله‌ها، تصاویر، کد و دیگر آثار برای آموزش مدل‌ها بحث‌های حقوقی دربارهٔ مالکیت فکری و حق مؤلف ایجاد کرده است.

یکی از مسائل این است که تحت چه شرایطی استفاده از آثار دارای حق مؤلف برای آموزش مدل مجاز است.

مسئلهٔ دیگر به خروجی مربوط می‌شود: آیا خروجی ممکن است بخش‌هایی از آثار آموزشی را بازتولید کند و مسئولیت چنین بازتولیدی بر عهدهٔ چه کسی است.

پاسخ حقوقی به این مسائل بسته به حوزهٔ قضایی متفاوت و همچنان در حال تحول است.

شفافیت

اطلاعات موجود دربارهٔ مدل‌های مختلف یکسان نیست.

در برخی موارد توسعه‌دهنده اطلاعات گسترده‌ای دربارهٔ معماری، داده و ارزیابی منتشر می‌کند و در موارد دیگر بخش زیادی از این اطلاعات محرمانه باقی می‌ماند.

شفافیت برای پژوهش دربارهٔ توانایی‌ها، سوگیری‌ها، آثار محیط‌زیستی و خطرهای مدل اهمیت دارد.

مرکز پژوهش مدل‌های بنیادین استنفورد نیز شاخصی برای ارزیابی شفافیت توسعه‌دهندگان مدل‌های بنیادین ایجاد کرده است.[۱۵]

مدل باز و مدل بسته

اصطلاح‌های مدل باز و مدل بسته به درجات مختلف دسترسی به اجزای یک مدل اشاره دارند.

در برخی مدل‌ها وزن‌های مدل برای دریافت و اجرای مستقل منتشر می‌شوند.

برخی دیگر فقط از طریق رابط برنامه‌نویسی یا سرویس آنلاین قابل استفاده‌اند.

«باز» نیز مفهوم یکدستی نیست؛ ممکن است وزن‌ها منتشر شوند اما دادهٔ آموزشی یا کد کامل در دسترس نباشد.

پژوهشگران استنفورد مدل‌های بنیادین باز را در یک تعریف عملی، مدل‌هایی با وزن‌های به‌طور گسترده در دسترس بررسی کرده‌اند و هم مزایای بازرسی و سفارشی‌سازی و هم دشواری کنترل استفاده‌های پایین‌دستی آنها را مورد توجه قرار داده‌اند.[۱۶]

هزینه محاسباتی

آموزش مدل‌های بسیار بزرگ می‌تواند به زیرساخت محاسباتی قابل توجهی نیاز داشته باشد.

شتاب‌دهنده‌های سخت‌افزاری مانند GPUها و دیگر تراشه‌های تخصصی برای انجام تعداد عظیمی از عملیات ریاضی استفاده می‌شوند.

هزینهٔ محاسباتی یکی از عواملی است که توسعهٔ مدل‌های پیشرفته را برای همهٔ دانشگاه‌ها و شرکت‌ها به یک اندازه امکان‌پذیر نمی‌کند.

این مسئله با تمرکز اقتصادی و دسترسی به زیرساخت هوش مصنوعی ارتباط پیدا کرده است.

مصرف انرژی

آموزش و اجرای مدل‌های بزرگ انرژی مصرف می‌کند.

میزان مصرف به معماری، اندازهٔ مدل، سخت‌افزار، محل مرکز داده، تعداد کاربران و روش استقرار وابسته است.

بنابراین نمی‌توان برای همهٔ LLMها یک مقدار ثابت انرژی تعیین کرد.

با افزایش استفاده از مدل‌های بزرگ، کارایی سخت‌افزار و نرم‌افزار و آثار زیست‌محیطی زیرساخت‌های محاسباتی به موضوع پژوهش تبدیل شده‌اند.

ارزیابی

ارزیابی مدل زبانی تنها با یک معیار امکان‌پذیر نیست.

یک مدل ممکن است در ترجمه عملکرد خوبی داشته باشد اما در استدلال یا صحت واقعی ضعیف‌تر باشد.

معیارهای ارزیابی می‌توانند شامل:

  • دقت؛
  • صحت واقعی؛
  • استدلال؛
  • ایمنی؛
  • سوگیری؛
  • استحکام؛
  • کارایی؛
  • عملکرد چندزبانه

باشند.

مرکز پژوهش مدل‌های بنیادین استنفورد در پروژهٔ HELM بر ضرورت ارزیابی جامع مدل‌های زبانی در سناریوها و معیارهای متعدد تأکید کرده است.[۱۷]

بنچمارک

بنچمارک مجموعه‌ای از وظایف و داده‌های استاندارد برای مقایسهٔ مدل‌هاست.

بنچمارک‌ها امکان مقایسهٔ نسبی عملکرد را فراهم می‌کنند، اما محدودیت دارند.

اگر دادهٔ آزمون در داده‌های آموزشی مدل وجود داشته باشد، نتیجه ممکن است عملکرد واقعی روی مسئلهٔ جدید را نشان ندهد.

همچنین موفقیت در یک آزمون استاندارد لزوماً به معنای توانایی عمومی در دنیای واقعی نیست.

کاربرد در جست‌وجو

مدل‌های زبانی می‌توانند برای تفسیر پرسش کاربر، خلاصه‌سازی نتایج و ایجاد پاسخ‌های زبانی در سامانه‌های جست‌وجو استفاده شوند.

اما مدل زبانی و موتور جست‌وجو یکسان نیستند.

موتور جست‌وجو اطلاعات را از مجموعه‌ای از اسناد بازیابی می‌کند، در حالی که مدل زبانی متن تولید می‌کند.

ترکیب بازیابی اطلاعات و مدل زبانی می‌تواند مزایای هر دو رویکرد را به کار گیرد.

کاربرد در برنامه‌نویسی

مدل‌های زبانی که با داده‌های کد آموزش دیده‌اند می‌توانند:

  • کد تولید کنند؛
  • خطاها را توضیح دهند؛
  • کد را مستندسازی کنند؛
  • میان زبان‌های برنامه‌نویسی تبدیل انجام دهند؛
  • آزمون نرم‌افزاری پیشنهاد کنند.

با این حال کد تولیدشده ممکن است دارای خطای منطقی یا آسیب‌پذیری امنیتی باشد و نیازمند بررسی است.

کاربرد در آموزش

LLMها می‌توانند مفاهیم را توضیح دهند، متن را ساده‌سازی کنند، تمرین تولید کنند و بازخورد ارائه دهند.

همچنین می‌توانند ابزار یادگیری زبان و دستیار پژوهشی باشند.

در مقابل، خطای واقعی، تولید منابع جعلی و امکان استفاده برای انجام تکالیف بدون یادگیری واقعی از چالش‌های کاربرد آموزشی آنهاست.

کاربرد در پژوهش

مدل‌های زبانی می‌توانند در جست‌وجوی مفاهیم، طبقه‌بندی متون، استخراج داده، خلاصه‌سازی و کمک به نگارش مورد استفاده قرار گیرند.

اما در پژوهش علمی نباید خروجی مدل بدون راستی‌آزمایی به‌عنوان منبع تلقی شود.

به‌ویژه ارجاعات، اعداد، نقل‌قول‌ها و ادعاهای تاریخی باید با منابع اصلی بررسی شوند.

توانایی تولید متن قانع‌کننده می‌تواند تشخیص خطا را دشوارتر کند.

کاربرد در پزشکی و حقوق

مدل‌های زبانی برای پردازش اسناد پزشکی و حقوقی، خلاصه‌سازی و پشتیبانی اطلاعاتی مورد مطالعه قرار گرفته‌اند.

اما این حوزه‌ها از نمونه‌های کاربردهای پرپیامد هستند.

NIST هشدار می‌دهد که خطای ساختگی در کاربردهایی مانند سلامت می‌تواند پیامدهای جدی داشته باشد؛ برای مثال خلاصهٔ نادرست اطلاعات بیمار می‌تواند بر تصمیم پزشکی اثر بگذارد.[۱۸]

بنابراین استفاده در چنین حوزه‌هایی نیازمند کنترل و ارزیابی متناسب با خطر است.

مدل زبانی و فهم

یکی از مناقشه‌های اساسی این است که آیا توانایی مدل در تولید زبان به معنای فهم زبان است.

از دیدگاه مهندسی می‌توان توانایی مدل را با عملکرد آن در وظایف مختلف سنجید.

اما از دیدگاه فلسفی و علوم شناختی، پرسش‌هایی دربارهٔ معنا، قصد، تجربه و آگاهی مطرح می‌شوند.

توانایی تولید جملهٔ درست به‌تنهایی اثبات نمی‌کند که مدل دارای تجربهٔ ذهنی مشابه انسان است.

این مسئله ادامهٔ برخی بحث‌های قدیمی‌تر دربارهٔ آزمون تورینگ، اتاق چینی و ماهیت هوش ماشینی است.

مدل زبانی و آگاهی

هیچ نتیجهٔ علمی پذیرفته‌شده‌ای وجود ندارد که صرف توانایی یک مدل زبانی در مکالمه یا حل مسئله را اثبات آگاهی آن بداند.

مدل می‌تواند دربارهٔ احساسات، هویت یا تجربهٔ شخصی متن تولید کند، زیرا چنین الگوهایی در زبان وجود دارند.

این خروجی به خودی خود نشان نمی‌دهد سامانه دارای احساس یا تجربهٔ ذهنی است.

تفکیک رفتار زبانی از ادعای آگاهی برای تحلیل علمی این سامانه‌ها اهمیت دارد.

رابطه با هوش عمومی مصنوعی

مدل‌های زبانی بزرگ گاهی در بحث هوش عمومی مصنوعی یا AGI مطرح می‌شوند.

توانایی انجام طیف گسترده‌ای از وظایف سبب شده است برخی پژوهشگران آنها را مسیر احتمالی توسعهٔ سامانه‌های عمومی‌تر بدانند.

با این حال AGI تعریف واحد و معیار پذیرفته‌شدهٔ جهانی ندارد و نباید LLM را به‌طور خودکار معادل هوش عمومی مصنوعی دانست.

مدل‌های زبانی کنونی دارای توانایی‌های قابل توجه و در عین حال محدودیت‌های مستند هستند.

مدل زبانی و انسان

مدل زبانی و انسان از سازوکارهای متفاوتی برای یادگیری و استفاده از زبان برخوردارند.

انسان زبان را در محیط اجتماعی و فیزیکی، همراه با تجربهٔ حسی و تعامل با دیگران می‌آموزد.

مدل زبانی عمدتاً از داده‌های دیجیتال و اهداف محاسباتی آموزش می‌بیند.

مرکز پژوهش مدل‌های بنیادین استنفورد نیز به تفاوت میان یادگیری زبان در انسان و مدل‌های بنیادین، از جمله کارایی بسیار بیشتر کودک در یادگیری از نمونه‌های محدود، اشاره کرده است.[۱۹]

بنابراین شباهت خروجی زبانی نباید به معنای یکسان‌بودن فرایند شناختی تلقی شود.

آثار اجتماعی

مدل‌های زبانی بزرگ می‌توانند هزینهٔ تولید و پردازش متن را کاهش دهند.

این تحول می‌تواند بر مشاغلی که بخش مهمی از آنها با زبان، اطلاعات یا کد سروکار دارد اثر بگذارد.

در عین حال آثار آنها به نحوهٔ استفاده وابسته است.

در برخی فعالیت‌ها مدل می‌تواند جایگزین بخشی از وظایف شود و در برخی دیگر نقش ابزار کمکی برای افزایش توانایی انسان داشته باشد.

تأثیر نهایی بر بازار کار به فناوری، سازمان‌دهی کار، سیاست و مهارت نیروی انسانی وابسته است.

تمرکز قدرت

آموزش مدل‌های پیشرفته می‌تواند به سرمایه، داده، سخت‌افزار و زیرساخت عظیم نیاز داشته باشد.

این امر می‌تواند توسعهٔ مدل‌های مرزی را در تعداد محدودی از شرکت‌ها و نهادها متمرکز کند.

مرکز پژوهش مدل‌های بنیادین استنفورد هشدار داده است که استفادهٔ گسترده از تعداد محدودی مدل می‌تواند نوعی «همگن‌سازی» ایجاد کند: مزیت آن این است که بهبود یک مدل می‌تواند به بسیاری از کاربردها منتقل شود، اما نقص یا خطر همان مدل نیز ممکن است در شمار زیادی از سامانه‌های پایین‌دستی انتشار یابد.[۲۰]

خطرهای سیستمی

وقتی تعداد زیادی نرم‌افزار و خدمت بر یک مدل بنیادین واحد تکیه کنند، خطای آن مدل می‌تواند به چندین کاربرد منتقل شود.

برای مثال سوگیری، آسیب‌پذیری امنیتی یا محدودیت زبانی ممکن است در سامانه‌های متعددی که بر همان مدل ساخته شده‌اند ظاهر شود.

این ویژگی سبب شده است ارزیابی مدل‌های بنیادین تنها مسئله‌ای مربوط به عملکرد یک محصول منفرد نباشد.

مدیریت ریسک

با گسترش مدل‌های مولد، چارچوب‌هایی برای شناسایی و مدیریت خطرها توسعه یافته‌اند.

NIST در سال ۲۰۲۴ نمایهٔ ویژهٔ هوش مصنوعی مولد را به‌عنوان مکمل چارچوب مدیریت ریسک هوش مصنوعی منتشر کرد.

این سند خطرهایی مانند خطای ساختگی، محتوای زیان‌آور، حریم خصوصی، سوگیری، امنیت اطلاعات، مالکیت فکری و مسائل مرتبط با زنجیرهٔ ارزش هوش مصنوعی را بررسی می‌کند.[۲۱]

مدیریت ریسک به معنای حذف کامل عدم قطعیت نیست، بلکه شامل شناسایی، سنجش و کاهش خطر متناسب با نوع کاربرد است.

محدودیت‌های مدل زبانی بزرگ

با وجود توانایی‌های گسترده، LLMها محدودیت‌های مهمی دارند:

  • ممکن است اطلاعات نادرست تولید کنند؛
  • ممکن است منابع ساختگی ارائه دهند؛
  • عملکرد آنها میان زبان‌ها متفاوت باشد؛
  • ممکن است سوگیری داده‌های آموزشی را بازتولید کنند؛
  • همیشه منشأ اطلاعات خود را مشخص نمی‌کنند؛
  • ممکن است نسبت به نحوهٔ بیان پرامپت حساس باشند؛
  • عملکرد خوب در یک آزمون تضمین‌کنندهٔ عملکرد در شرایط دیگر نیست؛
  • تولید متن روان لزوماً به معنای صحت یا فهم نیست.

این محدودیت‌ها به‌ویژه در کاربردهای علمی، پزشکی، حقوقی و دیگر حوزه‌های پرپیامد اهمیت دارند.

تفاوت مفاهیم مرتبط

مدل زبانی هر مدل محاسباتی برای مدل‌سازی زبان است و لزوماً بزرگ یا مبتنی بر شبکهٔ عصبی نیست.

مدل زبانی بزرگ مدلی زبانی در مقیاس بزرگ است که معمولاً با یادگیری عمیق و حجم زیادی از داده آموزش می‌بیند.

ترنسفورمر معماری شبکهٔ عصبی است و به خودی خود مترادف LLM نیست.

مدل بنیادین مدلی است که بر داده‌های گسترده آموزش می‌بیند و برای وظایف متعدد قابل سازگارسازی است؛ این مفهوم از LLM گسترده‌تر است.

هوش مصنوعی مولد به سامانه‌هایی گفته می‌شود که محتوای جدید تولید می‌کنند و می‌تواند شامل متن، تصویر، صوت و ویدئو باشد.

چت‌بات رابط یا سامانه‌ای برای گفت‌وگو با کاربر است و ممکن است از LLM استفاده کند، اما چت‌بات و مدل زبانی یک چیز نیستند.

عامل هوش مصنوعی سامانه‌ای است که می‌تواند مدل زبانی را با ابزارها، حافظه و اجرای اقدام ترکیب کند.

این تمایزها برای فهم معماری سامانه‌های هوش مصنوعی معاصر اهمیت دارند.

اهمیت مدل‌های زبانی بزرگ

اهمیت LLMها فقط در توانایی تولید متن نیست.

تحول مهم‌تر این است که یک مدل واحد می‌تواند به زیربنای تعداد زیادی کاربرد تبدیل شود.

پیش از این بسیاری از وظایف پردازش زبان به مدل‌های تخصصی جداگانه نیاز داشتند.

مدل‌های بنیادین زبانی امکان می‌دهند یک مدل پیش‌آموزش‌دیده با پرامپت، تنظیم دقیق یا دیگر روش‌ها برای کاربردهای گوناگون سازگار شود.

مرکز پژوهش مدل‌های بنیادین استنفورد این تحول را بخشی از تغییر پارادایم در هوش مصنوعی توصیف کرده است.[۲۲]

نقد مدل‌های زبانی بزرگ

نقد LLMها چند حوزهٔ متفاوت را دربرمی‌گیرد.

برخی نقدها فنی‌اند و به خطای واقعی، شکنندگی، دشواری تفسیر و محدودیت استدلال مربوط می‌شوند.

برخی اجتماعی‌اند و بر سوگیری، حقوق مؤلفان، شرایط گردآوری داده، تمرکز قدرت و تأثیر بر بازار کار تمرکز دارند.

برخی دیگر فلسفی‌اند و این پرسش را مطرح می‌کنند که آیا موفقیت در تولید زبان باید به «فهم»، «دانش» یا «هوش» تعبیر شود.

همچنین هزینهٔ محاسباتی و محیط‌زیستی آموزش و اجرای مدل‌های بزرگ موضوع نقد است.

این بحث‌ها نشان می‌دهند که LLM صرفاً یک فناوری نرم‌افزاری نیست، بلکه سامانه‌ای اجتماعی ـ فنی است که آثار آن به نحوهٔ توسعه، مالکیت و استفاده از آن وابسته است.

جمع‌بندی

مدل زبانی بزرگ نوعی سامانهٔ هوش مصنوعی است که با استفاده از حجم زیادی از داده و محاسبات برای مدل‌سازی و تولید زبان آموزش می‌بیند. نسل کنونی این مدل‌ها عمدتاً بر معماری ترنسفورمر استوار است؛ معماری‌ای که در سال ۲۰۱۷ معرفی شد و سازوکار توجه را به عنصر اصلی پردازش دنباله تبدیل کرد.[۲۳]

توانایی یک LLM در انجام وظایف متعدد از پیش‌آموزش گسترده و امکان سازگارسازی آن ناشی می‌شود. این ویژگی سبب شده است مدل‌های زبانی بزرگ به یکی از مهم‌ترین نمونه‌های مدل‌های بنیادین تبدیل شوند و در کاربردهایی از ترجمه و برنامه‌نویسی تا آموزش و پژوهش مورد استفاده قرار گیرند.[۲۴]

با این حال تولید متن روان نباید با صحت، فهم یا آگاهی یکسان دانسته شود. مدل‌های زبانی می‌توانند محتوای نادرست و حتی منابع ساختگی تولید کنند. NIST این پدیده را یکی از خطرهای مهم هوش مصنوعی مولد می‌داند و تأکید می‌کند که خروجی آماری مدل می‌تواند در عین ظاهر معتبر، از نظر واقعی نادرست باشد.[۲۵]

از این رو ارزیابی مدل‌های زبانی بزرگ تنها با سنجش توانایی تولید متن امکان‌پذیر نیست. صحت، ایمنی، سوگیری، عملکرد چندزبانه، شفافیت، امنیت و قابلیت اعتماد نیز باید بررسی شوند. گسترش این مدل‌ها در دههٔ ۲۰۲۰ آنها را از موضوعی تخصصی در پردازش زبان طبیعی به یکی از فناوری‌های مهم در بحث‌های علمی، اقتصادی، فرهنگی و اجتماعی پیرامون هوش مصنوعی تبدیل کرده است.

جستارهای وابسته

منابع

  1. ↑ “What is a Large Language Model (LLM)?”, Stanford Institute for Human-Centered Artificial Intelligence
  2. ↑ Ashish Vaswani et al., “Attention Is All You Need”, 2017
  3. ↑ Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, 2024
  4. ↑ Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser and Illia Polosukhin, “Attention Is All You Need”, 2017
  5. ↑ “What is a Transformer?”, Stanford Institute for Human-Centered Artificial Intelligence
  6. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford Center for Research on Foundation Models, 2021
  7. ↑ Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST, 2024
  8. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  9. ↑ “Reflections on Foundation Models”, Stanford CRFM
  10. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  11. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  12. ↑ Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, 2024
  13. ↑ Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST, 2024
  14. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  15. ↑ Foundation Model Transparency Index, Stanford CRFM
  16. ↑ On the Societal Impact of Open Foundation Models, Stanford CRFM
  17. ↑ Rishi Bommasani, Percy Liang and Tony Lee, “Language Models are Changing AI: The Need for Holistic Evaluation”, Stanford CRFM
  18. ↑ Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST, 2024
  19. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  20. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  21. ↑ Chloe Autio et al., Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST, 2024
  22. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  23. ↑ Ashish Vaswani et al., “Attention Is All You Need”, 2017
  24. ↑ Rishi Bommasani et al., On the Opportunities and Risks of Foundation Models, Stanford CRFM
  25. ↑ Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST, 2024

الگو:تاریخ آخرین ویرایش