هوش مصنوعی مولد

از ایران پدیا
پرش به ناوبری پرش به جستجو
هوش مصنوعی مولد
شناسنامه
نام‌های دیگرهوش مصنوعی زایا، هوش مصنوعی تولیدگر، Generative AI، GenAI
حوزههوش مصنوعی، یادگیری ماشین، یادگیری عمیق، علوم رایانه، پردازش زبان طبیعی، بینایی ماشین
خاستگاهعلوم رایانه، آمار، نظریهٔ اطلاعات، شبکه‌های عصبی مصنوعی و یادگیری ماشین
اندیشه و تاریخ
مفاهیم کلیدیمدل مولد، دادهٔ آموزشی، شبکهٔ عصبی، مدل زبانی بزرگ، ترنسفورمر، توکن، پرامپت، مدل انتشاری، آموزش، استنتاج، محتوای مصنوعی، چندوجهی
جریان‌های مرتبطهوش مصنوعی، یادگیری ماشین، یادگیری عمیق، مدل‌های زبانی بزرگ، مدل‌های بنیادین، شبکه‌های مولد تخاصمی، مدل‌های انتشاری، پردازش زبان طبیعی
تأثیرپذیرفته ازآمار، نظریهٔ احتمال، علوم رایانه، علوم شناختی، شبکه‌های عصبی، یادگیری ماشین و افزایش توان محاسباتی
تأثیرگذار برآموزش، پژوهش، برنامه‌نویسی، رسانه، هنر، طراحی، پزشکی، کسب‌وکار، صنعت، ارتباطات و تولید محتوا
نقد و ارزیابی

هوش مصنوعی مولد یا هوش مصنوعی زایا (به انگلیسی: Generative Artificial Intelligence یا Generative AI) شاخه‌ای از هوش مصنوعی است که سامانه‌های آن با یادگیری الگوها و ساختارهای موجود در مجموعه‌های بزرگ داده قادر به تولید محتوای جدید هستند. این محتوا می‌تواند شامل متن، تصویر، صدا، موسیقی، ویدئو، کد رایانه‌ای، مدل سه‌بعدی و ترکیبی از چند نوع داده باشد.[۱]

برخلاف بسیاری از کاربردهای سنتی هوش مصنوعی که عمدتاً بر تشخیص، طبقه‌بندی، پیش‌بینی یا انتخاب میان گزینه‌های از پیش موجود متمرکز بودند، مدل‌های مولد می‌توانند بر اساس الگوهایی که در مرحلهٔ آموزش آموخته‌اند، خروجی تازه ایجاد کنند. این خروجی معمولاً بازتولید مستقیم یک نمونهٔ واحد از داده‌های آموزشی نیست، بلکه محصول محاسبات احتمالاتی مدل بر اساس ساختارهای آموخته‌شده است.[۲]

گسترش عمومی هوش مصنوعی مولد از اواخر سال ۲۰۲۲ شتاب چشمگیری یافت؛ زمانی که سامانه‌های گفت‌وگومحور مبتنی بر مدل‌های زبانی بزرگ توجه عمومی را به قابلیت تولید متن توسط ماشین جلب کردند. هم‌زمان، سامانه‌های تولید تصویر، صدا، موسیقی و ویدئو نیز پیشرفت کردند و هوش مصنوعی مولد به یکی از مهم‌ترین حوزه‌های فناوری در دههٔ ۲۰۲۰ تبدیل شد.[۳]

تعریف

مؤسسهٔ هوش مصنوعی انسان‌محور دانشگاه استنفورد، هوش مصنوعی مولد را به سامانه‌های هوش مصنوعی اطلاق می‌کند که قادر به ایجاد محتوای جدید مانند متن، تصویر، موسیقی، کد یا ویدئو هستند. این سامانه‌ها الگوهای موجود در داده‌های آموزشی را فرا می‌گیرند و خروجی‌هایی ایجاد می‌کنند که از لحاظ ساختار به داده‌های آموخته‌شده شباهت دارند.[۴]

مؤسسه ملی استانداردها و فناوری ایالات متحده (NIST) نیز هوش مصنوعی مولد را رده‌ای از مدل‌های هوش مصنوعی تعریف می‌کند که ساختار و ویژگی‌های دادهٔ ورودی را الگوبرداری می‌کنند تا محتوای مصنوعی مشتق‌شده‌ای مانند متن، تصویر، ویدئو و صدا تولید کنند.[۵]

تفاوت هوش مصنوعی و هوش مصنوعی مولد

هوش مصنوعی مفهومی گسترده‌تر از هوش مصنوعی مولد است.

سامانه‌های هوش مصنوعی می‌توانند برای شناسایی چهره، پیش‌بینی وضعیت آب‌وهوا، تشخیص بیماری، پیشنهاد محصول، ترجمهٔ زبان، هدایت خودرو، کشف تقلب یا انجام بازی طراحی شوند.

هوش مصنوعی مولد زیرمجموعه‌ای از این حوزه است که ویژگی اصلی آن تولید محتوا است.

برای نمونه، یک سامانهٔ تشخیص تصویر ممکن است مشخص کند تصویر متعلق به یک گربه است؛ اما یک مدل مولد تصویر می‌تواند بر اساس دستور کاربر تصویری تازه از یک گربه ایجاد کند.

پیشینه

ایدهٔ ساخت ماشین‌هایی که بتوانند رفتارهایی شبیه توانایی‌های شناختی انسان نشان دهند سابقه‌ای طولانی دارد.

در سال ۱۹۵۰ آلن تورینگ در مقالهٔ مشهور خود با عنوان Computing Machinery and Intelligence پرسش «آیا ماشین‌ها می‌توانند فکر کنند؟» را مطرح کرد.

در دهه‌های بعد، پژوهشگران روش‌های مختلفی برای ساخت سامانه‌های هوشمند توسعه دادند.

نسل‌های اولیهٔ هوش مصنوعی تا حد زیادی مبتنی بر قواعدی بودند که انسان برای ماشین تعریف می‌کرد.

با توسعهٔ یادگیری ماشین، رویکرد دیگری گسترش یافت: به‌جای تعریف همهٔ قواعد، سامانه از داده‌ها الگو می‌آموخت.

شبکه‌های عصبی مصنوعی

یکی از پایه‌های مهم هوش مصنوعی مولد، شبکه‌های عصبی مصنوعی است.

این شبکه‌ها ساختارهای محاسباتی متشکل از واحدهای به‌هم‌پیوسته هستند که می‌توانند روابط پیچیدهٔ موجود در داده‌ها را یاد بگیرند.

ایدهٔ اولیهٔ آنها از ساختار شبکه‌های عصبی زیستی الهام گرفته است، هرچند شبکهٔ عصبی مصنوعی مدل دقیقی از مغز انسان نیست.

با افزایش قدرت پردازنده‌ها، توسعهٔ پردازنده‌های گرافیکی و دسترسی به مجموعه‌های بزرگ داده، آموزش شبکه‌های عصبی بسیار بزرگ امکان‌پذیر شد.

یادگیری عمیق

یادگیری عمیق (Deep Learning) زیرشاخه‌ای از یادگیری ماشین است که از شبکه‌های عصبی دارای لایه‌های متعدد استفاده می‌کند.

این روش در تشخیص تصویر، گفتار، ترجمهٔ ماشینی و پردازش زبان طبیعی پیشرفت‌های مهمی ایجاد کرد.

بخش بزرگی از سامانه‌های پیشرفتهٔ هوش مصنوعی مولد بر روش‌های یادگیری عمیق استوارند.

مدل مولد

مدل مولد مدلی است که توزیع یا ساختار داده‌ها را می‌آموزد و می‌تواند نمونه‌هایی تازه بر اساس آن ایجاد کند.

اگر مدلی با مجموعهٔ بزرگی از تصاویر آموزش داده شود، می‌تواند الگوهایی مانند شکل، رنگ، بافت، نور و رابطهٔ میان اجزای تصویر را بیاموزد.

سپس بر اساس این الگوها می‌تواند تصاویر جدید تولید کند.

در مدل‌های متنی نیز سامانه روابط آماری میان واژه‌ها، نشانه‌ها و ساختارهای زبانی را فرا می‌گیرد.

شبکه‌های مولد تخاصمی

یکی از نقاط مهم در تاریخ هوش مصنوعی مولد توسعهٔ شبکه‌های مولد تخاصمی یا GAN بود.

این معماری در سال ۲۰۱۴ توسط ایان گودفلو و همکارانش معرفی شد.

GAN معمولاً از دو شبکه تشکیل می‌شود: یک شبکهٔ مولد که نمونه‌های مصنوعی ایجاد می‌کند و یک شبکهٔ تمایزدهنده که تلاش می‌کند نمونهٔ واقعی را از مصنوعی تشخیص دهد.

این دو شبکه طی فرایند آموزش با یکدیگر رقابت می‌کنند.

مولد به‌تدریج می‌آموزد خروجی‌هایی ایجاد کند که تشخیص آنها از نمونه‌های واقعی دشوارتر باشد.

GANها در توسعهٔ تولید تصویر مصنوعی نقش مهمی داشتند.

معماری ترنسفورمر

یکی از مهم‌ترین نقاط عطف در تحول هوش مصنوعی مولد معرفی معماری ترنسفورمر (Transformer) در سال ۲۰۱۷ بود.

گروهی از پژوهشگران در مقاله‌ای با عنوان Attention Is All You Need معماری جدیدی پیشنهاد کردند که اساس آن بر سازوکار توجه استوار بود.[۶]

ترنسفورمر امکان پردازش مؤثر روابط میان بخش‌های مختلف یک دنبالهٔ اطلاعاتی را فراهم کرد.

این معماری بعدها پایهٔ بسیاری از مدل‌های زبانی بزرگ و سامانه‌های هوش مصنوعی مولد شد.

سازوکار توجه

توجه یا Attention سازوکاری است که به مدل امکان می‌دهد هنگام پردازش اطلاعات، اهمیت نسبی بخش‌های مختلف ورودی را محاسبه کند.

برای مثال، در یک جمله، معنای یک واژه ممکن است به واژه‌ای وابسته باشد که چندین کلمه پیش‌تر آمده است.

سازوکار توجه به مدل کمک می‌کند چنین روابطی را در نظر بگیرد.

معماری ترنسفورمر با اتکا به این سازوکار توانست بسیاری از محدودیت‌های معماری‌های پیشین را کاهش دهد.[۷]

مدل‌های زبانی بزرگ

مدل زبانی بزرگ یا LLM نوعی مدل هوش مصنوعی است که با حجم بزرگی از داده‌های متنی آموزش می‌بیند.

این مدل‌ها روابط آماری میان واحدهای زبان را فرا می‌گیرند و می‌توانند بر اساس متن ورودی، ادامهٔ محتمل یک دنباله را تولید کنند.

در بسیاری از مدل‌ها، متن ابتدا به واحدهایی به نام توکن تبدیل می‌شود.

توکن ممکن است یک واژه، بخشی از واژه، علامت یا واحد دیگری از متن باشد.

مدل با محاسبهٔ احتمال توکن‌های بعدی، متن را مرحله‌به‌مرحله تولید می‌کند.

مدل زبانی بزرگ و هوش مصنوعی مولد

مدل زبانی بزرگ و هوش مصنوعی مولد مترادف نیستند.

هوش مصنوعی مولد مفهوم گسترده‌تری است.

مدل‌های زبانی بزرگ عمدتاً برای پردازش و تولید زبان طراحی شده‌اند، در حالی که هوش مصنوعی مولد شامل مدل‌های تولید تصویر، صدا، موسیقی، ویدئو و دیگر انواع داده نیز می‌شود.

از سوی دیگر، همهٔ سامانه‌های هوش مصنوعی مولد الزاماً مدل زبانی بزرگ نیستند.

مدل‌های بنیادین

مدل بنیادین (Foundation Model) مدلی است که با حجم گسترده‌ای از داده آموزش دیده و می‌تواند برای طیف متنوعی از وظایف سازگار شود.

یک مدل بنیادین ممکن است پس از آموزش اولیه برای خلاصه‌سازی، ترجمه، پاسخ به پرسش، تولید کد یا کاربردهای تخصصی‌تر تنظیم شود.

بسیاری از مدل‌های زبانی بزرگ معاصر نمونه‌هایی از مدل‌های بنیادین هستند.

اما «مدل بنیادین»، «مدل زبانی بزرگ» و «هوش مصنوعی مولد» سه اصطلاح دارای حوزه‌های معنایی متفاوت‌اند و نباید کاملاً مترادف در نظر گرفته شوند.

مدل‌های انتشاری

مدل‌های انتشاری (Diffusion Models) یکی دیگر از فناوری‌های مهم هوش مصنوعی مولد هستند.

این مدل‌ها به‌ویژه در تولید تصویر کاربرد گسترده‌ای یافته‌اند.

در یک توضیح ساده، طی آموزش به دادهٔ اصلی به‌تدریج نویز اضافه می‌شود و مدل می‌آموزد فرایند معکوس را انجام دهد.

پس از آموزش، مدل می‌تواند از نویز آغاز کند و طی چند مرحله آن را به تصویری دارای ساختار تبدیل کند.[۸]

مدل‌های انتشاری در توسعهٔ نسل جدید سامانه‌های تولید تصویر نقش مهمی داشته‌اند.

پرامپت

پرامپت (Prompt) دستور یا ورودی‌ای است که کاربر به سامانهٔ هوش مصنوعی مولد می‌دهد.

پرامپت می‌تواند یک پرسش ساده، دستور مفصل، متن، تصویر، فایل یا ترکیبی از آنها باشد.

برای مثال:

«تاریخ انقلاب صنعتی را در پانصد کلمه خلاصه کن.»

یا:

«تصویری از یک شهر صنعتی اروپایی در سدهٔ نوزدهم ایجاد کن.»

سامانه بر اساس دستور کاربر و الگوهای آموخته‌شده در مرحلهٔ آموزش، خروجی تولید می‌کند.

مهندسی پرامپت

مهندسی پرامپت به طراحی و تنظیم دستورها برای دریافت خروجی مناسب‌تر از مدل‌های مولد گفته می‌شود.

تعیین هدف، ارائهٔ زمینه، مشخص‌کردن قالب خروجی و تعریف محدودیت‌ها می‌تواند کیفیت پاسخ مدل را تغییر دهد.

با پیشرفت مدل‌ها، بخشی از تعامل انسان و ماشین از برنامه‌نویسی سنتی به بیان هدف با زبان طبیعی منتقل شده است.

هوش مصنوعی مولد متنی

مدل‌های مولد متنی می‌توانند فعالیت‌هایی مانند موارد زیر را انجام دهند:

  • تولید و بازنویسی متن؛
  • خلاصه‌سازی؛
  • ترجمه؛
  • پاسخ به پرسش؛
  • تولید گزارش؛
  • نگارش نامه و متن اداری؛
  • تولید داستان و شعر؛
  • توضیح مفاهیم علمی؛
  • استخراج اطلاعات؛
  • و تولید کد رایانه‌ای.

با این حال، متن تولیدشده توسط این سامانه‌ها الزاماً صحیح نیست و برای کاربردهای علمی، تاریخی، حقوقی و پزشکی نیازمند بررسی منابع معتبر است.

تولید تصویر

مدل‌های مولد تصویر می‌توانند بر اساس توصیف متنی تصاویر تازه ایجاد کنند.

کاربر ممکن است موضوع، سبک، نور، ترکیب‌بندی، زاویهٔ دوربین و عناصر مختلف تصویر را توصیف کند و مدل بر اساس این دستور تصویر تولید کند.

این فناوری در طراحی گرافیک، تبلیغات، هنر دیجیتال، معماری، بازی‌های رایانه‌ای و تولید محتوای رسانه‌ای کاربرد یافته است.

تولید ویدئو

مدل‌های مولد ویدئو می‌توانند کلیپ‌های ویدئویی را بر اساس متن، تصویر یا ویدئوی اولیه ایجاد یا تغییر دهند.

این فناوری امکان تولید حرکت، تغییر صحنه، ایجاد شخصیت و ساخت تصاویر متحرک را فراهم می‌کند.

پیشرفت این حوزه هم‌زمان نگرانی‌هایی دربارهٔ تولید ویدئوهای جعلی و دشوارترشدن تشخیص محتوای واقعی از مصنوعی ایجاد کرده است.

تولید صدا و موسیقی

هوش مصنوعی مولد می‌تواند صدا و موسیقی نیز تولید کند.

برخی مدل‌ها قادرند گفتار مصنوعی با ویژگی‌های صوتی متفاوت ایجاد کنند و برخی دیگر موسیقی را بر اساس سبک، ساز یا توصیف کاربر تولید می‌کنند.

این فناوری در دوبله، کتاب صوتی، بازی، فیلم، آموزش و تولید موسیقی کاربرد دارد.

در عین حال تقلید صدای افراد واقعی مسائل مربوط به رضایت، جعل هویت و حقوق فردی را مطرح کرده است.

تولید کد رایانه‌ای

مدل‌های زبانی بزرگ می‌توانند کد رایانه‌ای تولید و تحلیل کنند.

این سامانه‌ها قادرند بر اساس توضیح کاربر برنامه بنویسند، خطاهای کد را پیدا کنند، عملکرد کد را توضیح دهند و آن را از یک زبان برنامه‌نویسی به زبان دیگر تبدیل کنند.

هوش مصنوعی مولد به همین دلیل به یکی از ابزارهای مورد استفاده در توسعهٔ نرم‌افزار تبدیل شده است.

اما کد تولیدشده ممکن است دارای خطا یا آسیب‌پذیری امنیتی باشد و باید پیش از استفاده بررسی و آزمایش شود.

سامانه‌های چندوجهی

نسل جدیدی از سامانه‌های هوش مصنوعی مولد چندوجهی یا Multimodal هستند.

این سامانه‌ها می‌توانند بیش از یک نوع داده را پردازش کنند.

برای مثال، یک مدل ممکن است هم‌زمان متن و تصویر را دریافت کند، محتوای تصویر را تحلیل کند و پاسخ متنی ارائه دهد.

مدل‌های دیگر می‌توانند میان متن، تصویر، صدا و ویدئو ارتباط برقرار کنند.

چندوجهی‌شدن یکی از روندهای مهم توسعهٔ هوش مصنوعی مولد است.

آموزش مدل

مدل‌های مولد معمولاً با حجم بزرگی از داده آموزش داده می‌شوند.

در مرحلهٔ آموزش، الگوریتم تلاش می‌کند روابط آماری و ساختاری موجود در داده را بیاموزد.

این فرایند ممکن است به توان محاسباتی بسیار زیادی نیاز داشته باشد.

پس از آموزش اولیه، مدل می‌تواند با روش‌های مختلف برای انجام وظایف خاص تنظیم شود.

کیفیت، تنوع و ساختار داده‌های آموزشی بر عملکرد مدل تأثیر قابل توجهی دارند.

استنتاج

پس از آموزش مدل، مرحلهٔ استفاده از آن برای تولید پاسخ استنتاج (Inference) نامیده می‌شود.

هنگامی که کاربر پرامپتی وارد می‌کند، مدل بر اساس پارامترهای آموخته‌شده خروجی مناسب را محاسبه می‌کند.

در مدل‌های زبانی، این فرایند معمولاً شامل پیش‌بینی متوالی توکن‌هاست.

بنابراین پاسخ مدل از یک پایگاه دادهٔ ثابت که پاسخ‌های آماده در آن ذخیره شده باشد استخراج نمی‌شود؛ بلکه در زمان پاسخ‌گویی تولید می‌شود.

تنظیم دقیق

تنظیم دقیق یا Fine-tuning فرایندی است که طی آن یک مدل از پیش آموزش‌دیده با مجموعه‌ای از داده‌های تخصصی‌تر آموزش بیشتری می‌بیند.

برای مثال، یک مدل عمومی می‌تواند برای کاربردهای حقوقی، علمی، پزشکی یا سازمانی تنظیم شود.

این روش اجازه می‌دهد از توانایی عمومی مدل استفاده شود و هم‌زمان رفتار آن برای حوزه‌ای خاص سازگار گردد.

یادگیری از بازخورد انسانی

در برخی مدل‌های مولد از بازخورد انسان برای بهبود رفتار سامانه استفاده می‌شود.

ارزیابان انسانی ممکن است پاسخ‌های مختلف مدل را مقایسه کنند و کیفیت آنها را ارزیابی کنند.

این اطلاعات سپس برای تنظیم رفتار مدل مورد استفاده قرار می‌گیرد.

هدف این روش‌ها افزایش مفیدبودن، ایمنی و سازگاری پاسخ‌ها با دستور کاربر است.

کاربرد در آموزش

هوش مصنوعی مولد کاربردهای گسترده‌ای در آموزش یافته است.

این سامانه‌ها می‌توانند مفاهیم را توضیح دهند، تمرین تولید کنند، متون را خلاصه کنند، بازخورد ارائه دهند و محتوای آموزشی را متناسب با سطح یادگیرنده تنظیم کنند.

در عین حال استفادهٔ گسترده از آنها پرسش‌هایی دربارهٔ تقلب آموزشی، ارزیابی دانش واقعی دانش‌آموز، اعتبار منابع و وابستگی بیش از اندازه به فناوری ایجاد کرده است.

یونسکو در راهنمای خود دربارهٔ هوش مصنوعی مولد در آموزش و پژوهش بر رویکرد انسان‌محور، حفاظت از حریم خصوصی، اعتبارسنجی ابزارها و حفظ عاملیت انسانی تأکید کرده است.[۹]

کاربرد در پژوهش

پژوهشگران می‌توانند از هوش مصنوعی مولد برای کمک به جست‌وجوی مفاهیم، خلاصه‌سازی متون، تحلیل اولیهٔ داده‌ها، ترجمه، برنامه‌نویسی و تهیهٔ پیش‌نویس استفاده کنند.

اما استفادهٔ علمی از این ابزارها مستلزم راستی‌آزمایی است.

مدل ممکن است مقاله، نام نویسنده، تاریخ، نقل‌قول یا شناسهٔ دیجیتال نادرستی تولید کند.

بنابراین هوش مصنوعی مولد نمی‌تواند بدون بررسی مستقل جایگزین مراجعه به منابع اصلی شود.

کاربرد در پزشکی

هوش مصنوعی مولد در پزشکی برای تولید یا خلاصه‌سازی گزارش‌های بالینی، کمک به تحلیل اطلاعات، آموزش پزشکی و پژوهش مورد بررسی قرار گرفته است.

با این حال خطای مدل در این حوزه می‌تواند پیامدهای جدی داشته باشد.

به همین دلیل استفادهٔ پزشکی از این فناوری نیازمند نظارت متخصص، حفاظت از اطلاعات بیماران و ارزیابی دقیق اعتبار سامانه است.

کاربرد در رسانه و روزنامه‌نگاری

هوش مصنوعی مولد می‌تواند برای خلاصه‌سازی اسناد، پیاده‌سازی مصاحبه، ترجمه، تولید پیش‌نویس و تحلیل مجموعه‌های بزرگ متن مورد استفاده قرار گیرد.

در مقابل، همین فناوری امکان تولید سریع اطلاعات جعلی، تصویر ساختگی و جعل صدا و ویدئو را نیز فراهم کرده است.

بنابراین گسترش هوش مصنوعی مولد اهمیت راستی‌آزمایی دیجیتال و بررسی منشأ محتوا را افزایش داده است.

کاربرد در هنر

مدل‌های مولد می‌توانند تصویر، موسیقی، شعر، داستان و طراحی ایجاد کنند.

این قابلیت بحث گسترده‌ای دربارهٔ مفهوم خلاقیت ایجاد کرده است.

برخی هنرمندان از هوش مصنوعی به‌عنوان ابزار جدید تولید اثر استفاده می‌کنند.

در مقابل، دربارهٔ استفاده از آثار هنرمندان در داده‌های آموزشی، تقلید سبک و مالکیت آثار تولیدشده اختلاف نظرهای حقوقی و اخلاقی وجود دارد.

توهم هوش مصنوعی

یکی از مهم‌ترین محدودیت‌های مدل‌های مولد پدیده‌ای است که معمولاً توهم (Hallucination) نامیده می‌شود.

مدل ممکن است پاسخی تولید کند که از نظر زبانی منسجم و متقاعدکننده به نظر برسد، اما از نظر واقعی نادرست باشد.

برای مثال ممکن است:

  • منبعی غیرواقعی معرفی کند؛
  • تاریخ نادرستی ارائه دهد؛
  • نام شخص یا کتابی را بسازد؛
  • نقل‌قولی را به فردی نسبت دهد که آن را بیان نکرده است؛
  • یا از دادهٔ ناقص نتیجه‌گیری نادرست کند.

این مسئله از تفاوت بنیادی میان تولید متن محتمل و اثبات حقیقت ناشی می‌شود.

هوش مصنوعی مولد و حقیقت

مدل زبانی برای تولید جمله‌ای که از لحاظ آماری و ساختاری مناسب باشد آموزش می‌بیند؛ این امر به‌خودی‌خود تضمین نمی‌کند که جمله از نظر تاریخی یا علمی درست باشد.

به همین دلیل، توانایی تولید زبان روان را نباید با دسترسی مستقل به حقیقت یکسان دانست.

در کاربردهای دانشنامه‌ای، علمی و روزنامه‌نگاری باید میان تولید پاسخ و اثبات ادعا تمایز گذاشت.

منابع مستقل و قابل راستی‌آزمایی همچنان برای اثبات ادعاهای factual ضروری‌اند.

سوگیری

مدل‌های مولد ممکن است برخی سوگیری‌های موجود در داده‌های آموزشی را بازتاب دهند.

اگر مجموعهٔ داده شامل کلیشه‌ها، تبعیض یا عدم توازن فرهنگی و زبانی باشد، این ویژگی‌ها می‌توانند بر خروجی مدل اثر بگذارند.

روش‌های مختلفی برای کاهش این مشکل به کار گرفته می‌شود، اما حذف کامل سوگیری از سامانه‌های پیچیده دشوار است.

این مسئله به‌ویژه در کاربردهایی که بر افراد یا گروه‌های اجتماعی تأثیر می‌گذارند اهمیت دارد.

حریم خصوصی

استفاده از هوش مصنوعی مولد پرسش‌هایی دربارهٔ حریم خصوصی ایجاد کرده است.

کاربران ممکن است اطلاعات شخصی یا محرمانه را در اختیار یک سامانه قرار دهند.

همچنین داده‌های مورد استفاده برای آموزش مدل ممکن است شامل اطلاعات شخصی باشند.

یونسکو حفاظت از حریم خصوصی کاربران را از مسائل اساسی در سیاست‌گذاری هوش مصنوعی مولد دانسته است.[۱۰]

مالکیت فکری

مالکیت فکری یکی از مناقشه‌برانگیزترین مسائل هوش مصنوعی مولد است.

مدل‌ها برای آموزش به حجم بسیار بزرگی از متن، تصویر، صدا و دیگر داده‌ها نیاز دارند.

بخشی از این داده‌ها ممکن است تحت حمایت حق مؤلف قرار داشته باشند.

از این رو پرسش‌هایی مطرح شده است:

آیا استفاده از آثار دارای حق مؤلف برای آموزش مدل مجاز است؟

حقوق اثر تولیدشده توسط هوش مصنوعی متعلق به چه کسی است؟

تا چه اندازه می‌توان سبک یک هنرمند را تقلید کرد؟

پاسخ حقوقی به این مسائل در حوزه‌های قضایی مختلف همچنان در حال تحول است.

دیپ‌فیک

دیپ‌فیک به محتوای مصنوعی یا دستکاری‌شده‌ای گفته می‌شود که می‌تواند تصویر، صدا یا ویدئوی فردی را به‌گونه‌ای واقع‌نما بازسازی کند.

هوش مصنوعی مولد ساخت چنین محتوایی را آسان‌تر و ارزان‌تر کرده است.

دیپ‌فیک می‌تواند در سرگرمی و هنر کاربرد داشته باشد، اما برای جعل هویت، فریب، انتشار اطلاعات نادرست و دستکاری افکار عمومی نیز قابل استفاده است.

استنفورد نیز اطلاعات نادرست و دیپ‌فیک را از زمینه‌های سوءاستفاده احتمالی هوش مصنوعی مولد ذکر کرده است.[۱۱]

اطلاعات نادرست

توانایی تولید انبوه متن، تصویر، صدا و ویدئو هزینهٔ ایجاد محتوای جعلی را کاهش داده است.

یک تولیدکنندهٔ محتوا می‌تواند با استفاده از مدل‌های مولد تعداد زیادی مقاله، پیام یا تصویر مصنوعی ایجاد کند.

این توانایی نگرانی‌هایی دربارهٔ عملیات اطلاعاتی، تبلیغات گمراه‌کننده و انتشار سازمان‌یافتهٔ اطلاعات نادرست ایجاد کرده است.

در نتیجه، توسعهٔ ابزارهای تشخیص محتوا، اعتبارسنجی منابع و سواد رسانه‌ای اهمیت بیشتری یافته است.

خطرهای هوش مصنوعی مولد

مؤسسه ملی استانداردها و فناوری ایالات متحده در سال ۲۰۲۴ چارچوب ویژه‌ای برای مدیریت خطرهای هوش مصنوعی مولد منتشر کرد.

این چارچوب به خطرهایی اشاره می‌کند که ممکن است مختص هوش مصنوعی مولد باشند یا استفاده از این فناوری آنها را تشدید کند و مجموعه‌ای از اقدامات را برای شناسایی، اندازه‌گیری و مدیریت این خطرها پیشنهاد می‌دهد.[۱۲]

از مهم‌ترین حوزه‌های نگرانی می‌توان به صحت اطلاعات، امنیت، حریم خصوصی، محتوای زیان‌آور، سوگیری، مالکیت فکری، جعل هویت و وابستگی بیش از اندازهٔ انسان به سامانه‌های خودکار اشاره کرد.

هوش مصنوعی مولد و اشتغال

گسترش هوش مصنوعی مولد بحث گسترده‌ای دربارهٔ آیندهٔ کار ایجاد کرده است.

برخی فعالیت‌های متنی، طراحی، ترجمه، برنامه‌نویسی و پردازش اطلاعات را می‌توان تا حدی خودکار کرد.

اما فناوری‌های جدید معمولاً علاوه بر حذف یا تغییر برخی وظایف، وظایف و مشاغل تازه‌ای نیز ایجاد می‌کنند.

از این رو اثر نهایی هوش مصنوعی مولد بر اشتغال تنها به توانایی فنی مدل‌ها بستگی ندارد؛ هزینهٔ فناوری، قوانین، ساختار سازمان‌ها، آموزش نیروی انسانی و تصمیم کارفرمایان نیز در آن مؤثر است.

هوش مصنوعی مولد و خلاقیت انسانی

یکی از مباحث فلسفی مهم این است که آیا محتوای تولیدشده توسط ماشین را می‌توان «خلاقیت» نامید.

مدل‌های مولد می‌توانند ترکیب‌هایی ایجاد کنند که پیش‌تر دقیقاً به همان صورت وجود نداشته‌اند.

اما این مدل‌ها تجربهٔ زیسته، قصد هنری و آگاهی انسانی را به معنایی که دربارهٔ انسان به کار می‌رود ندارند.

از این رو میان تولید محتوای جدید و خلاقیت انسانی تمایز مفهومی وجود دارد.

این مسئله همچنان موضوع بحث در فلسفهٔ ذهن، زیبایی‌شناسی و علوم شناختی است.

آیا هوش مصنوعی مولد می‌فهمد؟

توانایی مدل‌های زبانی در تولید پاسخ‌های پیچیده بحثی فلسفی دربارهٔ مفهوم «فهم» ایجاد کرده است.

از یک سو، این مدل‌ها قادرند روابط پیچیدهٔ زبانی را پردازش و مسائل متعددی را حل کنند.

از سوی دیگر، عملکرد آنها بر محاسبات عددی و الگوهای آموخته‌شده استوار است و دربارهٔ اینکه آیا چنین عملکردی را باید «فهم» به معنای انسانی نامید، اجماع وجود ندارد.

این بحث با پرسش‌های قدیمی‌تر فلسفه ذهن دربارهٔ هوش، زبان و آگاهی ارتباط دارد.

هوش مصنوعی مولد و آگاهی

توانایی تولید زبان طبیعی نباید به‌خودی‌خود شاهدی بر وجود آگاهی تلقی شود.

سامانه ممکن است دربارهٔ احساسات، ترس، امید یا تجربهٔ شخصی جمله تولید کند، زیرا الگوهای زبانی مرتبط با این مفاهیم را آموخته است.

این امر به‌تنهایی اثبات نمی‌کند که مدل تجربهٔ ذهنی مشابه انسان دارد.

مسئلهٔ امکان آگاهی ماشین همچنان پرسشی باز در فلسفه و علوم شناختی است.

رویکرد انسان‌محور

یکی از رویکردهای مهم در سیاست‌گذاری هوش مصنوعی، هوش مصنوعی انسان‌محور است.

در این دیدگاه فناوری باید در خدمت توانمندسازی انسان قرار گیرد و تصمیم‌گیری دربارهٔ اهداف و ارزش‌ها در اختیار انسان باقی بماند.

یونسکو در راهنمای هوش مصنوعی مولد در آموزش و پژوهش بر حفظ عاملیت انسانی، فراگیری، برابری، تنوع فرهنگی و زبانی و استفادهٔ اخلاقی از فناوری تأکید کرده است.[۱۳]

تنظیم‌گری

گسترش سریع هوش مصنوعی مولد دولت‌ها و نهادهای بین‌المللی را با مسئلهٔ تنظیم‌گری مواجه کرده است.

موضوعاتی مانند حفاظت از داده، شفافیت، مسئولیت در برابر خسارت، حق مؤلف، امنیت، تبعیض الگوریتمی و استفاده از هوش مصنوعی در تصمیم‌های حساس از محورهای اصلی سیاست‌گذاری هستند.

یکی از دشواری‌های تنظیم‌گری، سرعت تحول فناوری است. مدل‌ها و قابلیت‌های جدید ممکن است سریع‌تر از فرایند قانون‌گذاری توسعه یابند.

یونسکو نیز در راهنمای خود به فاصله میان سرعت توسعهٔ ابزارهای مولد و سازگاری چارچوب‌های قانونی کشورها اشاره کرده است.[۱۴]

هوش مصنوعی مولد و زبان فارسی

مدل‌های مولد امکان تولید، ترجمه و پردازش متن فارسی را نیز فراهم کرده‌اند.

این فناوری می‌تواند در ترجمه، آموزش زبان، پژوهش، تولید محتوا، دسترسی به دانش و پردازش اسناد فارسی کاربرد داشته باشد.

با این حال عملکرد مدل‌ها در همهٔ زبان‌ها یکسان نیست.

حجم و کیفیت داده‌های آموزشی هر زبان، تنوع منابع و کیفیت ارزیابی‌ها بر توانایی مدل تأثیر می‌گذارند.

این مسئله اهمیت توسعهٔ داده‌ها و معیارهای ارزیابی باکیفیت برای زبان فارسی را افزایش می‌دهد.

هوش مصنوعی مولد و دانشنامه‌ها

هوش مصنوعی مولد می‌تواند در تدوین مقاله‌های دانشنامه‌ای برای سازمان‌دهی مطالب، پیشنهاد ساختار، خلاصه‌سازی منابع، ترجمه و ویرایش مورد استفاده قرار گیرد.

اما یکی از خطرهای اصلی در این کاربرد، تولید منابع یا اطلاعات غیرواقعی است.

به همین دلیل در نگارش دانشنامه‌ای باید هر ادعای مهم به منبع واقعی و قابل بررسی متصل شود.

هوش مصنوعی می‌تواند ابزار پژوهش و نگارش باشد، اما مسئولیت راستی‌آزمایی و تصمیم نهایی دربارهٔ انتشار اطلاعات همچنان بر عهدهٔ انسان و نهاد منتشرکننده است.

محدودیت‌ها

با وجود پیشرفت سریع، هوش مصنوعی مولد محدودیت‌های مهمی دارد.

این مدل‌ها ممکن است اطلاعات نادرست تولید کنند، زمینهٔ پرسش را اشتباه بفهمند، در محاسبات خطا کنند یا دربارهٔ موضوعی که اطلاعات کافی ندارند پاسخ بسیار مطمئن ارائه دهند.

عملکرد آنها همچنین می‌تواند تحت تأثیر داده‌های آموزشی، نحوهٔ طرح پرسش و طراحی سامانه قرار گیرد.

بنابراین روان‌بودن پاسخ نباید با صحت آن اشتباه گرفته شود.

آیندهٔ هوش مصنوعی مولد

هوش مصنوعی مولد همچنان حوزه‌ای در حال تحول سریع است.

چندوجهی‌شدن مدل‌ها، افزایش توانایی استدلال و استفاده از ابزارها، تعامل صوتی و تصویری، کاربردهای تخصصی و ادغام هوش مصنوعی در نرم‌افزارهای روزمره از مسیرهای اصلی توسعهٔ این فناوری هستند.

در کنار افزایش قابلیت‌ها، مسائل مربوط به ایمنی، اعتماد، حریم خصوصی، حقوق مؤلف، تأثیر بر بازار کار و نحوهٔ کنترل سامانه‌های قدرتمندتر نیز اهمیت بیشتری پیدا کرده‌اند.

NIST برای پاسخ به بخشی از این چالش‌ها چارچوب مدیریت ریسک ویژهٔ هوش مصنوعی مولد را تدوین کرده است که هدف آن کمک به سازمان‌ها برای مدیریت خطرها در مراحل مختلف چرخهٔ عمر سامانه‌های هوش مصنوعی است.[۱۵]

اهمیت تاریخی

هوش مصنوعی مولد را می‌توان یکی از مراحل مهم تحول رابطهٔ انسان و رایانه دانست.

در نسل‌های اولیهٔ رایانه، انسان باید دستورات را با زبان‌های تخصصی برنامه‌نویسی بیان می‌کرد.

رابط‌های گرافیکی کار با رایانه را آسان‌تر کردند.

مدل‌های مولد مرحلهٔ دیگری را شکل داده‌اند که در آن انسان می‌تواند بسیاری از اهداف خود را با زبان طبیعی بیان کند و از ماشین بخواهد متن، تصویر، کد، صدا یا محتوای دیگر تولید کند.

اهمیت این تحول تنها در خودکارسازی نیست؛ بلکه در تبدیل زبان طبیعی به یکی از رابط‌های اصلی میان انسان و سامانه‌های محاسباتی نیز هست.

جمع‌بندی

هوش مصنوعی مولد شاخه‌ای از هوش مصنوعی است که با یادگیری الگوهای موجود در داده‌ها می‌تواند محتوای جدید تولید کند. متن، تصویر، صدا، موسیقی، ویدئو و کد از مهم‌ترین انواع این محتوا هستند.[۱۶]

پیشرفت شبکه‌های عصبی، یادگیری عمیق، شبکه‌های مولد تخاصمی، معماری ترنسفورمر و مدل‌های انتشاری زمینهٔ توسعهٔ نسل کنونی این فناوری را فراهم کردند. مقالهٔ Attention Is All You Need در سال ۲۰۱۷ با معرفی معماری ترنسفورمر یکی از نقاط مهم این تحول بود.[۱۷]

گسترش عمومی مدل‌های مولد در دههٔ ۲۰۲۰ کاربرد هوش مصنوعی را از ابزارهای تخصصی به فعالیت‌های روزمره‌ای مانند نوشتن، آموزش، برنامه‌نویسی، پژوهش و تولید تصویر گسترش داده است.

در عین حال، توانایی تولید محتوا مشکلات تازه‌ای نیز ایجاد کرده است. توهم و تولید اطلاعات نادرست، دیپ‌فیک، سوگیری، حفاظت از حریم خصوصی، مالکیت فکری، امنیت و تأثیر بر اشتغال از مهم‌ترین مسائل مرتبط با این فناوری‌اند. NIST به همین دلیل در سال ۲۰۲۴ چارچوب ویژه‌ای برای شناسایی و مدیریت خطرهای هوش مصنوعی مولد منتشر کرد.[۱۸]

از منظر دانشنامه‌ای، هوش مصنوعی مولد را نباید با «هوش انسانی» یا حتی کل حوزهٔ هوش مصنوعی یکسان دانست. این فناوری مجموعه‌ای از مدل‌ها و روش‌های محاسباتی برای یادگیری ساختار داده و تولید خروجی‌های جدید است. توانایی چشمگیر این سامانه‌ها در تولید زبان و تصویر نیز به‌خودی‌خود اثبات‌کنندهٔ آگاهی، تجربهٔ ذهنی یا فهم انسانی نیست.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Bengio, Yoshua, Ian Goodfellow, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016.
  • Goodfellow, Ian J., et al. “Generative Adversarial Nets.” In Advances in Neural Information Processing Systems 27, 2014.
  • Miao, Fengchun, and Wayne Holmes. Guidance for Generative AI in Education and Research. Paris: UNESCO, 2023.
  • National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI 600-1. Gaithersburg, MD: NIST, 2024.
  • Russell, Stuart, and Peter Norvig. Artificial Intelligence: A Modern Approach. 4th ed. Pearson, 2021.
  • Turing, Alan M. “Computing Machinery and Intelligence.” Mind 59, no. 236 (1950): 433–460.
  • Vaswani, Ashish, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, and Illia Polosukhin. “Attention Is All You Need.” 2017.