هوش مصنوعی مولد
| شناسنامه | |
|---|---|
| نامهای دیگر | هوش مصنوعی زایا، هوش مصنوعی تولیدگر، Generative AI، GenAI |
| حوزه | هوش مصنوعی، یادگیری ماشین، یادگیری عمیق، علوم رایانه، پردازش زبان طبیعی، بینایی ماشین |
| خاستگاه | علوم رایانه، آمار، نظریهٔ اطلاعات، شبکههای عصبی مصنوعی و یادگیری ماشین |
| اندیشه و تاریخ | |
| مفاهیم کلیدی | مدل مولد، دادهٔ آموزشی، شبکهٔ عصبی، مدل زبانی بزرگ، ترنسفورمر، توکن، پرامپت، مدل انتشاری، آموزش، استنتاج، محتوای مصنوعی، چندوجهی |
| جریانهای مرتبط | هوش مصنوعی، یادگیری ماشین، یادگیری عمیق، مدلهای زبانی بزرگ، مدلهای بنیادین، شبکههای مولد تخاصمی، مدلهای انتشاری، پردازش زبان طبیعی |
| تأثیرپذیرفته از | آمار، نظریهٔ احتمال، علوم رایانه، علوم شناختی، شبکههای عصبی، یادگیری ماشین و افزایش توان محاسباتی |
| تأثیرگذار بر | آموزش، پژوهش، برنامهنویسی، رسانه، هنر، طراحی، پزشکی، کسبوکار، صنعت، ارتباطات و تولید محتوا |
| نقد و ارزیابی | |
هوش مصنوعی مولد یا هوش مصنوعی زایا (به انگلیسی: Generative Artificial Intelligence یا Generative AI) شاخهای از هوش مصنوعی است که سامانههای آن با یادگیری الگوها و ساختارهای موجود در مجموعههای بزرگ داده قادر به تولید محتوای جدید هستند. این محتوا میتواند شامل متن، تصویر، صدا، موسیقی، ویدئو، کد رایانهای، مدل سهبعدی و ترکیبی از چند نوع داده باشد.[۱]
برخلاف بسیاری از کاربردهای سنتی هوش مصنوعی که عمدتاً بر تشخیص، طبقهبندی، پیشبینی یا انتخاب میان گزینههای از پیش موجود متمرکز بودند، مدلهای مولد میتوانند بر اساس الگوهایی که در مرحلهٔ آموزش آموختهاند، خروجی تازه ایجاد کنند. این خروجی معمولاً بازتولید مستقیم یک نمونهٔ واحد از دادههای آموزشی نیست، بلکه محصول محاسبات احتمالاتی مدل بر اساس ساختارهای آموختهشده است.[۲]
گسترش عمومی هوش مصنوعی مولد از اواخر سال ۲۰۲۲ شتاب چشمگیری یافت؛ زمانی که سامانههای گفتوگومحور مبتنی بر مدلهای زبانی بزرگ توجه عمومی را به قابلیت تولید متن توسط ماشین جلب کردند. همزمان، سامانههای تولید تصویر، صدا، موسیقی و ویدئو نیز پیشرفت کردند و هوش مصنوعی مولد به یکی از مهمترین حوزههای فناوری در دههٔ ۲۰۲۰ تبدیل شد.[۳]
تعریف
مؤسسهٔ هوش مصنوعی انسانمحور دانشگاه استنفورد، هوش مصنوعی مولد را به سامانههای هوش مصنوعی اطلاق میکند که قادر به ایجاد محتوای جدید مانند متن، تصویر، موسیقی، کد یا ویدئو هستند. این سامانهها الگوهای موجود در دادههای آموزشی را فرا میگیرند و خروجیهایی ایجاد میکنند که از لحاظ ساختار به دادههای آموختهشده شباهت دارند.[۴]
مؤسسه ملی استانداردها و فناوری ایالات متحده (NIST) نیز هوش مصنوعی مولد را ردهای از مدلهای هوش مصنوعی تعریف میکند که ساختار و ویژگیهای دادهٔ ورودی را الگوبرداری میکنند تا محتوای مصنوعی مشتقشدهای مانند متن، تصویر، ویدئو و صدا تولید کنند.[۵]
تفاوت هوش مصنوعی و هوش مصنوعی مولد
هوش مصنوعی مفهومی گستردهتر از هوش مصنوعی مولد است.
سامانههای هوش مصنوعی میتوانند برای شناسایی چهره، پیشبینی وضعیت آبوهوا، تشخیص بیماری، پیشنهاد محصول، ترجمهٔ زبان، هدایت خودرو، کشف تقلب یا انجام بازی طراحی شوند.
هوش مصنوعی مولد زیرمجموعهای از این حوزه است که ویژگی اصلی آن تولید محتوا است.
برای نمونه، یک سامانهٔ تشخیص تصویر ممکن است مشخص کند تصویر متعلق به یک گربه است؛ اما یک مدل مولد تصویر میتواند بر اساس دستور کاربر تصویری تازه از یک گربه ایجاد کند.
پیشینه
ایدهٔ ساخت ماشینهایی که بتوانند رفتارهایی شبیه تواناییهای شناختی انسان نشان دهند سابقهای طولانی دارد.
در سال ۱۹۵۰ آلن تورینگ در مقالهٔ مشهور خود با عنوان Computing Machinery and Intelligence پرسش «آیا ماشینها میتوانند فکر کنند؟» را مطرح کرد.
در دهههای بعد، پژوهشگران روشهای مختلفی برای ساخت سامانههای هوشمند توسعه دادند.
نسلهای اولیهٔ هوش مصنوعی تا حد زیادی مبتنی بر قواعدی بودند که انسان برای ماشین تعریف میکرد.
با توسعهٔ یادگیری ماشین، رویکرد دیگری گسترش یافت: بهجای تعریف همهٔ قواعد، سامانه از دادهها الگو میآموخت.
شبکههای عصبی مصنوعی
یکی از پایههای مهم هوش مصنوعی مولد، شبکههای عصبی مصنوعی است.
این شبکهها ساختارهای محاسباتی متشکل از واحدهای بههمپیوسته هستند که میتوانند روابط پیچیدهٔ موجود در دادهها را یاد بگیرند.
ایدهٔ اولیهٔ آنها از ساختار شبکههای عصبی زیستی الهام گرفته است، هرچند شبکهٔ عصبی مصنوعی مدل دقیقی از مغز انسان نیست.
با افزایش قدرت پردازندهها، توسعهٔ پردازندههای گرافیکی و دسترسی به مجموعههای بزرگ داده، آموزش شبکههای عصبی بسیار بزرگ امکانپذیر شد.
یادگیری عمیق
یادگیری عمیق (Deep Learning) زیرشاخهای از یادگیری ماشین است که از شبکههای عصبی دارای لایههای متعدد استفاده میکند.
این روش در تشخیص تصویر، گفتار، ترجمهٔ ماشینی و پردازش زبان طبیعی پیشرفتهای مهمی ایجاد کرد.
بخش بزرگی از سامانههای پیشرفتهٔ هوش مصنوعی مولد بر روشهای یادگیری عمیق استوارند.
مدل مولد
مدل مولد مدلی است که توزیع یا ساختار دادهها را میآموزد و میتواند نمونههایی تازه بر اساس آن ایجاد کند.
اگر مدلی با مجموعهٔ بزرگی از تصاویر آموزش داده شود، میتواند الگوهایی مانند شکل، رنگ، بافت، نور و رابطهٔ میان اجزای تصویر را بیاموزد.
سپس بر اساس این الگوها میتواند تصاویر جدید تولید کند.
در مدلهای متنی نیز سامانه روابط آماری میان واژهها، نشانهها و ساختارهای زبانی را فرا میگیرد.
شبکههای مولد تخاصمی
یکی از نقاط مهم در تاریخ هوش مصنوعی مولد توسعهٔ شبکههای مولد تخاصمی یا GAN بود.
این معماری در سال ۲۰۱۴ توسط ایان گودفلو و همکارانش معرفی شد.
GAN معمولاً از دو شبکه تشکیل میشود: یک شبکهٔ مولد که نمونههای مصنوعی ایجاد میکند و یک شبکهٔ تمایزدهنده که تلاش میکند نمونهٔ واقعی را از مصنوعی تشخیص دهد.
این دو شبکه طی فرایند آموزش با یکدیگر رقابت میکنند.
مولد بهتدریج میآموزد خروجیهایی ایجاد کند که تشخیص آنها از نمونههای واقعی دشوارتر باشد.
GANها در توسعهٔ تولید تصویر مصنوعی نقش مهمی داشتند.
معماری ترنسفورمر
یکی از مهمترین نقاط عطف در تحول هوش مصنوعی مولد معرفی معماری ترنسفورمر (Transformer) در سال ۲۰۱۷ بود.
گروهی از پژوهشگران در مقالهای با عنوان Attention Is All You Need معماری جدیدی پیشنهاد کردند که اساس آن بر سازوکار توجه استوار بود.[۶]
ترنسفورمر امکان پردازش مؤثر روابط میان بخشهای مختلف یک دنبالهٔ اطلاعاتی را فراهم کرد.
این معماری بعدها پایهٔ بسیاری از مدلهای زبانی بزرگ و سامانههای هوش مصنوعی مولد شد.
سازوکار توجه
توجه یا Attention سازوکاری است که به مدل امکان میدهد هنگام پردازش اطلاعات، اهمیت نسبی بخشهای مختلف ورودی را محاسبه کند.
برای مثال، در یک جمله، معنای یک واژه ممکن است به واژهای وابسته باشد که چندین کلمه پیشتر آمده است.
سازوکار توجه به مدل کمک میکند چنین روابطی را در نظر بگیرد.
معماری ترنسفورمر با اتکا به این سازوکار توانست بسیاری از محدودیتهای معماریهای پیشین را کاهش دهد.[۷]
مدلهای زبانی بزرگ
مدل زبانی بزرگ یا LLM نوعی مدل هوش مصنوعی است که با حجم بزرگی از دادههای متنی آموزش میبیند.
این مدلها روابط آماری میان واحدهای زبان را فرا میگیرند و میتوانند بر اساس متن ورودی، ادامهٔ محتمل یک دنباله را تولید کنند.
در بسیاری از مدلها، متن ابتدا به واحدهایی به نام توکن تبدیل میشود.
توکن ممکن است یک واژه، بخشی از واژه، علامت یا واحد دیگری از متن باشد.
مدل با محاسبهٔ احتمال توکنهای بعدی، متن را مرحلهبهمرحله تولید میکند.
مدل زبانی بزرگ و هوش مصنوعی مولد
مدل زبانی بزرگ و هوش مصنوعی مولد مترادف نیستند.
هوش مصنوعی مولد مفهوم گستردهتری است.
مدلهای زبانی بزرگ عمدتاً برای پردازش و تولید زبان طراحی شدهاند، در حالی که هوش مصنوعی مولد شامل مدلهای تولید تصویر، صدا، موسیقی، ویدئو و دیگر انواع داده نیز میشود.
از سوی دیگر، همهٔ سامانههای هوش مصنوعی مولد الزاماً مدل زبانی بزرگ نیستند.
مدلهای بنیادین
مدل بنیادین (Foundation Model) مدلی است که با حجم گستردهای از داده آموزش دیده و میتواند برای طیف متنوعی از وظایف سازگار شود.
یک مدل بنیادین ممکن است پس از آموزش اولیه برای خلاصهسازی، ترجمه، پاسخ به پرسش، تولید کد یا کاربردهای تخصصیتر تنظیم شود.
بسیاری از مدلهای زبانی بزرگ معاصر نمونههایی از مدلهای بنیادین هستند.
اما «مدل بنیادین»، «مدل زبانی بزرگ» و «هوش مصنوعی مولد» سه اصطلاح دارای حوزههای معنایی متفاوتاند و نباید کاملاً مترادف در نظر گرفته شوند.
مدلهای انتشاری
مدلهای انتشاری (Diffusion Models) یکی دیگر از فناوریهای مهم هوش مصنوعی مولد هستند.
این مدلها بهویژه در تولید تصویر کاربرد گستردهای یافتهاند.
در یک توضیح ساده، طی آموزش به دادهٔ اصلی بهتدریج نویز اضافه میشود و مدل میآموزد فرایند معکوس را انجام دهد.
پس از آموزش، مدل میتواند از نویز آغاز کند و طی چند مرحله آن را به تصویری دارای ساختار تبدیل کند.[۸]
مدلهای انتشاری در توسعهٔ نسل جدید سامانههای تولید تصویر نقش مهمی داشتهاند.
پرامپت
پرامپت (Prompt) دستور یا ورودیای است که کاربر به سامانهٔ هوش مصنوعی مولد میدهد.
پرامپت میتواند یک پرسش ساده، دستور مفصل، متن، تصویر، فایل یا ترکیبی از آنها باشد.
برای مثال:
«تاریخ انقلاب صنعتی را در پانصد کلمه خلاصه کن.»
یا:
«تصویری از یک شهر صنعتی اروپایی در سدهٔ نوزدهم ایجاد کن.»
سامانه بر اساس دستور کاربر و الگوهای آموختهشده در مرحلهٔ آموزش، خروجی تولید میکند.
مهندسی پرامپت
مهندسی پرامپت به طراحی و تنظیم دستورها برای دریافت خروجی مناسبتر از مدلهای مولد گفته میشود.
تعیین هدف، ارائهٔ زمینه، مشخصکردن قالب خروجی و تعریف محدودیتها میتواند کیفیت پاسخ مدل را تغییر دهد.
با پیشرفت مدلها، بخشی از تعامل انسان و ماشین از برنامهنویسی سنتی به بیان هدف با زبان طبیعی منتقل شده است.
هوش مصنوعی مولد متنی
مدلهای مولد متنی میتوانند فعالیتهایی مانند موارد زیر را انجام دهند:
- تولید و بازنویسی متن؛
- خلاصهسازی؛
- ترجمه؛
- پاسخ به پرسش؛
- تولید گزارش؛
- نگارش نامه و متن اداری؛
- تولید داستان و شعر؛
- توضیح مفاهیم علمی؛
- استخراج اطلاعات؛
- و تولید کد رایانهای.
با این حال، متن تولیدشده توسط این سامانهها الزاماً صحیح نیست و برای کاربردهای علمی، تاریخی، حقوقی و پزشکی نیازمند بررسی منابع معتبر است.
تولید تصویر
مدلهای مولد تصویر میتوانند بر اساس توصیف متنی تصاویر تازه ایجاد کنند.
کاربر ممکن است موضوع، سبک، نور، ترکیببندی، زاویهٔ دوربین و عناصر مختلف تصویر را توصیف کند و مدل بر اساس این دستور تصویر تولید کند.
این فناوری در طراحی گرافیک، تبلیغات، هنر دیجیتال، معماری، بازیهای رایانهای و تولید محتوای رسانهای کاربرد یافته است.
تولید ویدئو
مدلهای مولد ویدئو میتوانند کلیپهای ویدئویی را بر اساس متن، تصویر یا ویدئوی اولیه ایجاد یا تغییر دهند.
این فناوری امکان تولید حرکت، تغییر صحنه، ایجاد شخصیت و ساخت تصاویر متحرک را فراهم میکند.
پیشرفت این حوزه همزمان نگرانیهایی دربارهٔ تولید ویدئوهای جعلی و دشوارترشدن تشخیص محتوای واقعی از مصنوعی ایجاد کرده است.
تولید صدا و موسیقی
هوش مصنوعی مولد میتواند صدا و موسیقی نیز تولید کند.
برخی مدلها قادرند گفتار مصنوعی با ویژگیهای صوتی متفاوت ایجاد کنند و برخی دیگر موسیقی را بر اساس سبک، ساز یا توصیف کاربر تولید میکنند.
این فناوری در دوبله، کتاب صوتی، بازی، فیلم، آموزش و تولید موسیقی کاربرد دارد.
در عین حال تقلید صدای افراد واقعی مسائل مربوط به رضایت، جعل هویت و حقوق فردی را مطرح کرده است.
تولید کد رایانهای
مدلهای زبانی بزرگ میتوانند کد رایانهای تولید و تحلیل کنند.
این سامانهها قادرند بر اساس توضیح کاربر برنامه بنویسند، خطاهای کد را پیدا کنند، عملکرد کد را توضیح دهند و آن را از یک زبان برنامهنویسی به زبان دیگر تبدیل کنند.
هوش مصنوعی مولد به همین دلیل به یکی از ابزارهای مورد استفاده در توسعهٔ نرمافزار تبدیل شده است.
اما کد تولیدشده ممکن است دارای خطا یا آسیبپذیری امنیتی باشد و باید پیش از استفاده بررسی و آزمایش شود.
سامانههای چندوجهی
نسل جدیدی از سامانههای هوش مصنوعی مولد چندوجهی یا Multimodal هستند.
این سامانهها میتوانند بیش از یک نوع داده را پردازش کنند.
برای مثال، یک مدل ممکن است همزمان متن و تصویر را دریافت کند، محتوای تصویر را تحلیل کند و پاسخ متنی ارائه دهد.
مدلهای دیگر میتوانند میان متن، تصویر، صدا و ویدئو ارتباط برقرار کنند.
چندوجهیشدن یکی از روندهای مهم توسعهٔ هوش مصنوعی مولد است.
آموزش مدل
مدلهای مولد معمولاً با حجم بزرگی از داده آموزش داده میشوند.
در مرحلهٔ آموزش، الگوریتم تلاش میکند روابط آماری و ساختاری موجود در داده را بیاموزد.
این فرایند ممکن است به توان محاسباتی بسیار زیادی نیاز داشته باشد.
پس از آموزش اولیه، مدل میتواند با روشهای مختلف برای انجام وظایف خاص تنظیم شود.
کیفیت، تنوع و ساختار دادههای آموزشی بر عملکرد مدل تأثیر قابل توجهی دارند.
استنتاج
پس از آموزش مدل، مرحلهٔ استفاده از آن برای تولید پاسخ استنتاج (Inference) نامیده میشود.
هنگامی که کاربر پرامپتی وارد میکند، مدل بر اساس پارامترهای آموختهشده خروجی مناسب را محاسبه میکند.
در مدلهای زبانی، این فرایند معمولاً شامل پیشبینی متوالی توکنهاست.
بنابراین پاسخ مدل از یک پایگاه دادهٔ ثابت که پاسخهای آماده در آن ذخیره شده باشد استخراج نمیشود؛ بلکه در زمان پاسخگویی تولید میشود.
تنظیم دقیق
تنظیم دقیق یا Fine-tuning فرایندی است که طی آن یک مدل از پیش آموزشدیده با مجموعهای از دادههای تخصصیتر آموزش بیشتری میبیند.
برای مثال، یک مدل عمومی میتواند برای کاربردهای حقوقی، علمی، پزشکی یا سازمانی تنظیم شود.
این روش اجازه میدهد از توانایی عمومی مدل استفاده شود و همزمان رفتار آن برای حوزهای خاص سازگار گردد.
یادگیری از بازخورد انسانی
در برخی مدلهای مولد از بازخورد انسان برای بهبود رفتار سامانه استفاده میشود.
ارزیابان انسانی ممکن است پاسخهای مختلف مدل را مقایسه کنند و کیفیت آنها را ارزیابی کنند.
این اطلاعات سپس برای تنظیم رفتار مدل مورد استفاده قرار میگیرد.
هدف این روشها افزایش مفیدبودن، ایمنی و سازگاری پاسخها با دستور کاربر است.
کاربرد در آموزش
هوش مصنوعی مولد کاربردهای گستردهای در آموزش یافته است.
این سامانهها میتوانند مفاهیم را توضیح دهند، تمرین تولید کنند، متون را خلاصه کنند، بازخورد ارائه دهند و محتوای آموزشی را متناسب با سطح یادگیرنده تنظیم کنند.
در عین حال استفادهٔ گسترده از آنها پرسشهایی دربارهٔ تقلب آموزشی، ارزیابی دانش واقعی دانشآموز، اعتبار منابع و وابستگی بیش از اندازه به فناوری ایجاد کرده است.
یونسکو در راهنمای خود دربارهٔ هوش مصنوعی مولد در آموزش و پژوهش بر رویکرد انسانمحور، حفاظت از حریم خصوصی، اعتبارسنجی ابزارها و حفظ عاملیت انسانی تأکید کرده است.[۹]
کاربرد در پژوهش
پژوهشگران میتوانند از هوش مصنوعی مولد برای کمک به جستوجوی مفاهیم، خلاصهسازی متون، تحلیل اولیهٔ دادهها، ترجمه، برنامهنویسی و تهیهٔ پیشنویس استفاده کنند.
اما استفادهٔ علمی از این ابزارها مستلزم راستیآزمایی است.
مدل ممکن است مقاله، نام نویسنده، تاریخ، نقلقول یا شناسهٔ دیجیتال نادرستی تولید کند.
بنابراین هوش مصنوعی مولد نمیتواند بدون بررسی مستقل جایگزین مراجعه به منابع اصلی شود.
کاربرد در پزشکی
هوش مصنوعی مولد در پزشکی برای تولید یا خلاصهسازی گزارشهای بالینی، کمک به تحلیل اطلاعات، آموزش پزشکی و پژوهش مورد بررسی قرار گرفته است.
با این حال خطای مدل در این حوزه میتواند پیامدهای جدی داشته باشد.
به همین دلیل استفادهٔ پزشکی از این فناوری نیازمند نظارت متخصص، حفاظت از اطلاعات بیماران و ارزیابی دقیق اعتبار سامانه است.
کاربرد در رسانه و روزنامهنگاری
هوش مصنوعی مولد میتواند برای خلاصهسازی اسناد، پیادهسازی مصاحبه، ترجمه، تولید پیشنویس و تحلیل مجموعههای بزرگ متن مورد استفاده قرار گیرد.
در مقابل، همین فناوری امکان تولید سریع اطلاعات جعلی، تصویر ساختگی و جعل صدا و ویدئو را نیز فراهم کرده است.
بنابراین گسترش هوش مصنوعی مولد اهمیت راستیآزمایی دیجیتال و بررسی منشأ محتوا را افزایش داده است.
کاربرد در هنر
مدلهای مولد میتوانند تصویر، موسیقی، شعر، داستان و طراحی ایجاد کنند.
این قابلیت بحث گستردهای دربارهٔ مفهوم خلاقیت ایجاد کرده است.
برخی هنرمندان از هوش مصنوعی بهعنوان ابزار جدید تولید اثر استفاده میکنند.
در مقابل، دربارهٔ استفاده از آثار هنرمندان در دادههای آموزشی، تقلید سبک و مالکیت آثار تولیدشده اختلاف نظرهای حقوقی و اخلاقی وجود دارد.
توهم هوش مصنوعی
یکی از مهمترین محدودیتهای مدلهای مولد پدیدهای است که معمولاً توهم (Hallucination) نامیده میشود.
مدل ممکن است پاسخی تولید کند که از نظر زبانی منسجم و متقاعدکننده به نظر برسد، اما از نظر واقعی نادرست باشد.
برای مثال ممکن است:
- منبعی غیرواقعی معرفی کند؛
- تاریخ نادرستی ارائه دهد؛
- نام شخص یا کتابی را بسازد؛
- نقلقولی را به فردی نسبت دهد که آن را بیان نکرده است؛
- یا از دادهٔ ناقص نتیجهگیری نادرست کند.
این مسئله از تفاوت بنیادی میان تولید متن محتمل و اثبات حقیقت ناشی میشود.
هوش مصنوعی مولد و حقیقت
مدل زبانی برای تولید جملهای که از لحاظ آماری و ساختاری مناسب باشد آموزش میبیند؛ این امر بهخودیخود تضمین نمیکند که جمله از نظر تاریخی یا علمی درست باشد.
به همین دلیل، توانایی تولید زبان روان را نباید با دسترسی مستقل به حقیقت یکسان دانست.
در کاربردهای دانشنامهای، علمی و روزنامهنگاری باید میان تولید پاسخ و اثبات ادعا تمایز گذاشت.
منابع مستقل و قابل راستیآزمایی همچنان برای اثبات ادعاهای factual ضروریاند.
سوگیری
مدلهای مولد ممکن است برخی سوگیریهای موجود در دادههای آموزشی را بازتاب دهند.
اگر مجموعهٔ داده شامل کلیشهها، تبعیض یا عدم توازن فرهنگی و زبانی باشد، این ویژگیها میتوانند بر خروجی مدل اثر بگذارند.
روشهای مختلفی برای کاهش این مشکل به کار گرفته میشود، اما حذف کامل سوگیری از سامانههای پیچیده دشوار است.
این مسئله بهویژه در کاربردهایی که بر افراد یا گروههای اجتماعی تأثیر میگذارند اهمیت دارد.
حریم خصوصی
استفاده از هوش مصنوعی مولد پرسشهایی دربارهٔ حریم خصوصی ایجاد کرده است.
کاربران ممکن است اطلاعات شخصی یا محرمانه را در اختیار یک سامانه قرار دهند.
همچنین دادههای مورد استفاده برای آموزش مدل ممکن است شامل اطلاعات شخصی باشند.
یونسکو حفاظت از حریم خصوصی کاربران را از مسائل اساسی در سیاستگذاری هوش مصنوعی مولد دانسته است.[۱۰]
مالکیت فکری
مالکیت فکری یکی از مناقشهبرانگیزترین مسائل هوش مصنوعی مولد است.
مدلها برای آموزش به حجم بسیار بزرگی از متن، تصویر، صدا و دیگر دادهها نیاز دارند.
بخشی از این دادهها ممکن است تحت حمایت حق مؤلف قرار داشته باشند.
از این رو پرسشهایی مطرح شده است:
آیا استفاده از آثار دارای حق مؤلف برای آموزش مدل مجاز است؟
حقوق اثر تولیدشده توسط هوش مصنوعی متعلق به چه کسی است؟
تا چه اندازه میتوان سبک یک هنرمند را تقلید کرد؟
پاسخ حقوقی به این مسائل در حوزههای قضایی مختلف همچنان در حال تحول است.
دیپفیک
دیپفیک به محتوای مصنوعی یا دستکاریشدهای گفته میشود که میتواند تصویر، صدا یا ویدئوی فردی را بهگونهای واقعنما بازسازی کند.
هوش مصنوعی مولد ساخت چنین محتوایی را آسانتر و ارزانتر کرده است.
دیپفیک میتواند در سرگرمی و هنر کاربرد داشته باشد، اما برای جعل هویت، فریب، انتشار اطلاعات نادرست و دستکاری افکار عمومی نیز قابل استفاده است.
استنفورد نیز اطلاعات نادرست و دیپفیک را از زمینههای سوءاستفاده احتمالی هوش مصنوعی مولد ذکر کرده است.[۱۱]
اطلاعات نادرست
توانایی تولید انبوه متن، تصویر، صدا و ویدئو هزینهٔ ایجاد محتوای جعلی را کاهش داده است.
یک تولیدکنندهٔ محتوا میتواند با استفاده از مدلهای مولد تعداد زیادی مقاله، پیام یا تصویر مصنوعی ایجاد کند.
این توانایی نگرانیهایی دربارهٔ عملیات اطلاعاتی، تبلیغات گمراهکننده و انتشار سازمانیافتهٔ اطلاعات نادرست ایجاد کرده است.
در نتیجه، توسعهٔ ابزارهای تشخیص محتوا، اعتبارسنجی منابع و سواد رسانهای اهمیت بیشتری یافته است.
خطرهای هوش مصنوعی مولد
مؤسسه ملی استانداردها و فناوری ایالات متحده در سال ۲۰۲۴ چارچوب ویژهای برای مدیریت خطرهای هوش مصنوعی مولد منتشر کرد.
این چارچوب به خطرهایی اشاره میکند که ممکن است مختص هوش مصنوعی مولد باشند یا استفاده از این فناوری آنها را تشدید کند و مجموعهای از اقدامات را برای شناسایی، اندازهگیری و مدیریت این خطرها پیشنهاد میدهد.[۱۲]
از مهمترین حوزههای نگرانی میتوان به صحت اطلاعات، امنیت، حریم خصوصی، محتوای زیانآور، سوگیری، مالکیت فکری، جعل هویت و وابستگی بیش از اندازهٔ انسان به سامانههای خودکار اشاره کرد.
هوش مصنوعی مولد و اشتغال
گسترش هوش مصنوعی مولد بحث گستردهای دربارهٔ آیندهٔ کار ایجاد کرده است.
برخی فعالیتهای متنی، طراحی، ترجمه، برنامهنویسی و پردازش اطلاعات را میتوان تا حدی خودکار کرد.
اما فناوریهای جدید معمولاً علاوه بر حذف یا تغییر برخی وظایف، وظایف و مشاغل تازهای نیز ایجاد میکنند.
از این رو اثر نهایی هوش مصنوعی مولد بر اشتغال تنها به توانایی فنی مدلها بستگی ندارد؛ هزینهٔ فناوری، قوانین، ساختار سازمانها، آموزش نیروی انسانی و تصمیم کارفرمایان نیز در آن مؤثر است.
هوش مصنوعی مولد و خلاقیت انسانی
یکی از مباحث فلسفی مهم این است که آیا محتوای تولیدشده توسط ماشین را میتوان «خلاقیت» نامید.
مدلهای مولد میتوانند ترکیبهایی ایجاد کنند که پیشتر دقیقاً به همان صورت وجود نداشتهاند.
اما این مدلها تجربهٔ زیسته، قصد هنری و آگاهی انسانی را به معنایی که دربارهٔ انسان به کار میرود ندارند.
از این رو میان تولید محتوای جدید و خلاقیت انسانی تمایز مفهومی وجود دارد.
این مسئله همچنان موضوع بحث در فلسفهٔ ذهن، زیباییشناسی و علوم شناختی است.
آیا هوش مصنوعی مولد میفهمد؟
توانایی مدلهای زبانی در تولید پاسخهای پیچیده بحثی فلسفی دربارهٔ مفهوم «فهم» ایجاد کرده است.
از یک سو، این مدلها قادرند روابط پیچیدهٔ زبانی را پردازش و مسائل متعددی را حل کنند.
از سوی دیگر، عملکرد آنها بر محاسبات عددی و الگوهای آموختهشده استوار است و دربارهٔ اینکه آیا چنین عملکردی را باید «فهم» به معنای انسانی نامید، اجماع وجود ندارد.
این بحث با پرسشهای قدیمیتر فلسفه ذهن دربارهٔ هوش، زبان و آگاهی ارتباط دارد.
هوش مصنوعی مولد و آگاهی
توانایی تولید زبان طبیعی نباید بهخودیخود شاهدی بر وجود آگاهی تلقی شود.
سامانه ممکن است دربارهٔ احساسات، ترس، امید یا تجربهٔ شخصی جمله تولید کند، زیرا الگوهای زبانی مرتبط با این مفاهیم را آموخته است.
این امر بهتنهایی اثبات نمیکند که مدل تجربهٔ ذهنی مشابه انسان دارد.
مسئلهٔ امکان آگاهی ماشین همچنان پرسشی باز در فلسفه و علوم شناختی است.
رویکرد انسانمحور
یکی از رویکردهای مهم در سیاستگذاری هوش مصنوعی، هوش مصنوعی انسانمحور است.
در این دیدگاه فناوری باید در خدمت توانمندسازی انسان قرار گیرد و تصمیمگیری دربارهٔ اهداف و ارزشها در اختیار انسان باقی بماند.
یونسکو در راهنمای هوش مصنوعی مولد در آموزش و پژوهش بر حفظ عاملیت انسانی، فراگیری، برابری، تنوع فرهنگی و زبانی و استفادهٔ اخلاقی از فناوری تأکید کرده است.[۱۳]
تنظیمگری
گسترش سریع هوش مصنوعی مولد دولتها و نهادهای بینالمللی را با مسئلهٔ تنظیمگری مواجه کرده است.
موضوعاتی مانند حفاظت از داده، شفافیت، مسئولیت در برابر خسارت، حق مؤلف، امنیت، تبعیض الگوریتمی و استفاده از هوش مصنوعی در تصمیمهای حساس از محورهای اصلی سیاستگذاری هستند.
یکی از دشواریهای تنظیمگری، سرعت تحول فناوری است. مدلها و قابلیتهای جدید ممکن است سریعتر از فرایند قانونگذاری توسعه یابند.
یونسکو نیز در راهنمای خود به فاصله میان سرعت توسعهٔ ابزارهای مولد و سازگاری چارچوبهای قانونی کشورها اشاره کرده است.[۱۴]
هوش مصنوعی مولد و زبان فارسی
مدلهای مولد امکان تولید، ترجمه و پردازش متن فارسی را نیز فراهم کردهاند.
این فناوری میتواند در ترجمه، آموزش زبان، پژوهش، تولید محتوا، دسترسی به دانش و پردازش اسناد فارسی کاربرد داشته باشد.
با این حال عملکرد مدلها در همهٔ زبانها یکسان نیست.
حجم و کیفیت دادههای آموزشی هر زبان، تنوع منابع و کیفیت ارزیابیها بر توانایی مدل تأثیر میگذارند.
این مسئله اهمیت توسعهٔ دادهها و معیارهای ارزیابی باکیفیت برای زبان فارسی را افزایش میدهد.
هوش مصنوعی مولد و دانشنامهها
هوش مصنوعی مولد میتواند در تدوین مقالههای دانشنامهای برای سازماندهی مطالب، پیشنهاد ساختار، خلاصهسازی منابع، ترجمه و ویرایش مورد استفاده قرار گیرد.
اما یکی از خطرهای اصلی در این کاربرد، تولید منابع یا اطلاعات غیرواقعی است.
به همین دلیل در نگارش دانشنامهای باید هر ادعای مهم به منبع واقعی و قابل بررسی متصل شود.
هوش مصنوعی میتواند ابزار پژوهش و نگارش باشد، اما مسئولیت راستیآزمایی و تصمیم نهایی دربارهٔ انتشار اطلاعات همچنان بر عهدهٔ انسان و نهاد منتشرکننده است.
محدودیتها
با وجود پیشرفت سریع، هوش مصنوعی مولد محدودیتهای مهمی دارد.
این مدلها ممکن است اطلاعات نادرست تولید کنند، زمینهٔ پرسش را اشتباه بفهمند، در محاسبات خطا کنند یا دربارهٔ موضوعی که اطلاعات کافی ندارند پاسخ بسیار مطمئن ارائه دهند.
عملکرد آنها همچنین میتواند تحت تأثیر دادههای آموزشی، نحوهٔ طرح پرسش و طراحی سامانه قرار گیرد.
بنابراین روانبودن پاسخ نباید با صحت آن اشتباه گرفته شود.
آیندهٔ هوش مصنوعی مولد
هوش مصنوعی مولد همچنان حوزهای در حال تحول سریع است.
چندوجهیشدن مدلها، افزایش توانایی استدلال و استفاده از ابزارها، تعامل صوتی و تصویری، کاربردهای تخصصی و ادغام هوش مصنوعی در نرمافزارهای روزمره از مسیرهای اصلی توسعهٔ این فناوری هستند.
در کنار افزایش قابلیتها، مسائل مربوط به ایمنی، اعتماد، حریم خصوصی، حقوق مؤلف، تأثیر بر بازار کار و نحوهٔ کنترل سامانههای قدرتمندتر نیز اهمیت بیشتری پیدا کردهاند.
NIST برای پاسخ به بخشی از این چالشها چارچوب مدیریت ریسک ویژهٔ هوش مصنوعی مولد را تدوین کرده است که هدف آن کمک به سازمانها برای مدیریت خطرها در مراحل مختلف چرخهٔ عمر سامانههای هوش مصنوعی است.[۱۵]
اهمیت تاریخی
هوش مصنوعی مولد را میتوان یکی از مراحل مهم تحول رابطهٔ انسان و رایانه دانست.
در نسلهای اولیهٔ رایانه، انسان باید دستورات را با زبانهای تخصصی برنامهنویسی بیان میکرد.
رابطهای گرافیکی کار با رایانه را آسانتر کردند.
مدلهای مولد مرحلهٔ دیگری را شکل دادهاند که در آن انسان میتواند بسیاری از اهداف خود را با زبان طبیعی بیان کند و از ماشین بخواهد متن، تصویر، کد، صدا یا محتوای دیگر تولید کند.
اهمیت این تحول تنها در خودکارسازی نیست؛ بلکه در تبدیل زبان طبیعی به یکی از رابطهای اصلی میان انسان و سامانههای محاسباتی نیز هست.
جمعبندی
هوش مصنوعی مولد شاخهای از هوش مصنوعی است که با یادگیری الگوهای موجود در دادهها میتواند محتوای جدید تولید کند. متن، تصویر، صدا، موسیقی، ویدئو و کد از مهمترین انواع این محتوا هستند.[۱۶]
پیشرفت شبکههای عصبی، یادگیری عمیق، شبکههای مولد تخاصمی، معماری ترنسفورمر و مدلهای انتشاری زمینهٔ توسعهٔ نسل کنونی این فناوری را فراهم کردند. مقالهٔ Attention Is All You Need در سال ۲۰۱۷ با معرفی معماری ترنسفورمر یکی از نقاط مهم این تحول بود.[۱۷]
گسترش عمومی مدلهای مولد در دههٔ ۲۰۲۰ کاربرد هوش مصنوعی را از ابزارهای تخصصی به فعالیتهای روزمرهای مانند نوشتن، آموزش، برنامهنویسی، پژوهش و تولید تصویر گسترش داده است.
در عین حال، توانایی تولید محتوا مشکلات تازهای نیز ایجاد کرده است. توهم و تولید اطلاعات نادرست، دیپفیک، سوگیری، حفاظت از حریم خصوصی، مالکیت فکری، امنیت و تأثیر بر اشتغال از مهمترین مسائل مرتبط با این فناوریاند. NIST به همین دلیل در سال ۲۰۲۴ چارچوب ویژهای برای شناسایی و مدیریت خطرهای هوش مصنوعی مولد منتشر کرد.[۱۸]
از منظر دانشنامهای، هوش مصنوعی مولد را نباید با «هوش انسانی» یا حتی کل حوزهٔ هوش مصنوعی یکسان دانست. این فناوری مجموعهای از مدلها و روشهای محاسباتی برای یادگیری ساختار داده و تولید خروجیهای جدید است. توانایی چشمگیر این سامانهها در تولید زبان و تصویر نیز بهخودیخود اثباتکنندهٔ آگاهی، تجربهٔ ذهنی یا فهم انسانی نیست.
جستارهای وابسته
- هوش مصنوعی
- یادگیری ماشین
- یادگیری عمیق
- شبکه عصبی مصنوعی
- مدل زبانی بزرگ
- پردازش زبان طبیعی
- علوم رایانه
- رباتیک
- الگوریتم
- کلانداده
- حریم خصوصی
- مالکیت فکری
- اطلاعات نادرست
- پروپاگاندا
- فلسفه ذهن
- آگاهی
- جهانیشدن
- انقلاب صنعتی
منابع
- ↑ Stanford Institute for Human-Centered Artificial Intelligence, “What is Generative AI?”
- ↑ UNESCO, “Guidance for Generative AI in Education and Research,” 2023.
- ↑ UNESCO, Guidance for Generative AI in Education and Research, 2023.
- ↑ Stanford HAI, “What is Generative AI?”
- ↑ NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1, 2024.
- ↑ Ashish Vaswani et al., “Attention Is All You Need,” 2017.
- ↑ Vaswani et al., “Attention Is All You Need.”
- ↑ Stanford HAI, “What are Diffusion Models?”
- ↑ UNESCO, “Guidance for Generative AI in Education and Research.”
- ↑ UNESCO, “Guidance for Generative AI in Education and Research,” 2023.
- ↑ Stanford HAI, “What is Generative AI?”
- ↑ NIST, “Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile,” 2024.
- ↑ UNESCO, “Guidance for Generative AI in Education and Research.”
- ↑ UNESCO, “Guidance for Generative AI in Education and Research,” 2023.
- ↑ NIST, “AI Risk Management Framework.”
- ↑ Stanford HAI, “What is Generative AI?”
- ↑ Vaswani et al., “Attention Is All You Need,” 2017.
- ↑ NIST, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, 2024.
کتابشناسی
- Bengio, Yoshua, Ian Goodfellow, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016.
- Goodfellow, Ian J., et al. “Generative Adversarial Nets.” In Advances in Neural Information Processing Systems 27, 2014.
- Miao, Fengchun, and Wayne Holmes. Guidance for Generative AI in Education and Research. Paris: UNESCO, 2023.
- National Institute of Standards and Technology. Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile. NIST AI 600-1. Gaithersburg, MD: NIST, 2024.
- Russell, Stuart, and Peter Norvig. Artificial Intelligence: A Modern Approach. 4th ed. Pearson, 2021.
- Turing, Alan M. “Computing Machinery and Intelligence.” Mind 59, no. 236 (1950): 433–460.
- Vaswani, Ashish, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, and Illia Polosukhin. “Attention Is All You Need.” 2017.