یادگیری عمیق
| شناسنامه | |
|---|---|
| نامهای دیگر | یادگیری ژرف، DL |
| حوزه | هوش مصنوعی، یادگیری ماشین، شبکههای عصبی مصنوعی، علوم رایانه، علم داده |
| خاستگاه | شبکههای عصبی مصنوعی، یادگیری ماشین، تشخیص الگو، آمار و علوم رایانه |
| اندیشه و تاریخ | |
| مفاهیم کلیدی | شبکه عصبی، لایه پنهان، پسانتشار، گرادیان نزولی، بازنمایی، تابع فعالسازی، شبکه عصبی پیچشی، شبکه بازگشتی، ترنسفورمر |
| جریانهای مرتبط | یادگیری ماشین، شبکه عصبی مصنوعی، هوش مصنوعی مولد، مدل زبانی بزرگ، پردازش زبان طبیعی، بینایی ماشین، یادگیری تقویتی |
| تأثیرپذیرفته از | یادگیری ماشین، شبکههای عصبی مصنوعی، آمار، بهینهسازی، علوم شناختی و عصبشناسی محاسباتی |
| تأثیرگذار بر | هوش مصنوعی مولد، مدلهای زبانی بزرگ، بینایی ماشین، تشخیص گفتار، ترجمه ماشینی، رباتیک و پزشکی محاسباتی |
| نقد و ارزیابی | |
یادگیری عمیق یا یادگیری ژرف (به انگلیسی: Deep Learning) زیرشاخهای از یادگیری ماشین و هوش مصنوعی است که عمدتاً بر شبکههای عصبی مصنوعی چندلایه برای یادگیری بازنماییهای سلسلهمراتبی از دادهها استوار است. در این روش، لایههای متوالی شبکه میتوانند ویژگیهایی با سطوح متفاوت انتزاع را از داده بیاموزند؛ برای مثال در پردازش تصویر، لایههای اولیه ممکن است الگوهای سادهتری مانند لبهها را بازنمایی کنند و لایههای بعدی ساختارهای پیچیدهتر را تشخیص دهند.[۱]
یادگیری عمیق یکی از فناوریهای بنیادی در توسعهٔ هوش مصنوعی معاصر است و در تشخیص تصویر و گفتار، پردازش زبان طبیعی، ترجمهٔ ماشینی، سامانههای توصیهگر، پزشکی محاسباتی، رباتیک و هوش مصنوعی مولد کاربرد دارد.
مدلهای زبانی بزرگ و بسیاری از سامانههای تولید تصویر و صوت نیز بر معماریها و روشهای یادگیری عمیق استوارند.
تعریف
یادگیری عمیق خانوادهای از روشهای یادگیری ماشین است که از چندین سطح پردازش برای یادگیری بازنمایی داده استفاده میکند.
در مقالهٔ مروری یان لکون، یوشوا بنجیو و جفری هینتون در سال ۲۰۱۵، یادگیری عمیق بهعنوان روشی معرفی شد که مدلهای محاسباتی متشکل از چندین لایهٔ پردازشی را قادر میکند بازنماییهایی از داده را در سطوح مختلف انتزاع بیاموزند.[۲]
در این ساختار، هر لایه دادهٔ دریافتشده از لایهٔ قبلی را به بازنمایی دیگری تبدیل میکند.
بهصورت ساده:
دادهٔ خام ↓ لایهٔ نخست ↓ ویژگیهای ساده ↓ لایههای میانی ↓ ویژگیهای پیچیدهتر ↓ بازنمایی سطح بالا ↓ خروجی
همین ساختار چندلایه یکی از دلایل استفاده از واژهٔ «عمیق» در نام این روش است.
جایگاه در هوش مصنوعی
رابطهٔ میان هوش مصنوعی، یادگیری ماشین و یادگیری عمیق را میتوان بهطور ساده چنین نشان داد:
هوش مصنوعی ↓ یادگیری ماشین ↓ یادگیری عمیق ↓ شبکههای عصبی عمیق ↓ بسیاری از مدلهای مولد معاصر
هوش مصنوعی حوزهای گسترده است.
یادگیری ماشین یکی از رویکردهای مهم در این حوزه است.
یادگیری عمیق نیز خانوادهای از روشهای یادگیری ماشین است.
بنابراین یادگیری عمیق و یادگیری ماشین مترادف نیستند.
شبکهٔ عصبی مصنوعی
پایهٔ بسیاری از روشهای یادگیری عمیق شبکهٔ عصبی مصنوعی (Artificial Neural Network) است.
شبکهٔ عصبی از واحدهای محاسباتی متصل به یکدیگر تشکیل شده است. هر واحد ورودیهایی دریافت میکند، روی آنها محاسباتی انجام میدهد و خروجی را به واحدهای بعدی انتقال میدهد.
ساختار سادهای از شبکه میتواند شامل:
لایهٔ ورودی ↓ لایهٔ پنهان ↓ لایهٔ پنهان ↓ لایهٔ خروجی
باشد.
شبکههای عمیق میتوانند تعداد بسیار بیشتری لایه و پارامتر داشته باشند.
اگرچه اصطلاح «شبکهٔ عصبی» از زیستشناسی الهام گرفته شده است، شبکههای عصبی مصنوعی مدل دقیق مغز انسان نیستند.
نورون مصنوعی
واحد پایه در بسیاری از شبکههای عصبی نورون مصنوعی نامیده میشود.
نورون مجموعهای از ورودیها را دریافت میکند:
x₁, x₂, x₃, ...
برای هر ورودی وزنی وجود دارد:
w₁, w₂, w₃, ...
سپس ترکیبی از ورودیها و وزنها محاسبه و از یک تابع فعالسازی عبور داده میشود.
بهصورت ساده:
ورودیها × وزنها ↓ جمع ↓ تابع فعالسازی ↓ خروجی
در جریان آموزش، وزنها تغییر میکنند تا عملکرد شبکه در وظیفهٔ مورد نظر بهبود یابد.
لایههای شبکه
شبکهٔ عصبی معمولاً شامل سه نوع کلی لایه است:
لایهٔ ورودی داده را دریافت میکند.
لایههای پنهان تبدیلهای میانی را انجام میدهند.
لایهٔ خروجی نتیجهٔ نهایی را تولید میکند.
وجود چندین لایهٔ پنهان امکان یادگیری بازنماییهای پیچیدهتر را فراهم میکند.
بازنمایی سلسلهمراتبی
یکی از مفاهیم اصلی یادگیری عمیق یادگیری بازنمایی است.
فرض کنید مدل برای تشخیص چهره آموزش داده شود.
در یک تصویر، لایههای اولیه ممکن است ویژگیهایی مانند:
- لبه؛
- جهت؛
- روشنایی؛
- یا بافت
را استخراج کنند.
لایههای بعدی میتوانند ترکیبهایی مانند:
- چشم؛
- بینی؛
- دهان
را بازنمایی کنند.
لایههای بالاتر ممکن است ترکیب این ویژگیها را برای تشخیص ساختار کلی چهره به کار گیرند.
در نتیجه، مدل میتواند از دادهٔ خام به بازنماییهای انتزاعیتر برسد.
تاریخچه
ریشههای یادگیری عمیق به تاریخ شبکههای عصبی مصنوعی بازمیگردد.
پژوهش دربارهٔ مدلهای محاسباتی الهامگرفته از نورونها در میانهٔ سدهٔ بیستم آغاز شد. پرسپترون فرانک روزنبلات از نمونههای مهم اولیه بود.
در دهههای بعد، پژوهشگران روشهایی برای آموزش شبکههای چندلایه توسعه دادند.
یکی از نقاط مهم تاریخی، مقالهٔ دیوید روملهارت، جفری هینتون و رونالد ویلیامز در سال ۱۹۸۶ دربارهٔ پسانتشار خطا بود.[۳]
این مقاله روشی را تشریح کرد که وزنهای ارتباطات شبکه را بهطور مکرر تغییر میداد تا اختلاف میان خروجی واقعی شبکه و خروجی مورد انتظار کاهش یابد.
پسانتشار
پسانتشار (Backpropagation) یکی از روشهای بنیادی آموزش شبکههای عصبی است.
فرایند را میتوان بهطور ساده چنین نمایش داد:
ورودی ↓ عبور رو به جلو ↓ پیشبینی ↓ مقایسه با پاسخ واقعی ↓ محاسبهٔ خطا ↓ انتشار خطا به عقب ↓ محاسبهٔ گرادیانها ↓ اصلاح وزنها
در مرحلهٔ عبور رو به جلو، شبکه پیشبینی تولید میکند.
سپس تابع زیان میزان اختلاف پیشبینی با هدف را محاسبه میکند.
پسانتشار با استفاده از قاعدهٔ زنجیرهای حساب دیفرانسیل، اطلاعات لازم برای محاسبهٔ تأثیر پارامترهای مختلف بر خطا را فراهم میکند.
روملهارت، هینتون و ویلیامز نشان دادند که این فرایند میتواند موجب شود واحدهای پنهان ویژگیهای مفیدی از مسئله را بازنمایی کنند.[۴]
دورههای رکود شبکههای عصبی
شبکههای عصبی در طول تاریخ همواره حوزهٔ غالب هوش مصنوعی نبودند.
محدودیت قدرت محاسباتی، کمبود داده و دشواری آموزش شبکههای بزرگ موجب شد توجه پژوهشی به این روشها در دورههایی کاهش یابد.
روشهای دیگری مانند ماشینهای بردار پشتیبان و مدلهای آماری در بسیاری از کاربردها عملکرد رقابتی داشتند.
از دههٔ ۲۰۰۰، ترکیب چند عامل زمینهٔ بازگشت شبکههای عصبی را فراهم کرد:
- افزایش حجم داده؛
- افزایش توان محاسباتی؛
- استفاده از پردازندههای گرافیکی؛
- بهبود الگوریتمهای آموزش؛
- توسعهٔ توابع فعالسازی مناسبتر؛
- و پیشرفت معماری شبکهها.
گسترش اصطلاح یادگیری عمیق
اصطلاح «یادگیری عمیق» در دههٔ ۲۰۰۰ بهتدریج برای توصیف روشهای مبتنی بر معماریهای چندلایه رواج بیشتری یافت.
در این دوره پژوهشهای جفری هینتون، یوشوا بنجیو و دیگران نشان دادند که شبکههای دارای چندین سطح بازنمایی میتوانند با روشهای جدید آموزش داده شوند.
کتاب Deep Learning نوشتهٔ ایان گودفلو، یوشوا بنجیو و آرون کورویل در سال ۲۰۱۶ به یکی از منابع مرجع این حوزه تبدیل شد.[۵]
جهش دههٔ ۲۰۱۰
یکی از نقاط عطف یادگیری عمیق در سال ۲۰۱۲ و رقابت ImageNet رخ داد.
الکس کریژفسکی، ایلیا سوتسکور و جفری هینتون شبکهٔ عصبی پیچشی عمیقی را برای طبقهبندی تصاویر به کار گرفتند. عملکرد این سامانه توجه گستردهای را به قابلیت شبکههای عصبی عمیق در بینایی ماشین جلب کرد.
این معماری بعدها با نام AlexNet شناخته شد.
موفقیت شبکههای عمیق در ImageNet به گسترش سریع استفاده از یادگیری عمیق در دانشگاهها و صنعت کمک کرد.
پردازندههای گرافیکی
یکی از عوامل مهم رشد یادگیری عمیق استفاده از پردازندههای گرافیکی یا GPU بود.
GPUها در اصل برای پردازش گرافیک طراحی شده بودند، اما معماری آنها برای بسیاری از عملیات موازی مورد نیاز شبکههای عصبی نیز مناسب است.
آموزش شبکهای که ممکن بود روی سختافزارهای قدیمی زمان بسیار زیادی نیاز داشته باشد، با استفاده از پردازش موازی سریعتر شد.
بعدها شتابدهندههای تخصصی هوش مصنوعی نیز توسعه یافتند.
دادههای بزرگ
افزایش حجم دادههای دیجیتال نیز نقش مهمی در توسعهٔ یادگیری عمیق داشت.
شبکههای بزرگ دارای تعداد زیادی پارامتر هستند و برای آموزش مؤثر اغلب به حجم قابل توجهی از داده نیاز دارند.
گسترش اینترنت، دوربینهای دیجیتال، تلفنهای هوشمند، حسگرها و پایگاههای داده موجب افزایش حجم دادههای قابل استفاده برای آموزش شد.
تابع فعالسازی
تابع فعالسازی (Activation Function) تبدیل غیرخطیای است که در واحدهای شبکه به کار میرود.
بدون تبدیلهای غیرخطی، ترکیب تعداد زیادی لایهٔ خطی همچنان معادل یک تبدیل خطی خواهد بود و شبکه توانایی محدودی در مدلسازی روابط پیچیده خواهد داشت.
توابعی مانند:
- Sigmoid؛
- Tanh؛
- ReLU؛
- GELU
در معماریهای مختلف استفاده شدهاند.
ReLU
ReLU مخفف Rectified Linear Unit یکی از توابع فعالسازی پرکاربرد در شبکههای عصبی عمیق است.
شکل سادهٔ آن:
f(x) = max(0,x)
است.
یعنی اگر ورودی منفی باشد خروجی صفر و اگر مثبت باشد همان مقدار ورودی بازگردانده میشود.
استفادهٔ گسترده از ReLU یکی از عواملی بود که آموزش برخی شبکههای عمیق را سادهتر کرد.
گرادیان نزولی
بسیاری از شبکههای عمیق با نسخههایی از گرادیان نزولی آموزش داده میشوند.
هدف، کاهش تابع زیان است.
به صورت ساده:
وزنهای اولیه ↓ پیشبینی ↓ محاسبهٔ خطا ↓ محاسبهٔ گرادیان ↓ تغییر وزنها ↓ پیشبینی جدید ↓ تکرار
این فرایند ممکن است میلیونها یا میلیاردها بار در جریان آموزش انجام شود.
شبکههای عصبی پیچشی
شبکهٔ عصبی پیچشی (Convolutional Neural Network یا CNN) خانوادهای از شبکههاست که بهویژه در پردازش دادههای دارای ساختار فضایی، مانند تصویر، تأثیرگذار بوده است.
CNNها از عملیات پیچش برای استخراج ویژگیهای محلی استفاده میکنند.
این شبکهها در:
- طبقهبندی تصویر؛
- تشخیص اشیا؛
- تشخیص چهره؛
- تصاویر پزشکی؛
- تصاویر ماهوارهای؛
- و پردازش ویدئو
کاربرد داشتهاند.
پژوهشهای یان لکون و همکاران دربارهٔ شبکههای پیچشی از آثار مهم در توسعهٔ این معماری بودند.
شبکههای بازگشتی
شبکهٔ عصبی بازگشتی (Recurrent Neural Network یا RNN) برای پردازش دادههای دنبالهای طراحی شده است.
از کاربردهای تاریخی آن میتوان به:
- پردازش متن؛
- گفتار؛
- ترجمه؛
- سریهای زمانی
اشاره کرد.
RNNها دارای سازوکاری هستند که اطلاعات مراحل پیشین توالی میتواند بر پردازش مرحلهٔ بعد اثر بگذارد.
LSTM
یکی از انواع مهم شبکههای بازگشتی حافظهٔ طولانی کوتاهمدت یا LSTM است.
LSTM برای کاهش برخی مشکلات شبکههای بازگشتی در یادگیری وابستگیهای بلندمدت توسعه یافت.
پیش از گسترش ترنسفورمرها، LSTMها در بسیاری از سامانههای ترجمه، گفتار و پردازش زبان کاربرد گسترده داشتند.
ترنسفورمر
ترنسفورمر یکی از مهمترین معماریهای یادگیری عمیق معاصر است.
در سال ۲۰۱۷، اشیش واسوانی و همکاران مقالهٔ Attention Is All You Need را منتشر کردند و معماری ترنسفورمر را معرفی کردند.
این معماری به جای تکیهٔ اصلی بر بازگشت، از سازوکار توجه برای مدلکردن رابطهٔ میان عناصر توالی استفاده میکند.
ترنسفورمر بعدها پایهٔ بسیاری از مدلهای زبانی بزرگ و سامانههای هوش مصنوعی مولد شد.
سازوکار توجه
توجه (Attention) به مدل اجازه میدهد هنگام پردازش یک عنصر، اهمیت عناصر دیگر را بهصورت پویا محاسبه کند.
برای مثال در جمله:
«مریم کتاب را برداشت زیرا او میخواست آن را بخواند.»
برای تفسیر «آن»، مدل باید ارتباط آن را با «کتاب» در نظر بگیرد.
سازوکار توجه روشی محاسباتی برای مدلکردن چنین روابطی فراهم میکند.
خودتوجهی
خودتوجهی (Self-Attention) نوعی سازوکار توجه است که روابط میان عناصر یک توالی را با عناصر دیگر همان توالی محاسبه میکند.
در ترنسفورمر، خودتوجهی امکان پردازش روابط دور و نزدیک میان توکنها را فراهم میکند.
این ویژگی نقش مهمی در موفقیت معماری ترنسفورمر در پردازش زبان داشته است.
یادگیری عمیق و پردازش زبان طبیعی
یادگیری عمیق تحول بزرگی در پردازش زبان طبیعی ایجاد کرده است.
از کاربردهای آن میتوان به:
- ترجمهٔ ماشینی؛
- خلاصهسازی؛
- پاسخ به پرسش؛
- تحلیل متن؛
- تشخیص گفتار؛
- تولید متن؛
- و بازیابی اطلاعات
اشاره کرد.
شبکههای بازگشتی و سپس ترنسفورمرها در توسعهٔ این حوزه نقش مهمی داشتهاند.
مدلهای زبانی بزرگ
مدلهای زبانی بزرگ یا LLMها نمونهای از کاربرد یادگیری عمیق هستند.
بسیاری از این مدلها دارای شبکههای ترنسفورمری با شمار زیادی پارامتر هستند و با حجم بزرگی از دادهٔ متنی آموزش داده میشوند.
در مدلهای خودرگرسیو، مدل معمولاً یاد میگیرد بر اساس توکنهای پیشین احتمال توکن بعدی را تخمین بزند.
به صورت ساده:
متن ↓ توکنها ↓ ترنسفورمر ↓ احتمال توکن بعدی ↓ انتخاب توکن ↓ تکرار ↓ متن تولیدشده
یادگیری عمیق و هوش مصنوعی مولد
هوش مصنوعی مولد یکی از مهمترین حوزههای کاربرد یادگیری عمیق است.
مدلهای مولد میتوانند:
- متن؛
- تصویر؛
- صوت؛
- موسیقی؛
- ویدئو؛
- کد؛
- و دادههای مصنوعی
تولید کنند.
مدلهای زبانی، مدلهای انتشار و برخی مدلهای مولد دیگر بر معماریها و روشهای یادگیری عمیق استوارند.
مدلهای انتشار
مدلهای انتشار (Diffusion Models) خانوادهای از مدلهای مولد هستند که در تولید تصویر و دیگر انواع داده کاربرد گسترده یافتهاند.
در یک توصیف ساده، مدل میآموزد فرایند افزودن نویز به داده را معکوس کند.
فرایند تولید را میتوان چنین تصور کرد:
نویز ↓ حذف تدریجی نویز ↓ ساختار اولیه ↓ جزئیات بیشتر ↓ تصویر
این روش پایهٔ بسیاری از سامانههای تولید تصویر معاصر شده است.
یادگیری عمیق در بینایی ماشین
یکی از نخستین حوزههایی که تأثیر گستردهٔ یادگیری عمیق در آن آشکار شد بینایی ماشین بود.
شبکههای عمیق میتوانند برای:
- طبقهبندی تصویر؛
- تشخیص شیء؛
- تقسیمبندی تصویر؛
- تشخیص چهره؛
- تحلیل تصاویر پزشکی؛
- و هدایت ربات
آموزش داده شوند.
شبکههای پیچشی برای سالها معماری غالب بسیاری از این کاربردها بودند و بعدها ترنسفورمرهای بینایی نیز گسترش یافتند.
تشخیص گفتار
یادگیری عمیق در سامانههای تشخیص گفتار نیز نقش مهمی داشته است.
مدلها میتوانند سیگنال صوتی را به بازنماییهایی تبدیل کنند که برای تشخیص واج، واژه و جمله استفاده میشوند.
این فناوری در:
- تبدیل گفتار به متن؛
- زیرنویس خودکار؛
- دستیار صوتی؛
- رونویسی؛
- و سامانههای دسترسپذیری
کاربرد دارد.
پزشکی
در پزشکی، یادگیری عمیق برای تحلیل:
- تصاویر رادیولوژی؛
- سیتیاسکن؛
- MRI؛
- تصاویر پاتولوژی؛
- دادههای ژنتیکی؛
- و پروندههای پزشکی
مورد مطالعه قرار گرفته است.
با این حال عملکرد یک مدل پزشکی باید در جمعیت هدف و شرایط واقعی ارزیابی شود.
دقت بالا روی مجموعهٔ آزمایشی بهتنهایی تضمینکنندهٔ عملکرد ایمن در محیط بالینی نیست.
خودروهای خودران
یادگیری عمیق در سامانههای رانندگی خودکار برای تحلیل دادههای دوربین و حسگرها استفاده میشود.
مدلها میتوانند:
- عابر پیاده؛
- خودرو؛
- چراغ راهنمایی؛
- علائم؛
- خطوط جاده؛
- و موانع
را شناسایی کنند.
این اطلاعات سپس همراه با دیگر سامانههای مکانیابی، برنامهریزی و کنترل برای تصمیمگیری خودرو استفاده میشود.
رباتیک
در رباتیک، یادگیری عمیق میتواند برای:
- ادراک محیط؛
- تشخیص اشیا؛
- کنترل؛
- برنامهریزی حرکت؛
- یادگیری از نمایش؛
- و تعامل انسان و ربات
به کار رود.
ترکیب یادگیری عمیق و یادگیری تقویتی یکی از حوزههای پژوهشی مهم در رباتیک است.
سامانههای توصیهگر
شبکههای عمیق در برخی سامانههای توصیهگر برای یادگیری بازنمایی کاربران و محتوا استفاده میشوند.
این سامانهها میتوانند بر اساس سابقهٔ تعامل کاربران احتمال علاقه به یک محتوا را تخمین بزنند.
فروشگاههای اینترنتی، شبکههای اجتماعی و خدمات رسانهای از سامانههای توصیهگر استفاده میکنند.
مزایای یادگیری عمیق
یکی از مهمترین مزایای یادگیری عمیق توانایی یادگیری خودکار بازنمایی است.
در بسیاری از روشهای سنتی یادگیری ماشین، متخصص باید ویژگیهای مناسب را تا حد زیادی بهصورت دستی طراحی کند.
در یادگیری عمیق، مدل میتواند بسیاری از ویژگیهای مورد نیاز را از داده بیاموزد.
از دیگر مزایا میتوان به توانایی پردازش دادههای پیچیده و غیرساختیافته مانند متن، تصویر و صوت اشاره کرد.
نیاز به داده
مدلهای عمیق اغلب به حجم زیادی از داده نیاز دارند، هرچند مقدار لازم به معماری، وظیفه، پیشآموزش و روش یادگیری بستگی دارد.
تهیهٔ دادهٔ باکیفیت میتواند دشوار و پرهزینه باشد.
همچنین دادهٔ زیاد لزوماً دادهٔ خوب نیست.
کیفیت، تنوع و تناسب داده با کاربرد اهمیت بنیادی دارد.
هزینهٔ محاسباتی
آموزش مدلهای عمیق بزرگ میتواند به منابع محاسباتی قابل توجهی نیاز داشته باشد.
این منابع شامل:
- GPU؛
- شتابدهندههای تخصصی؛
- حافظه؛
- ذخیرهسازی؛
- شبکهٔ پرسرعت؛
- برق؛
- و سامانههای خنککننده
هستند.
رشد اندازهٔ مدلها موجب شده هزینه و مصرف انرژی به یکی از موضوعات مورد بحث در توسعهٔ هوش مصنوعی تبدیل شود.
بیشبرازش
مانند دیگر روشهای یادگیری ماشین، شبکههای عمیق نیز ممکن است دچار بیشبرازش شوند.
در این وضعیت، مدل روی دادههای آموزشی عملکرد خوبی دارد اما روی دادههای جدید ضعیفتر عمل میکند.
روشهایی مانند:
- منظمسازی؛
- افزایش داده؛
- توقف زودهنگام؛
- Dropout؛
- و استفاده از دادهٔ بیشتر
برای کاهش بیشبرازش به کار میروند.
جعبهٔ سیاه
یکی از انتقادهای مطرح دربارهٔ شبکههای عمیق دشواری توضیح برخی تصمیمهای آنهاست.
شبکهای با میلیونها یا میلیاردها پارامتر میتواند رابطهای بسیار پیچیده میان ورودی و خروجی ایجاد کند.
ممکن است مدل بتواند پاسخ دقیقی ارائه کند، اما توضیح اینکه دقیقاً چرا آن پاسخ را انتخاب کرده دشوار باشد.
این مسئله زمینهٔ پژوهش دربارهٔ هوش مصنوعی توضیحپذیر را تقویت کرده است.
سوگیری الگوریتمی
سوگیری الگوریتمی یکی از مسائل مهم سامانههای یادگیری عمیق است.
مدل از داده میآموزد و اگر داده دارای عدم توازن، سوگیری تاریخی یا پوشش نامناسب باشد، مدل میتواند بخشی از همان الگوها را بازتولید کند.
برای مثال سامانهٔ تشخیص چهرهای که دادهٔ آموزشی آن نمایندگی کافی از گروههای مختلف ندارد ممکن است نرخ خطای متفاوتی میان آنها داشته باشد.
بنابراین ارزیابی مدل باید برای گروهها و شرایط مختلف انجام شود.
حریم خصوصی
استفاده از مجموعههای بزرگ داده برای آموزش مدلهای عمیق پرسشهایی دربارهٔ حریم خصوصی ایجاد کرده است.
این پرسشها شامل:
- منشأ داده؛
- رضایت صاحبان داده؛
- اطلاعات شخصی؛
- امکان بازسازی اطلاعات؛
- امنیت مجموعهٔ آموزشی؛
- و حق استفاده از داده
میشود.
این مسائل بهویژه در دادههای پزشکی و اطلاعات شخصی اهمیت دارند.
توهم هوش مصنوعی
در مدلهای مولد عمیق، بهویژه مدلهای زبانی، یکی از مسائل شناختهشده توهم هوش مصنوعی است.
مدل ممکن است متن بسیار روان و ظاهراً معتبر تولید کند اما بخشی از اطلاعات آن نادرست یا ساختگی باشد.
برای مثال مدل ممکن است:
- منبعی غیرواقعی؛
- نقلقولی ساختگی؛
- تاریخی اشتباه؛
- یا رویدادی ناموجود
تولید کند.
این مسئله نشان میدهد توانایی یادگیری الگوهای پیچیدهٔ زبان به معنای وجود سامانهای تضمینشده برای تشخیص حقیقت نیست.
حملات خصمانه
شبکههای عمیق میتوانند در برابر حملات خصمانه آسیبپذیر باشند.
در برخی شرایط، تغییر بسیار کوچکی در ورودی میتواند موجب تغییر شدید خروجی مدل شود.
برای مثال تغییرات خاصی در تصویر که برای چشم انسان ناچیز به نظر میرسند ممکن است مدل طبقهبندی را به تشخیص اشتباه وادار کنند.
این موضوع یکی از حوزههای پژوهش در امنیت هوش مصنوعی است.
تغییر توزیع داده
مدل عمیق معمولاً بر اساس توزیع مشخصی از داده آموزش میبیند.
اگر شرایط واقعی تغییر کند، عملکرد مدل ممکن است کاهش یابد.
برای مثال مدلی که تصاویر پزشکی یک نوع دستگاه یا یک جمعیت خاص را دیده است ممکن است روی تصاویر حاصل از تجهیزات یا جمعیتی متفاوت عملکرد دیگری داشته باشد.
به همین دلیل اعتبارسنجی مدل در محیط واقعی اهمیت دارد.
یادگیری عمیق و علیت
مدلهای عمیق در کشف الگوهای آماری بسیار قدرتمند هستند، اما همبستگی آماری را نباید خودبهخود معادل رابطهٔ علت و معلولی دانست.
اگر مدل متوجه شود دو ویژگی معمولاً با هم ظاهر میشوند، این مسئله ثابت نمیکند که یکی علت دیگری است.
این تمایز در علوم اجتماعی، پزشکی و سیاستگذاری اهمیت ویژه دارد.
یادگیری عمیق و نیروی انسانی
گسترش یادگیری عمیق بر ساختار برخی مشاغل نیز تأثیر گذاشته است.
سامانههای مبتنی بر این فناوری میتوانند بخشی از وظایف مربوط به:
- ترجمه؛
- تولید محتوا؛
- برنامهنویسی؛
- طراحی؛
- تحلیل اسناد؛
- خدمات مشتری؛
- و پردازش اطلاعات
را خودکار یا نیمهخودکار کنند.
با این حال تأثیر واقعی بر اشتغال به نوع صنعت، نحوهٔ استفاده از فناوری، قوانین و سازگاری نیروی کار وابسته است.
یادگیری عمیق و تمرکز قدرت محاسباتی
آموزش مدلهای بسیار بزرگ به زیرساخت محاسباتی و سرمایهٔ قابل توجه نیاز دارد.
این مسئله میتواند توان توسعهٔ برخی مدلهای پیشرفته را در تعداد محدودی از شرکتها، دولتها و مؤسسات پژوهشی متمرکز کند.
این تمرکز پرسشهایی دربارهٔ:
- دسترسی به فناوری؛
- شفافیت؛
- رقابت؛
- نظارت؛
- مالکیت داده؛
- و پاسخگویی
ایجاد کرده است.
از این رو پیامدهای یادگیری عمیق تنها موضوعی فنی نیست و ابعاد اقتصادی و اجتماعی نیز دارد.
یادگیری عمیق و اطلاعات
شبکههای عمیق در موتورهای جستوجو، سامانههای توصیهگر و شبکههای اجتماعی میتوانند در رتبهبندی و انتخاب محتوایی که کاربران مشاهده میکنند نقش داشته باشند.
این موضوع در مطالعات رسانه و جامعهشناسی سیاسی اهمیت دارد، زیرا معماری سامانههای توصیهگر میتواند بر جریان اطلاعات اثر بگذارد.
با این حال برای ارزیابی تأثیر سیاسی یا اجتماعی هر سامانه باید دادههای مربوط به همان سامانه و نحوهٔ استفاده از آن بررسی شود.
یادگیری عمیق و ایران
در ایران، پژوهشهای مرتبط با یادگیری عمیق در دانشگاهها و حوزههایی مانند پردازش زبان فارسی، بینایی ماشین، پزشکی، تشخیص گفتار و تحلیل داده انجام شده است.
برای توسعهٔ مدلهای زبان فارسی، کیفیت و تنوع دادههای فارسی اهمیت ویژهای دارد.
دادهٔ ناکافی یا نامتوازن میتواند موجب عملکرد ضعیفتر مدل در زبان فارسی، گویشها یا گونههای زبانی کمنماینده شود.
از سوی دیگر، استفاده از فناوریهای مبتنی بر یادگیری عمیق در نظارت، تشخیص چهره یا تحلیل دادههای شهروندان، در صورت کاربرد حکومتی، موضوعاتی مانند حریم خصوصی، آزادیهای مدنی، شفافیت و پاسخگویی را مطرح میکند. هر ادعای مشخص دربارهٔ استفادهٔ نهادهای جمهوری اسلامی از چنین سامانههایی نیازمند منابع مستقل و قابل راستیآزمایی است.
تفاوت یادگیری ماشین و یادگیری عمیق
یادگیری عمیق بخشی از یادگیری ماشین است، نه اصطلاحی مترادف با آن.
یادگیری ماشین شامل طیف وسیعی از الگوریتمها مانند:
- رگرسیون؛
- درخت تصمیم؛
- جنگل تصادفی؛
- ماشین بردار پشتیبان؛
- خوشهبندی؛
- و شبکههای عصبی
است.
یادگیری عمیق عمدتاً به شبکههای عصبی دارای چندین سطح پردازش و یادگیری بازنمایی اشاره دارد.
بنابراین:
همهٔ یادگیری عمیقها ⊂ یادگیری ماشین
اما:
همهٔ روشهای یادگیری ماشین ≠ یادگیری عمیق
تفاوت یادگیری عمیق و هوش مصنوعی مولد
هوش مصنوعی مولد و یادگیری عمیق نیز مترادف نیستند.
یادگیری عمیق یک خانواده از روشهای یادگیری است.
هوش مصنوعی مولد به سامانههایی اشاره دارد که محتوای جدید تولید میکنند.
بسیاری از سامانههای مولد جدید از یادگیری عمیق استفاده میکنند، اما همهٔ کاربردهای یادگیری عمیق مولد نیستند.
برای مثال شبکهای که فقط تشخیص میدهد تصویر دارای گربه است یا سگ، میتواند یک مدل عمیق باشد بدون آنکه محتوای جدیدی تولید کند.
آیندهٔ یادگیری عمیق
پژوهش در یادگیری عمیق همچنان در زمینههایی مانند:
- مدلهای بنیادی؛
- مدلهای چندوجهی؛
- عاملهای هوشمند؛
- رباتیک؛
- مدلهای کارآمدتر؛
- یادگیری با دادهٔ کمتر؛
- تفسیرپذیری؛
- ایمنی؛
- و کاهش مصرف محاسباتی
ادامه دارد.
یکی از پرسشهای بنیادی آینده این است که افزایش اندازهٔ مدل و داده تا چه اندازه میتواند تواناییهای جدید ایجاد کند و چه روشهای دیگری برای افزایش قابلیت اعتماد، کارایی و استدلال لازم خواهد بود.
جمعبندی
یادگیری عمیق زیرشاخهای از یادگیری ماشین است که عمدتاً از شبکههای عصبی چندلایه برای یادگیری بازنماییهای سلسلهمراتبی داده استفاده میکند. لایههای مختلف شبکه میتوانند ویژگیهایی با سطوح متفاوت انتزاع را بیاموزند؛ ویژگیای که یادگیری عمیق را برای پردازش تصویر، صوت و زبان مناسب کرده است.[۶]
ریشههای آن به پژوهشهای شبکههای عصبی در سدهٔ بیستم بازمیگردد. توسعهٔ روش پسانتشار و پژوهش روملهارت، هینتون و ویلیامز در سال ۱۹۸۶ یکی از مراحل مهم تاریخی آموزش شبکههای چندلایه بود.[۷]
افزایش قدرت محاسباتی، دسترسی به مجموعههای بزرگ داده و پیشرفت الگوریتمها موجب شد یادگیری عمیق در دههٔ ۲۰۱۰ به یکی از رویکردهای اصلی هوش مصنوعی تبدیل شود. شبکههای پیچشی، شبکههای بازگشتی و سپس ترنسفورمرها مراحل مهم این تحول را شکل دادند.
امروزه بسیاری از مدلهای زبانی بزرگ و سامانههای هوش مصنوعی مولد بر یادگیری عمیق استوارند. در مقابل، هزینهٔ محاسباتی، سوگیری الگوریتمی، حریم خصوصی، دشواری توضیح تصمیمها، آسیبپذیری امنیتی و توهم هوش مصنوعی از چالشهای مهم این فناوری به شمار میروند.
از این رو یادگیری عمیق را میتوان یکی از فناوریهای بنیادی موج کنونی هوش مصنوعی دانست که امکان یادگیری بازنماییهای پیچیده از حجم بزرگی از داده را فراهم کرده و در عین حال مجموعهای از مسائل فنی، اجتماعی و اخلاقی تازه را پدید آورده است.
جستارهای وابسته
- هوش مصنوعی
- یادگیری ماشین
- هوش مصنوعی مولد
- شبکه عصبی مصنوعی
- مدل زبانی بزرگ
- ترنسفورمر
- پردازش زبان طبیعی
- بینایی ماشین
- توکن (هوش مصنوعی)
- پرامپت (هوش مصنوعی)
- توهم هوش مصنوعی
- سوگیری الگوریتمی
- علم داده
- الگوریتم
- علوم رایانه
منابع
- ↑ Yann LeCun, Yoshua Bengio and Geoffrey Hinton، “Deep Learning”، Nature، 2015
- ↑ LeCun, Bengio and Hinton، “Deep Learning”، Nature، 2015
- ↑ David E. Rumelhart, Geoffrey E. Hinton and Ronald J. Williams، “Learning representations by back-propagating errors”، Nature، 1986
- ↑ Rumelhart, Hinton and Williams، “Learning representations by back-propagating errors”، 1986
- ↑ Ian Goodfellow, Yoshua Bengio and Aaron Courville، Deep Learning، MIT Press، 2016
- ↑ LeCun, Bengio and Hinton، “Deep Learning”، Nature، 2015
- ↑ Rumelhart, Hinton and Williams، “Learning representations by back-propagating errors”، Nature، 1986
کتابشناسی
- Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016.
- Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” Advances in Neural Information Processing Systems 25 (2012).
- LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444.
- LeCun, Yann, Léon Bottou, Yoshua Bengio, and Patrick Haffner. “Gradient-Based Learning Applied to Document Recognition.” Proceedings of the IEEE 86, no. 11 (1998): 2278–2324.
- Rumelhart, David E., Geoffrey E. Hinton, and Ronald J. Williams. “Learning Representations by Back-Propagating Errors.” Nature 323 (1986): 533–536.
- Schmidhuber, Jürgen. “Deep Learning in Neural Networks: An Overview.” Neural Networks 61 (2015): 85–117.
- Vaswani, Ashish, Noam Shazeer, Niki Parmar, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017).