یادگیری عمیق

از ایران پدیا
نسخهٔ تاریخ ‏۳ اکتبر ۲۰۲۶، ساعت ۲۰:۲۸ توسط Alireza k h (بحث | مشارکت‌ها) (صفحه‌ای تازه حاوی «{{جعبه اطلاعات مفهوم | نام = یادگیری عمیق | نام اصلی = Deep Learning | نام‌های دیگر = یادگیری ژرف، DL | تصویر = | اندازه تصویر = | توضیح تصویر = | حوزه = هوش مصنوعی، یادگیری ماشین، شبکه‌های عصبی مصنوعی، علوم رای...» ایجاد کرد)
(تفاوت) → نسخهٔ قدیمی‌تر | نمایش نسخهٔ فعلی (تفاوت) | نسخهٔ جدیدتر ← (تفاوت)
پرش به ناوبری پرش به جستجو
یادگیری عمیق
شناسنامه
نام‌های دیگریادگیری ژرف، DL
حوزههوش مصنوعی، یادگیری ماشین، شبکه‌های عصبی مصنوعی، علوم رایانه، علم داده
خاستگاهشبکه‌های عصبی مصنوعی، یادگیری ماشین، تشخیص الگو، آمار و علوم رایانه
اندیشه و تاریخ
مفاهیم کلیدیشبکه عصبی، لایه پنهان، پس‌انتشار، گرادیان نزولی، بازنمایی، تابع فعال‌سازی، شبکه عصبی پیچشی، شبکه بازگشتی، ترنسفورمر
جریان‌های مرتبطیادگیری ماشین، شبکه عصبی مصنوعی، هوش مصنوعی مولد، مدل زبانی بزرگ، پردازش زبان طبیعی، بینایی ماشین، یادگیری تقویتی
تأثیرپذیرفته ازیادگیری ماشین، شبکه‌های عصبی مصنوعی، آمار، بهینه‌سازی، علوم شناختی و عصب‌شناسی محاسباتی
تأثیرگذار برهوش مصنوعی مولد، مدل‌های زبانی بزرگ، بینایی ماشین، تشخیص گفتار، ترجمه ماشینی، رباتیک و پزشکی محاسباتی
نقد و ارزیابی

یادگیری عمیق یا یادگیری ژرف (به انگلیسی: Deep Learning) زیرشاخه‌ای از یادگیری ماشین و هوش مصنوعی است که عمدتاً بر شبکه‌های عصبی مصنوعی چندلایه برای یادگیری بازنمایی‌های سلسله‌مراتبی از داده‌ها استوار است. در این روش، لایه‌های متوالی شبکه می‌توانند ویژگی‌هایی با سطوح متفاوت انتزاع را از داده بیاموزند؛ برای مثال در پردازش تصویر، لایه‌های اولیه ممکن است الگوهای ساده‌تری مانند لبه‌ها را بازنمایی کنند و لایه‌های بعدی ساختارهای پیچیده‌تر را تشخیص دهند.[۱]

یادگیری عمیق یکی از فناوری‌های بنیادی در توسعهٔ هوش مصنوعی معاصر است و در تشخیص تصویر و گفتار، پردازش زبان طبیعی، ترجمهٔ ماشینی، سامانه‌های توصیه‌گر، پزشکی محاسباتی، رباتیک و هوش مصنوعی مولد کاربرد دارد.

مدل‌های زبانی بزرگ و بسیاری از سامانه‌های تولید تصویر و صوت نیز بر معماری‌ها و روش‌های یادگیری عمیق استوارند.

تعریف

یادگیری عمیق خانواده‌ای از روش‌های یادگیری ماشین است که از چندین سطح پردازش برای یادگیری بازنمایی داده استفاده می‌کند.

در مقالهٔ مروری یان لکون، یوشوا بنجیو و جفری هینتون در سال ۲۰۱۵، یادگیری عمیق به‌عنوان روشی معرفی شد که مدل‌های محاسباتی متشکل از چندین لایهٔ پردازشی را قادر می‌کند بازنمایی‌هایی از داده را در سطوح مختلف انتزاع بیاموزند.[۲]

در این ساختار، هر لایه دادهٔ دریافت‌شده از لایهٔ قبلی را به بازنمایی دیگری تبدیل می‌کند.

به‌صورت ساده:

دادهٔ خام
↓
لایهٔ نخست
↓
ویژگی‌های ساده
↓
لایه‌های میانی
↓
ویژگی‌های پیچیده‌تر
↓
بازنمایی سطح بالا
↓
خروجی

همین ساختار چندلایه یکی از دلایل استفاده از واژهٔ «عمیق» در نام این روش است.

جایگاه در هوش مصنوعی

رابطهٔ میان هوش مصنوعی، یادگیری ماشین و یادگیری عمیق را می‌توان به‌طور ساده چنین نشان داد:

هوش مصنوعی
      ↓
یادگیری ماشین
      ↓
یادگیری عمیق
      ↓
شبکه‌های عصبی عمیق
      ↓
بسیاری از مدل‌های مولد معاصر

هوش مصنوعی حوزه‌ای گسترده است.

یادگیری ماشین یکی از رویکردهای مهم در این حوزه است.

یادگیری عمیق نیز خانواده‌ای از روش‌های یادگیری ماشین است.

بنابراین یادگیری عمیق و یادگیری ماشین مترادف نیستند.

شبکهٔ عصبی مصنوعی

پایهٔ بسیاری از روش‌های یادگیری عمیق شبکهٔ عصبی مصنوعی (Artificial Neural Network) است.

شبکهٔ عصبی از واحدهای محاسباتی متصل به یکدیگر تشکیل شده است. هر واحد ورودی‌هایی دریافت می‌کند، روی آنها محاسباتی انجام می‌دهد و خروجی را به واحدهای بعدی انتقال می‌دهد.

ساختار ساده‌ای از شبکه می‌تواند شامل:

لایهٔ ورودی
↓
لایهٔ پنهان
↓
لایهٔ پنهان
↓
لایهٔ خروجی

باشد.

شبکه‌های عمیق می‌توانند تعداد بسیار بیشتری لایه و پارامتر داشته باشند.

اگرچه اصطلاح «شبکهٔ عصبی» از زیست‌شناسی الهام گرفته شده است، شبکه‌های عصبی مصنوعی مدل دقیق مغز انسان نیستند.

نورون مصنوعی

واحد پایه در بسیاری از شبکه‌های عصبی نورون مصنوعی نامیده می‌شود.

نورون مجموعه‌ای از ورودی‌ها را دریافت می‌کند:

x₁, x₂, x₃, ...

برای هر ورودی وزنی وجود دارد:

w₁, w₂, w₃, ...

سپس ترکیبی از ورودی‌ها و وزن‌ها محاسبه و از یک تابع فعال‌سازی عبور داده می‌شود.

به‌صورت ساده:

ورودی‌ها × وزن‌ها
↓
جمع
↓
تابع فعال‌سازی
↓
خروجی

در جریان آموزش، وزن‌ها تغییر می‌کنند تا عملکرد شبکه در وظیفهٔ مورد نظر بهبود یابد.

لایه‌های شبکه

شبکهٔ عصبی معمولاً شامل سه نوع کلی لایه است:

لایهٔ ورودی داده را دریافت می‌کند.

لایه‌های پنهان تبدیل‌های میانی را انجام می‌دهند.

لایهٔ خروجی نتیجهٔ نهایی را تولید می‌کند.

وجود چندین لایهٔ پنهان امکان یادگیری بازنمایی‌های پیچیده‌تر را فراهم می‌کند.

بازنمایی سلسله‌مراتبی

یکی از مفاهیم اصلی یادگیری عمیق یادگیری بازنمایی است.

فرض کنید مدل برای تشخیص چهره آموزش داده شود.

در یک تصویر، لایه‌های اولیه ممکن است ویژگی‌هایی مانند:

  • لبه؛
  • جهت؛
  • روشنایی؛
  • یا بافت

را استخراج کنند.

لایه‌های بعدی می‌توانند ترکیب‌هایی مانند:

  • چشم؛
  • بینی؛
  • دهان

را بازنمایی کنند.

لایه‌های بالاتر ممکن است ترکیب این ویژگی‌ها را برای تشخیص ساختار کلی چهره به کار گیرند.

در نتیجه، مدل می‌تواند از دادهٔ خام به بازنمایی‌های انتزاعی‌تر برسد.

تاریخچه

ریشه‌های یادگیری عمیق به تاریخ شبکه‌های عصبی مصنوعی بازمی‌گردد.

پژوهش دربارهٔ مدل‌های محاسباتی الهام‌گرفته از نورون‌ها در میانهٔ سدهٔ بیستم آغاز شد. پرسپترون فرانک روزنبلات از نمونه‌های مهم اولیه بود.

در دهه‌های بعد، پژوهشگران روش‌هایی برای آموزش شبکه‌های چندلایه توسعه دادند.

یکی از نقاط مهم تاریخی، مقالهٔ دیوید روملهارت، جفری هینتون و رونالد ویلیامز در سال ۱۹۸۶ دربارهٔ پس‌انتشار خطا بود.[۳]

این مقاله روشی را تشریح کرد که وزن‌های ارتباطات شبکه را به‌طور مکرر تغییر می‌داد تا اختلاف میان خروجی واقعی شبکه و خروجی مورد انتظار کاهش یابد.

پس‌انتشار

پس‌انتشار (Backpropagation) یکی از روش‌های بنیادی آموزش شبکه‌های عصبی است.

فرایند را می‌توان به‌طور ساده چنین نمایش داد:

ورودی
↓
عبور رو به جلو
↓
پیش‌بینی
↓
مقایسه با پاسخ واقعی
↓
محاسبهٔ خطا
↓
انتشار خطا به عقب
↓
محاسبهٔ گرادیان‌ها
↓
اصلاح وزن‌ها

در مرحلهٔ عبور رو به جلو، شبکه پیش‌بینی تولید می‌کند.

سپس تابع زیان میزان اختلاف پیش‌بینی با هدف را محاسبه می‌کند.

پس‌انتشار با استفاده از قاعدهٔ زنجیره‌ای حساب دیفرانسیل، اطلاعات لازم برای محاسبهٔ تأثیر پارامترهای مختلف بر خطا را فراهم می‌کند.

روملهارت، هینتون و ویلیامز نشان دادند که این فرایند می‌تواند موجب شود واحدهای پنهان ویژگی‌های مفیدی از مسئله را بازنمایی کنند.[۴]

دوره‌های رکود شبکه‌های عصبی

شبکه‌های عصبی در طول تاریخ همواره حوزهٔ غالب هوش مصنوعی نبودند.

محدودیت قدرت محاسباتی، کمبود داده و دشواری آموزش شبکه‌های بزرگ موجب شد توجه پژوهشی به این روش‌ها در دوره‌هایی کاهش یابد.

روش‌های دیگری مانند ماشین‌های بردار پشتیبان و مدل‌های آماری در بسیاری از کاربردها عملکرد رقابتی داشتند.

از دههٔ ۲۰۰۰، ترکیب چند عامل زمینهٔ بازگشت شبکه‌های عصبی را فراهم کرد:

  • افزایش حجم داده؛
  • افزایش توان محاسباتی؛
  • استفاده از پردازنده‌های گرافیکی؛
  • بهبود الگوریتم‌های آموزش؛
  • توسعهٔ توابع فعال‌سازی مناسب‌تر؛
  • و پیشرفت معماری شبکه‌ها.

گسترش اصطلاح یادگیری عمیق

اصطلاح «یادگیری عمیق» در دههٔ ۲۰۰۰ به‌تدریج برای توصیف روش‌های مبتنی بر معماری‌های چندلایه رواج بیشتری یافت.

در این دوره پژوهش‌های جفری هینتون، یوشوا بنجیو و دیگران نشان دادند که شبکه‌های دارای چندین سطح بازنمایی می‌توانند با روش‌های جدید آموزش داده شوند.

کتاب Deep Learning نوشتهٔ ایان گودفلو، یوشوا بنجیو و آرون کورویل در سال ۲۰۱۶ به یکی از منابع مرجع این حوزه تبدیل شد.[۵]

جهش دههٔ ۲۰۱۰

یکی از نقاط عطف یادگیری عمیق در سال ۲۰۱۲ و رقابت ImageNet رخ داد.

الکس کریژفسکی، ایلیا سوتسکور و جفری هینتون شبکهٔ عصبی پیچشی عمیقی را برای طبقه‌بندی تصاویر به کار گرفتند. عملکرد این سامانه توجه گسترده‌ای را به قابلیت شبکه‌های عصبی عمیق در بینایی ماشین جلب کرد.

این معماری بعدها با نام AlexNet شناخته شد.

موفقیت شبکه‌های عمیق در ImageNet به گسترش سریع استفاده از یادگیری عمیق در دانشگاه‌ها و صنعت کمک کرد.

پردازنده‌های گرافیکی

یکی از عوامل مهم رشد یادگیری عمیق استفاده از پردازنده‌های گرافیکی یا GPU بود.

GPUها در اصل برای پردازش گرافیک طراحی شده بودند، اما معماری آنها برای بسیاری از عملیات موازی مورد نیاز شبکه‌های عصبی نیز مناسب است.

آموزش شبکه‌ای که ممکن بود روی سخت‌افزارهای قدیمی زمان بسیار زیادی نیاز داشته باشد، با استفاده از پردازش موازی سریع‌تر شد.

بعدها شتاب‌دهنده‌های تخصصی هوش مصنوعی نیز توسعه یافتند.

داده‌های بزرگ

افزایش حجم داده‌های دیجیتال نیز نقش مهمی در توسعهٔ یادگیری عمیق داشت.

شبکه‌های بزرگ دارای تعداد زیادی پارامتر هستند و برای آموزش مؤثر اغلب به حجم قابل توجهی از داده نیاز دارند.

گسترش اینترنت، دوربین‌های دیجیتال، تلفن‌های هوشمند، حسگرها و پایگاه‌های داده موجب افزایش حجم داده‌های قابل استفاده برای آموزش شد.

تابع فعال‌سازی

تابع فعال‌سازی (Activation Function) تبدیل غیرخطی‌ای است که در واحدهای شبکه به کار می‌رود.

بدون تبدیل‌های غیرخطی، ترکیب تعداد زیادی لایهٔ خطی همچنان معادل یک تبدیل خطی خواهد بود و شبکه توانایی محدودی در مدل‌سازی روابط پیچیده خواهد داشت.

توابعی مانند:

  • Sigmoid؛
  • Tanh؛
  • ReLU؛
  • GELU

در معماری‌های مختلف استفاده شده‌اند.

ReLU

ReLU مخفف Rectified Linear Unit یکی از توابع فعال‌سازی پرکاربرد در شبکه‌های عصبی عمیق است.

شکل سادهٔ آن:

f(x) = max(0,x)

است.

یعنی اگر ورودی منفی باشد خروجی صفر و اگر مثبت باشد همان مقدار ورودی بازگردانده می‌شود.

استفادهٔ گسترده از ReLU یکی از عواملی بود که آموزش برخی شبکه‌های عمیق را ساده‌تر کرد.

گرادیان نزولی

بسیاری از شبکه‌های عمیق با نسخه‌هایی از گرادیان نزولی آموزش داده می‌شوند.

هدف، کاهش تابع زیان است.

به صورت ساده:

وزن‌های اولیه
↓
پیش‌بینی
↓
محاسبهٔ خطا
↓
محاسبهٔ گرادیان
↓
تغییر وزن‌ها
↓
پیش‌بینی جدید
↓
تکرار

این فرایند ممکن است میلیون‌ها یا میلیاردها بار در جریان آموزش انجام شود.

شبکه‌های عصبی پیچشی

شبکهٔ عصبی پیچشی (Convolutional Neural Network یا CNN) خانواده‌ای از شبکه‌هاست که به‌ویژه در پردازش داده‌های دارای ساختار فضایی، مانند تصویر، تأثیرگذار بوده است.

CNNها از عملیات پیچش برای استخراج ویژگی‌های محلی استفاده می‌کنند.

این شبکه‌ها در:

  • طبقه‌بندی تصویر؛
  • تشخیص اشیا؛
  • تشخیص چهره؛
  • تصاویر پزشکی؛
  • تصاویر ماهواره‌ای؛
  • و پردازش ویدئو

کاربرد داشته‌اند.

پژوهش‌های یان لکون و همکاران دربارهٔ شبکه‌های پیچشی از آثار مهم در توسعهٔ این معماری بودند.

شبکه‌های بازگشتی

شبکهٔ عصبی بازگشتی (Recurrent Neural Network یا RNN) برای پردازش داده‌های دنباله‌ای طراحی شده است.

از کاربردهای تاریخی آن می‌توان به:

  • پردازش متن؛
  • گفتار؛
  • ترجمه؛
  • سری‌های زمانی

اشاره کرد.

RNNها دارای سازوکاری هستند که اطلاعات مراحل پیشین توالی می‌تواند بر پردازش مرحلهٔ بعد اثر بگذارد.

LSTM

یکی از انواع مهم شبکه‌های بازگشتی حافظهٔ طولانی کوتاه‌مدت یا LSTM است.

LSTM برای کاهش برخی مشکلات شبکه‌های بازگشتی در یادگیری وابستگی‌های بلندمدت توسعه یافت.

پیش از گسترش ترنسفورمرها، LSTMها در بسیاری از سامانه‌های ترجمه، گفتار و پردازش زبان کاربرد گسترده داشتند.

ترنسفورمر

ترنسفورمر یکی از مهم‌ترین معماری‌های یادگیری عمیق معاصر است.

در سال ۲۰۱۷، اشیش واسوانی و همکاران مقالهٔ Attention Is All You Need را منتشر کردند و معماری ترنسفورمر را معرفی کردند.

این معماری به جای تکیهٔ اصلی بر بازگشت، از سازوکار توجه برای مدل‌کردن رابطهٔ میان عناصر توالی استفاده می‌کند.

ترنسفورمر بعدها پایهٔ بسیاری از مدل‌های زبانی بزرگ و سامانه‌های هوش مصنوعی مولد شد.

سازوکار توجه

توجه (Attention) به مدل اجازه می‌دهد هنگام پردازش یک عنصر، اهمیت عناصر دیگر را به‌صورت پویا محاسبه کند.

برای مثال در جمله:

«مریم کتاب را برداشت زیرا او می‌خواست آن را بخواند.»

برای تفسیر «آن»، مدل باید ارتباط آن را با «کتاب» در نظر بگیرد.

سازوکار توجه روشی محاسباتی برای مدل‌کردن چنین روابطی فراهم می‌کند.

خودتوجهی

خودتوجهی (Self-Attention) نوعی سازوکار توجه است که روابط میان عناصر یک توالی را با عناصر دیگر همان توالی محاسبه می‌کند.

در ترنسفورمر، خودتوجهی امکان پردازش روابط دور و نزدیک میان توکن‌ها را فراهم می‌کند.

این ویژگی نقش مهمی در موفقیت معماری ترنسفورمر در پردازش زبان داشته است.

یادگیری عمیق و پردازش زبان طبیعی

یادگیری عمیق تحول بزرگی در پردازش زبان طبیعی ایجاد کرده است.

از کاربردهای آن می‌توان به:

  • ترجمهٔ ماشینی؛
  • خلاصه‌سازی؛
  • پاسخ به پرسش؛
  • تحلیل متن؛
  • تشخیص گفتار؛
  • تولید متن؛
  • و بازیابی اطلاعات

اشاره کرد.

شبکه‌های بازگشتی و سپس ترنسفورمرها در توسعهٔ این حوزه نقش مهمی داشته‌اند.

مدل‌های زبانی بزرگ

مدل‌های زبانی بزرگ یا LLMها نمونه‌ای از کاربرد یادگیری عمیق هستند.

بسیاری از این مدل‌ها دارای شبکه‌های ترنسفورمری با شمار زیادی پارامتر هستند و با حجم بزرگی از دادهٔ متنی آموزش داده می‌شوند.

در مدل‌های خودرگرسیو، مدل معمولاً یاد می‌گیرد بر اساس توکن‌های پیشین احتمال توکن بعدی را تخمین بزند.

به صورت ساده:

متن
↓
توکن‌ها
↓
ترنسفورمر
↓
احتمال توکن بعدی
↓
انتخاب توکن
↓
تکرار
↓
متن تولیدشده

یادگیری عمیق و هوش مصنوعی مولد

هوش مصنوعی مولد یکی از مهم‌ترین حوزه‌های کاربرد یادگیری عمیق است.

مدل‌های مولد می‌توانند:

  • متن؛
  • تصویر؛
  • صوت؛
  • موسیقی؛
  • ویدئو؛
  • کد؛
  • و داده‌های مصنوعی

تولید کنند.

مدل‌های زبانی، مدل‌های انتشار و برخی مدل‌های مولد دیگر بر معماری‌ها و روش‌های یادگیری عمیق استوارند.

مدل‌های انتشار

مدل‌های انتشار (Diffusion Models) خانواده‌ای از مدل‌های مولد هستند که در تولید تصویر و دیگر انواع داده کاربرد گسترده یافته‌اند.

در یک توصیف ساده، مدل می‌آموزد فرایند افزودن نویز به داده را معکوس کند.

فرایند تولید را می‌توان چنین تصور کرد:

نویز
↓
حذف تدریجی نویز
↓
ساختار اولیه
↓
جزئیات بیشتر
↓
تصویر

این روش پایهٔ بسیاری از سامانه‌های تولید تصویر معاصر شده است.

یادگیری عمیق در بینایی ماشین

یکی از نخستین حوزه‌هایی که تأثیر گستردهٔ یادگیری عمیق در آن آشکار شد بینایی ماشین بود.

شبکه‌های عمیق می‌توانند برای:

  • طبقه‌بندی تصویر؛
  • تشخیص شیء؛
  • تقسیم‌بندی تصویر؛
  • تشخیص چهره؛
  • تحلیل تصاویر پزشکی؛
  • و هدایت ربات

آموزش داده شوند.

شبکه‌های پیچشی برای سال‌ها معماری غالب بسیاری از این کاربردها بودند و بعدها ترنسفورمرهای بینایی نیز گسترش یافتند.

تشخیص گفتار

یادگیری عمیق در سامانه‌های تشخیص گفتار نیز نقش مهمی داشته است.

مدل‌ها می‌توانند سیگنال صوتی را به بازنمایی‌هایی تبدیل کنند که برای تشخیص واج، واژه و جمله استفاده می‌شوند.

این فناوری در:

  • تبدیل گفتار به متن؛
  • زیرنویس خودکار؛
  • دستیار صوتی؛
  • رونویسی؛
  • و سامانه‌های دسترس‌پذیری

کاربرد دارد.

پزشکی

در پزشکی، یادگیری عمیق برای تحلیل:

  • تصاویر رادیولوژی؛
  • سی‌تی‌اسکن؛
  • MRI؛
  • تصاویر پاتولوژی؛
  • داده‌های ژنتیکی؛
  • و پرونده‌های پزشکی

مورد مطالعه قرار گرفته است.

با این حال عملکرد یک مدل پزشکی باید در جمعیت هدف و شرایط واقعی ارزیابی شود.

دقت بالا روی مجموعهٔ آزمایشی به‌تنهایی تضمین‌کنندهٔ عملکرد ایمن در محیط بالینی نیست.

خودروهای خودران

یادگیری عمیق در سامانه‌های رانندگی خودکار برای تحلیل داده‌های دوربین و حسگرها استفاده می‌شود.

مدل‌ها می‌توانند:

  • عابر پیاده؛
  • خودرو؛
  • چراغ راهنمایی؛
  • علائم؛
  • خطوط جاده؛
  • و موانع

را شناسایی کنند.

این اطلاعات سپس همراه با دیگر سامانه‌های مکان‌یابی، برنامه‌ریزی و کنترل برای تصمیم‌گیری خودرو استفاده می‌شود.

رباتیک

در رباتیک، یادگیری عمیق می‌تواند برای:

  • ادراک محیط؛
  • تشخیص اشیا؛
  • کنترل؛
  • برنامه‌ریزی حرکت؛
  • یادگیری از نمایش؛
  • و تعامل انسان و ربات

به کار رود.

ترکیب یادگیری عمیق و یادگیری تقویتی یکی از حوزه‌های پژوهشی مهم در رباتیک است.

سامانه‌های توصیه‌گر

شبکه‌های عمیق در برخی سامانه‌های توصیه‌گر برای یادگیری بازنمایی کاربران و محتوا استفاده می‌شوند.

این سامانه‌ها می‌توانند بر اساس سابقهٔ تعامل کاربران احتمال علاقه به یک محتوا را تخمین بزنند.

فروشگاه‌های اینترنتی، شبکه‌های اجتماعی و خدمات رسانه‌ای از سامانه‌های توصیه‌گر استفاده می‌کنند.

مزایای یادگیری عمیق

یکی از مهم‌ترین مزایای یادگیری عمیق توانایی یادگیری خودکار بازنمایی است.

در بسیاری از روش‌های سنتی یادگیری ماشین، متخصص باید ویژگی‌های مناسب را تا حد زیادی به‌صورت دستی طراحی کند.

در یادگیری عمیق، مدل می‌تواند بسیاری از ویژگی‌های مورد نیاز را از داده بیاموزد.

از دیگر مزایا می‌توان به توانایی پردازش داده‌های پیچیده و غیرساخت‌یافته مانند متن، تصویر و صوت اشاره کرد.

نیاز به داده

مدل‌های عمیق اغلب به حجم زیادی از داده نیاز دارند، هرچند مقدار لازم به معماری، وظیفه، پیش‌آموزش و روش یادگیری بستگی دارد.

تهیهٔ دادهٔ باکیفیت می‌تواند دشوار و پرهزینه باشد.

همچنین دادهٔ زیاد لزوماً دادهٔ خوب نیست.

کیفیت، تنوع و تناسب داده با کاربرد اهمیت بنیادی دارد.

هزینهٔ محاسباتی

آموزش مدل‌های عمیق بزرگ می‌تواند به منابع محاسباتی قابل توجهی نیاز داشته باشد.

این منابع شامل:

  • GPU؛
  • شتاب‌دهنده‌های تخصصی؛
  • حافظه؛
  • ذخیره‌سازی؛
  • شبکهٔ پرسرعت؛
  • برق؛
  • و سامانه‌های خنک‌کننده

هستند.

رشد اندازهٔ مدل‌ها موجب شده هزینه و مصرف انرژی به یکی از موضوعات مورد بحث در توسعهٔ هوش مصنوعی تبدیل شود.

بیش‌برازش

مانند دیگر روش‌های یادگیری ماشین، شبکه‌های عمیق نیز ممکن است دچار بیش‌برازش شوند.

در این وضعیت، مدل روی داده‌های آموزشی عملکرد خوبی دارد اما روی داده‌های جدید ضعیف‌تر عمل می‌کند.

روش‌هایی مانند:

  • منظم‌سازی؛
  • افزایش داده؛
  • توقف زودهنگام؛
  • Dropout؛
  • و استفاده از دادهٔ بیشتر

برای کاهش بیش‌برازش به کار می‌روند.

جعبهٔ سیاه

یکی از انتقادهای مطرح دربارهٔ شبکه‌های عمیق دشواری توضیح برخی تصمیم‌های آنهاست.

شبکه‌ای با میلیون‌ها یا میلیاردها پارامتر می‌تواند رابطه‌ای بسیار پیچیده میان ورودی و خروجی ایجاد کند.

ممکن است مدل بتواند پاسخ دقیقی ارائه کند، اما توضیح این‌که دقیقاً چرا آن پاسخ را انتخاب کرده دشوار باشد.

این مسئله زمینهٔ پژوهش دربارهٔ هوش مصنوعی توضیح‌پذیر را تقویت کرده است.

سوگیری الگوریتمی

سوگیری الگوریتمی یکی از مسائل مهم سامانه‌های یادگیری عمیق است.

مدل از داده می‌آموزد و اگر داده دارای عدم توازن، سوگیری تاریخی یا پوشش نامناسب باشد، مدل می‌تواند بخشی از همان الگوها را بازتولید کند.

برای مثال سامانهٔ تشخیص چهره‌ای که دادهٔ آموزشی آن نمایندگی کافی از گروه‌های مختلف ندارد ممکن است نرخ خطای متفاوتی میان آنها داشته باشد.

بنابراین ارزیابی مدل باید برای گروه‌ها و شرایط مختلف انجام شود.

حریم خصوصی

استفاده از مجموعه‌های بزرگ داده برای آموزش مدل‌های عمیق پرسش‌هایی دربارهٔ حریم خصوصی ایجاد کرده است.

این پرسش‌ها شامل:

  • منشأ داده؛
  • رضایت صاحبان داده؛
  • اطلاعات شخصی؛
  • امکان بازسازی اطلاعات؛
  • امنیت مجموعهٔ آموزشی؛
  • و حق استفاده از داده

می‌شود.

این مسائل به‌ویژه در داده‌های پزشکی و اطلاعات شخصی اهمیت دارند.

توهم هوش مصنوعی

در مدل‌های مولد عمیق، به‌ویژه مدل‌های زبانی، یکی از مسائل شناخته‌شده توهم هوش مصنوعی است.

مدل ممکن است متن بسیار روان و ظاهراً معتبر تولید کند اما بخشی از اطلاعات آن نادرست یا ساختگی باشد.

برای مثال مدل ممکن است:

  • منبعی غیرواقعی؛
  • نقل‌قولی ساختگی؛
  • تاریخی اشتباه؛
  • یا رویدادی ناموجود

تولید کند.

این مسئله نشان می‌دهد توانایی یادگیری الگوهای پیچیدهٔ زبان به معنای وجود سامانه‌ای تضمین‌شده برای تشخیص حقیقت نیست.

حملات خصمانه

شبکه‌های عمیق می‌توانند در برابر حملات خصمانه آسیب‌پذیر باشند.

در برخی شرایط، تغییر بسیار کوچکی در ورودی می‌تواند موجب تغییر شدید خروجی مدل شود.

برای مثال تغییرات خاصی در تصویر که برای چشم انسان ناچیز به نظر می‌رسند ممکن است مدل طبقه‌بندی را به تشخیص اشتباه وادار کنند.

این موضوع یکی از حوزه‌های پژوهش در امنیت هوش مصنوعی است.

تغییر توزیع داده

مدل عمیق معمولاً بر اساس توزیع مشخصی از داده آموزش می‌بیند.

اگر شرایط واقعی تغییر کند، عملکرد مدل ممکن است کاهش یابد.

برای مثال مدلی که تصاویر پزشکی یک نوع دستگاه یا یک جمعیت خاص را دیده است ممکن است روی تصاویر حاصل از تجهیزات یا جمعیتی متفاوت عملکرد دیگری داشته باشد.

به همین دلیل اعتبارسنجی مدل در محیط واقعی اهمیت دارد.

یادگیری عمیق و علیت

مدل‌های عمیق در کشف الگوهای آماری بسیار قدرتمند هستند، اما همبستگی آماری را نباید خودبه‌خود معادل رابطهٔ علت و معلولی دانست.

اگر مدل متوجه شود دو ویژگی معمولاً با هم ظاهر می‌شوند، این مسئله ثابت نمی‌کند که یکی علت دیگری است.

این تمایز در علوم اجتماعی، پزشکی و سیاست‌گذاری اهمیت ویژه دارد.

یادگیری عمیق و نیروی انسانی

گسترش یادگیری عمیق بر ساختار برخی مشاغل نیز تأثیر گذاشته است.

سامانه‌های مبتنی بر این فناوری می‌توانند بخشی از وظایف مربوط به:

  • ترجمه؛
  • تولید محتوا؛
  • برنامه‌نویسی؛
  • طراحی؛
  • تحلیل اسناد؛
  • خدمات مشتری؛
  • و پردازش اطلاعات

را خودکار یا نیمه‌خودکار کنند.

با این حال تأثیر واقعی بر اشتغال به نوع صنعت، نحوهٔ استفاده از فناوری، قوانین و سازگاری نیروی کار وابسته است.

یادگیری عمیق و تمرکز قدرت محاسباتی

آموزش مدل‌های بسیار بزرگ به زیرساخت محاسباتی و سرمایهٔ قابل توجه نیاز دارد.

این مسئله می‌تواند توان توسعهٔ برخی مدل‌های پیشرفته را در تعداد محدودی از شرکت‌ها، دولت‌ها و مؤسسات پژوهشی متمرکز کند.

این تمرکز پرسش‌هایی دربارهٔ:

  • دسترسی به فناوری؛
  • شفافیت؛
  • رقابت؛
  • نظارت؛
  • مالکیت داده؛
  • و پاسخگویی

ایجاد کرده است.

از این رو پیامدهای یادگیری عمیق تنها موضوعی فنی نیست و ابعاد اقتصادی و اجتماعی نیز دارد.

یادگیری عمیق و اطلاعات

شبکه‌های عمیق در موتورهای جست‌وجو، سامانه‌های توصیه‌گر و شبکه‌های اجتماعی می‌توانند در رتبه‌بندی و انتخاب محتوایی که کاربران مشاهده می‌کنند نقش داشته باشند.

این موضوع در مطالعات رسانه و جامعه‌شناسی سیاسی اهمیت دارد، زیرا معماری سامانه‌های توصیه‌گر می‌تواند بر جریان اطلاعات اثر بگذارد.

با این حال برای ارزیابی تأثیر سیاسی یا اجتماعی هر سامانه باید داده‌های مربوط به همان سامانه و نحوهٔ استفاده از آن بررسی شود.

یادگیری عمیق و ایران

در ایران، پژوهش‌های مرتبط با یادگیری عمیق در دانشگاه‌ها و حوزه‌هایی مانند پردازش زبان فارسی، بینایی ماشین، پزشکی، تشخیص گفتار و تحلیل داده انجام شده است.

برای توسعهٔ مدل‌های زبان فارسی، کیفیت و تنوع داده‌های فارسی اهمیت ویژه‌ای دارد.

دادهٔ ناکافی یا نامتوازن می‌تواند موجب عملکرد ضعیف‌تر مدل در زبان فارسی، گویش‌ها یا گونه‌های زبانی کم‌نماینده شود.

از سوی دیگر، استفاده از فناوری‌های مبتنی بر یادگیری عمیق در نظارت، تشخیص چهره یا تحلیل داده‌های شهروندان، در صورت کاربرد حکومتی، موضوعاتی مانند حریم خصوصی، آزادی‌های مدنی، شفافیت و پاسخگویی را مطرح می‌کند. هر ادعای مشخص دربارهٔ استفادهٔ نهادهای جمهوری اسلامی از چنین سامانه‌هایی نیازمند منابع مستقل و قابل راستی‌آزمایی است.

تفاوت یادگیری ماشین و یادگیری عمیق

یادگیری عمیق بخشی از یادگیری ماشین است، نه اصطلاحی مترادف با آن.

یادگیری ماشین شامل طیف وسیعی از الگوریتم‌ها مانند:

  • رگرسیون؛
  • درخت تصمیم؛
  • جنگل تصادفی؛
  • ماشین بردار پشتیبان؛
  • خوشه‌بندی؛
  • و شبکه‌های عصبی

است.

یادگیری عمیق عمدتاً به شبکه‌های عصبی دارای چندین سطح پردازش و یادگیری بازنمایی اشاره دارد.

بنابراین:

همهٔ یادگیری عمیق‌ها ⊂ یادگیری ماشین

اما:

همهٔ روش‌های یادگیری ماشین ≠ یادگیری عمیق

تفاوت یادگیری عمیق و هوش مصنوعی مولد

هوش مصنوعی مولد و یادگیری عمیق نیز مترادف نیستند.

یادگیری عمیق یک خانواده از روش‌های یادگیری است.

هوش مصنوعی مولد به سامانه‌هایی اشاره دارد که محتوای جدید تولید می‌کنند.

بسیاری از سامانه‌های مولد جدید از یادگیری عمیق استفاده می‌کنند، اما همهٔ کاربردهای یادگیری عمیق مولد نیستند.

برای مثال شبکه‌ای که فقط تشخیص می‌دهد تصویر دارای گربه است یا سگ، می‌تواند یک مدل عمیق باشد بدون آن‌که محتوای جدیدی تولید کند.

آیندهٔ یادگیری عمیق

پژوهش در یادگیری عمیق همچنان در زمینه‌هایی مانند:

  • مدل‌های بنیادی؛
  • مدل‌های چندوجهی؛
  • عامل‌های هوشمند؛
  • رباتیک؛
  • مدل‌های کارآمدتر؛
  • یادگیری با دادهٔ کمتر؛
  • تفسیرپذیری؛
  • ایمنی؛
  • و کاهش مصرف محاسباتی

ادامه دارد.

یکی از پرسش‌های بنیادی آینده این است که افزایش اندازهٔ مدل و داده تا چه اندازه می‌تواند توانایی‌های جدید ایجاد کند و چه روش‌های دیگری برای افزایش قابلیت اعتماد، کارایی و استدلال لازم خواهد بود.

جمع‌بندی

یادگیری عمیق زیرشاخه‌ای از یادگیری ماشین است که عمدتاً از شبکه‌های عصبی چندلایه برای یادگیری بازنمایی‌های سلسله‌مراتبی داده استفاده می‌کند. لایه‌های مختلف شبکه می‌توانند ویژگی‌هایی با سطوح متفاوت انتزاع را بیاموزند؛ ویژگی‌ای که یادگیری عمیق را برای پردازش تصویر، صوت و زبان مناسب کرده است.[۶]

ریشه‌های آن به پژوهش‌های شبکه‌های عصبی در سدهٔ بیستم بازمی‌گردد. توسعهٔ روش پس‌انتشار و پژوهش روملهارت، هینتون و ویلیامز در سال ۱۹۸۶ یکی از مراحل مهم تاریخی آموزش شبکه‌های چندلایه بود.[۷]

افزایش قدرت محاسباتی، دسترسی به مجموعه‌های بزرگ داده و پیشرفت الگوریتم‌ها موجب شد یادگیری عمیق در دههٔ ۲۰۱۰ به یکی از رویکردهای اصلی هوش مصنوعی تبدیل شود. شبکه‌های پیچشی، شبکه‌های بازگشتی و سپس ترنسفورمرها مراحل مهم این تحول را شکل دادند.

امروزه بسیاری از مدل‌های زبانی بزرگ و سامانه‌های هوش مصنوعی مولد بر یادگیری عمیق استوارند. در مقابل، هزینهٔ محاسباتی، سوگیری الگوریتمی، حریم خصوصی، دشواری توضیح تصمیم‌ها، آسیب‌پذیری امنیتی و توهم هوش مصنوعی از چالش‌های مهم این فناوری به شمار می‌روند.

از این رو یادگیری عمیق را می‌توان یکی از فناوری‌های بنیادی موج کنونی هوش مصنوعی دانست که امکان یادگیری بازنمایی‌های پیچیده از حجم بزرگی از داده را فراهم کرده و در عین حال مجموعه‌ای از مسائل فنی، اجتماعی و اخلاقی تازه را پدید آورده است.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016.
  • Krizhevsky, Alex, Ilya Sutskever, and Geoffrey E. Hinton. “ImageNet Classification with Deep Convolutional Neural Networks.” Advances in Neural Information Processing Systems 25 (2012).
  • LeCun, Yann, Yoshua Bengio, and Geoffrey Hinton. “Deep Learning.” Nature 521 (2015): 436–444.
  • LeCun, Yann, Léon Bottou, Yoshua Bengio, and Patrick Haffner. “Gradient-Based Learning Applied to Document Recognition.” Proceedings of the IEEE 86, no. 11 (1998): 2278–2324.
  • Rumelhart, David E., Geoffrey E. Hinton, and Ronald J. Williams. “Learning Representations by Back-Propagating Errors.” Nature 323 (1986): 533–536.
  • Schmidhuber, Jürgen. “Deep Learning in Neural Networks: An Overview.” Neural Networks 61 (2015): 85–117.
  • Vaswani, Ashish, Noam Shazeer, Niki Parmar, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017).