یادگیری ماشینی

از ایران پدیا
پرش به ناوبری پرش به جستجو
یادگیری ماشینی
شناسنامه
نام‌های دیگریادگیری ماشینی، ML
حوزههوش مصنوعی، علوم رایانه، آمار، علم داده، بهینه‌سازی
خاستگاهعلوم رایانه، آمار، نظریهٔ اطلاعات، تشخیص الگو و پژوهش‌های اولیهٔ هوش مصنوعی
اندیشه و تاریخ
مفاهیم کلیدیدادهٔ آموزشی، ویژگی، مدل، آموزش، استنتاج، تعمیم، یادگیری نظارت‌شده، یادگیری بدون نظارت، یادگیری تقویتی، بیش‌برازش، کم‌برازش
جریان‌های مرتبطهوش مصنوعی، یادگیری عمیق، شبکه‌های عصبی مصنوعی، پردازش زبان طبیعی، بینایی ماشین، علم داده، هوش مصنوعی مولد
تأثیرپذیرفته ازآمار، احتمال، نظریهٔ اطلاعات، علوم رایانه، علوم شناختی، عصب‌شناسی محاسباتی و بهینه‌سازی
تأثیرگذار برهوش مصنوعی مولد، موتورهای جست‌وجو، سامانه‌های توصیه‌گر، تشخیص تصویر و گفتار، خودروهای خودران، پزشکی محاسباتی و تحلیل داده
نقد و ارزیابی

یادگیری ماشین یا یادگیری ماشینی (به انگلیسی: Machine Learning و به اختصار ML) شاخه‌ای از هوش مصنوعی و علوم رایانه است که به توسعهٔ الگوریتم‌ها و مدل‌هایی می‌پردازد که می‌توانند از داده‌ها الگو استخراج کنند و بر اساس تجربهٔ حاصل از داده، در وظایفی مانند پیش‌بینی، طبقه‌بندی، تشخیص الگو، تصمیم‌گیری یا تولید محتوا عمل کنند.

در یادگیری ماشین به جای آن‌که برنامه‌نویس همهٔ قواعد لازم برای حل مسئله را به‌صورت صریح در برنامه بنویسد، سامانه با استفاده از داده و یک روش یادگیری، پارامترهای مدلی را تنظیم می‌کند که بتواند رابطه‌ها و الگوهای مورد نظر را بازنمایی کند. این ویژگی، یادگیری ماشین را برای مسائلی مانند تشخیص تصویر، شناسایی گفتار، ترجمهٔ ماشینی و کشف الگو در مجموعه‌های بزرگ داده مناسب کرده است.[۱]

یادگیری ماشین زیربنای بسیاری از پیشرفت‌های معاصر در هوش مصنوعی است. یادگیری عمیق، مدل‌های زبانی بزرگ و بسیاری از سامانه‌های هوش مصنوعی مولد بر روش‌های یادگیری ماشین استوارند.

تعریف

تعریف واحدی که همهٔ پژوهشگران برای یادگیری ماشین به کار ببرند وجود ندارد، اما عنصر مشترک بیشتر تعریف‌ها یادگیری از داده یا تجربه است.

آرتور ساموئل، از پیشگامان این حوزه، در پژوهش‌های خود دربارهٔ برنامهٔ بازی چکرز از اصطلاح Machine Learning استفاده کرد و سامانه‌ای را توسعه داد که می‌توانست عملکرد خود را بر اساس تجربه بهبود دهد.[۲]

تام میچل بعدها تعریف صوری شناخته‌شده‌ای ارائه کرد. بر اساس آن، یک برنامهٔ رایانه‌ای از تجربهٔ E نسبت به دسته‌ای از وظایف T و معیار عملکرد P یاد می‌گیرد، اگر عملکرد آن در وظایف T، بر اساس معیار P، با تجربهٔ E بهبود یابد.[۳]

این تعریف سه عنصر اساسی را مشخص می‌کند:

  • وظیفه؛
  • تجربه؛
  • معیار عملکرد.

تاریخچه

ریشه‌های نظری یادگیری ماشین را می‌توان در آمار، منطق، علوم رایانه، نظریهٔ اطلاعات و پژوهش‌های اولیه دربارهٔ هوش مصنوعی جست‌وجو کرد.

در سال ۱۹۵۰، آلن تورینگ در مقالهٔ مشهور Computing Machinery and Intelligence مسئلهٔ توانایی ماشین برای نشان‌دادن رفتار هوشمند را بررسی کرد.[۴]

در دههٔ ۱۹۵۰ پژوهشگران به ساخت برنامه‌هایی پرداختند که می‌توانستند بر اساس تجربه عملکرد خود را تغییر دهند.

آرتور ساموئل در شرکت IBM برنامه‌ای برای بازی چکرز ایجاد کرد که از تجربهٔ بازی استفاده می‌کرد. مقالهٔ او در سال ۱۹۵۹ از آثار اولیه و اثرگذار در شکل‌گیری حوزهٔ یادگیری ماشین محسوب می‌شود.[۵]

پرسپترون

یکی دیگر از تحولات مهم اولیه، توسعهٔ پرسپترون (Perceptron) توسط فرانک روزنبلات در دههٔ ۱۹۵۰ بود.

پرسپترون یکی از مدل‌های اولیهٔ شبکهٔ عصبی مصنوعی بود و برای یادگیری دسته‌بندی‌های ساده طراحی شد.

این مدل نقش مهمی در تاریخ شبکه‌های عصبی داشت، اگرچه محدودیت‌های ریاضی آن بعدها موجب کاهش توجه به برخی رویکردهای شبکهٔ عصبی شد.

پژوهش دربارهٔ شبکه‌های عصبی در دهه‌های بعد دوباره گسترش یافت و نهایتاً یکی از پایه‌های یادگیری عمیق شد.

تفاوت برنامه‌نویسی سنتی و یادگیری ماشین

در برنامه‌نویسی سنتی، برنامه‌نویس معمولاً قواعد لازم برای تبدیل ورودی به خروجی را مشخص می‌کند.

به صورت ساده:

داده + قواعد → پاسخ

برای مثال، اگر هدف محاسبهٔ مالیات بر اساس مجموعه‌ای از قواعد مشخص باشد، برنامه‌نویس می‌تواند همان قواعد را مستقیماً در کد بنویسد.

در یادگیری ماشین رابطه متفاوت است:

داده + پاسخ‌های نمونه → فرایند آموزش → مدل

و سپس:

دادهٔ جدید + مدل → پیش‌بینی

در اینجا بسیاری از قواعد به صورت دستی نوشته نمی‌شوند؛ مدل آنها را از الگوهای موجود در داده استخراج می‌کند.

داده

داده یکی از عناصر بنیادی یادگیری ماشین است.

مدل‌ها برای یادگیری به نمونه‌هایی نیاز دارند که بتوان از آنها روابط آماری استخراج کرد.

داده می‌تواند شامل:

  • متن؛
  • تصویر؛
  • صدا؛
  • ویدئو؛
  • اعداد؛
  • سوابق تراکنش؛
  • اطلاعات حسگرها؛
  • داده‌های پزشکی؛
  • یا ترکیبی از آنها

باشد.

کیفیت، تنوع، اندازه و نمایندگی داده‌ها می‌تواند تأثیر قابل توجهی بر عملکرد مدل داشته باشد.

مجموعهٔ آموزشی

مجموعهٔ آموزشی (Training Set) داده‌ای است که برای آموزش مدل استفاده می‌شود.

مدل در فرایند آموزش پارامترهای خود را بر اساس این داده‌ها تنظیم می‌کند.

اما ارزیابی مدل صرفاً بر اساس داده‌ای که قبلاً دیده است کافی نیست.

مدلی که داده‌های آموزشی را به‌خوبی حفظ کرده باشد ممکن است روی داده‌های جدید عملکرد ضعیفی داشته باشد.

به همین دلیل داده‌ها معمولاً به مجموعه‌های مختلفی مانند آموزش، اعتبارسنجی و آزمون تقسیم می‌شوند.

مجموعهٔ اعتبارسنجی

مجموعهٔ اعتبارسنجی (Validation Set) برای ارزیابی انتخاب‌های مربوط به مدل در فرایند توسعه استفاده می‌شود.

برای مثال، پژوهشگر ممکن است چند معماری یا مجموعهٔ متفاوت از ابرپارامترها را آزمایش کند و بر اساس عملکرد روی دادهٔ اعتبارسنجی یکی را انتخاب کند.

این مجموعه به جلوگیری از تنظیم مدل صرفاً بر اساس دادهٔ آموزشی کمک می‌کند.

مجموعهٔ آزمون

مجموعهٔ آزمون (Test Set) برای ارزیابی نهایی عملکرد مدل روی داده‌هایی استفاده می‌شود که در آموزش مدل به کار نرفته‌اند.

هدف آن تخمین توانایی مدل برای تعمیم به نمونه‌های جدید است.

اگر دادهٔ آزمون در فرایند آموزش یا تنظیم مدل وارد شود، ارزیابی ممکن است تصویری بیش از حد خوش‌بینانه از عملکرد واقعی ارائه دهد.

ویژگی

ویژگی (Feature) متغیر یا اطلاعاتی است که برای پیش‌بینی مورد استفاده قرار می‌گیرد.

برای مثال در مدلی برای پیش‌بینی قیمت خانه، ویژگی‌ها ممکن است شامل:

  • مساحت؛
  • تعداد اتاق‌ها؛
  • سن ساختمان؛
  • موقعیت جغرافیایی؛
  • و فاصله از مرکز شهر

باشند.

در یادگیری عمیق، بسیاری از بازنمایی‌های مورد نیاز به جای طراحی دستی، توسط خود شبکه در جریان آموزش آموخته می‌شوند.

مدل

مدل ساختاری ریاضی یا محاسباتی است که رابطه‌ای را از داده‌ها می‌آموزد.

مدل می‌تواند از یک رگرسیون خطی ساده تا شبکه‌ای عصبی با میلیاردها پارامتر متغیر باشد.

هدف آموزش آن است که پارامترهای مدل به گونه‌ای تنظیم شوند که معیار مورد نظر بهبود یابد.

آموزش

آموزش (Training) فرایندی است که طی آن پارامترهای مدل با استفاده از داده تنظیم می‌شوند.

در بسیاری از الگوریتم‌ها یک تابع زیان (Loss Function) میزان اختلاف میان خروجی مدل و هدف مورد نظر را اندازه‌گیری می‌کند.

الگوریتم بهینه‌سازی تلاش می‌کند این زیان را کاهش دهد.

به شکل ساده:

داده
↓
مدل
↓
پیش‌بینی
↓
مقایسه با هدف
↓
محاسبهٔ خطا
↓
اصلاح پارامترها
↓
تکرار

استنتاج

پس از آموزش، مدل می‌تواند برای داده‌های جدید استفاده شود.

این مرحله استنتاج (Inference) نامیده می‌شود.

برای مثال، یک مدل تشخیص تصویر پس از آموزش می‌تواند تصویر جدیدی را دریافت کند و احتمال دهد که تصویر متعلق به چه دسته‌ای است.

آموزش و استنتاج بنابراین دو مرحلهٔ متفاوت‌اند.

تعمیم

یکی از اهداف بنیادی یادگیری ماشین تعمیم (Generalization) است.

مدل مطلوب نباید تنها نمونه‌های آموزشی را حفظ کند، بلکه باید الگوهایی را بیاموزد که در داده‌های جدید نیز کاربرد داشته باشند.

اگر مدلی در داده‌های آموزشی بسیار دقیق باشد اما در داده‌های جدید عملکرد ضعیفی داشته باشد، با مسئلهٔ بیش‌برازش روبه‌رو هستیم.

بیش‌برازش

بیش‌برازش (Overfitting) زمانی رخ می‌دهد که مدل بیش از اندازه با ویژگی‌ها یا نویز داده‌های آموزشی تطبیق پیدا کند و توانایی تعمیم آن کاهش یابد.

برای مثال، دانش‌آموزی را می‌توان تصور کرد که پاسخ‌های یک آزمون را حفظ کرده اما مفهوم درس را نیاموخته است.

ممکن است در همان آزمون عملکرد عالی داشته باشد، اما با پرسش‌های جدید مشکل پیدا کند.

مدل بیش‌برازش‌شده نیز رفتاری مشابه دارد.

کم‌برازش

کم‌برازش (Underfitting) زمانی رخ می‌دهد که مدل به اندازهٔ کافی قادر به یادگیری ساختار داده نباشد.

در این حالت مدل حتی روی داده‌های آموزشی نیز عملکرد مطلوبی ندارد.

مدلی بسیار ساده برای مسئله‌ای پیچیده ممکن است دچار کم‌برازش شود.

بنابراین طراحی مدل معمولاً نیازمند ایجاد تعادل میان ظرفیت یادگیری و توانایی تعمیم است.

انواع اصلی یادگیری ماشین

روش‌های یادگیری ماشین را می‌توان بر اساس نوع داده و شیوهٔ دریافت بازخورد به چند دسته تقسیم کرد.

از شناخته‌شده‌ترین آنها عبارت‌اند از:

  • یادگیری نظارت‌شده؛
  • یادگیری بدون نظارت؛
  • یادگیری نیمه‌نظارت‌شده؛
  • یادگیری خودنظارت‌شده؛
  • یادگیری تقویتی.

مرز میان این دسته‌ها همیشه مطلق نیست و روش‌های ترکیبی نیز وجود دارند.

یادگیری نظارت‌شده

یادگیری نظارت‌شده (Supervised Learning) زمانی است که مدل با نمونه‌هایی آموزش می‌بیند که برای آنها خروجی یا برچسب هدف مشخص شده است.

برای مثال:

تصویر گربه → گربه
تصویر سگ → سگ
تصویر اسب → اسب

مدل رابطه میان ورودی و برچسب را می‌آموزد و سپس تلاش می‌کند برچسب داده‌های جدید را پیش‌بینی کند.

دو وظیفهٔ رایج یادگیری نظارت‌شده طبقه‌بندی و رگرسیون هستند.

طبقه‌بندی

طبقه‌بندی (Classification) مسئله‌ای است که خروجی در آن یکی از چند دسته است.

برای مثال:

ایمیل → هرزنامه / عادی
تصویر → گربه / سگ
تراکنش → مشکوک / عادی

مدل بر اساس ویژگی‌های ورودی تلاش می‌کند دستهٔ مناسب را تعیین کند.

رگرسیون

رگرسیون (Regression) برای پیش‌بینی مقادیر پیوسته استفاده می‌شود.

برای مثال:

  • قیمت خانه؛
  • میزان مصرف انرژی؛
  • دمای آینده؛
  • یا مقدار فروش.

رگرسیون خطی از ساده‌ترین روش‌های این حوزه است، اما مدل‌های بسیار پیچیده‌تری نیز برای مسائل رگرسیون استفاده می‌شوند.

یادگیری بدون نظارت

در یادگیری بدون نظارت (Unsupervised Learning) داده‌ها دارای برچسب هدف از پیش تعیین‌شده نیستند.

مدل تلاش می‌کند ساختارها یا الگوهای موجود در داده را کشف کند.

از کاربردهای شناخته‌شده می‌توان به:

  • خوشه‌بندی؛
  • کاهش ابعاد؛
  • کشف ساختار؛
  • و شناسایی برخی الگوهای غیرعادی

اشاره کرد.

خوشه‌بندی

خوشه‌بندی (Clustering) تلاش می‌کند نمونه‌های مشابه را در گروه‌هایی قرار دهد.

برای مثال، یک فروشگاه ممکن است مشتریان را بر اساس الگوهای خرید به چند گروه تقسیم کند.

در این حالت برچسب گروه‌ها از ابتدا مشخص نیست؛ الگوریتم ساختارهای مشابه را در داده پیدا می‌کند.

K-means یکی از الگوریتم‌های شناخته‌شدهٔ خوشه‌بندی است.

یادگیری نیمه‌نظارت‌شده

یادگیری نیمه‌نظارت‌شده (Semi-Supervised Learning) از ترکیبی از داده‌های برچسب‌خورده و بدون برچسب استفاده می‌کند.

این روش زمانی مفید است که تهیهٔ دادهٔ خام آسان اما برچسب‌گذاری آن پرهزینه باشد.

برای مثال ممکن است میلیون‌ها تصویر در دسترس باشند اما تنها بخشی از آنها توسط انسان برچسب‌گذاری شده باشند.

یادگیری خودنظارت‌شده

یادگیری خودنظارت‌شده (Self-Supervised Learning) روشی است که در آن هدف آموزشی از ساختار خود داده استخراج می‌شود.

برای مثال، در آموزش برخی مدل‌های زبانی می‌توان بخشی از متن را پنهان کرد و از مدل خواست آن را پیش‌بینی کند؛ یا مدل را برای پیش‌بینی ادامهٔ توالی آموزش داد.

یادگیری خودنظارت‌شده نقش مهمی در توسعهٔ مدل‌های بنیادی و مدل‌های زبانی بزرگ داشته است.

یادگیری تقویتی

یادگیری تقویتی (Reinforcement Learning) بر تعامل یک عامل با یک محیط استوار است.

عامل عملی انجام می‌دهد، محیط تغییر می‌کند و عامل پاداش یا بازخورد دریافت می‌کند.

به صورت ساده:

عامل → عمل → محیط
↑              ↓
←──── پاداش ────

هدف عامل یادگیری سیاستی است که پاداش مورد انتظار را در طول زمان افزایش دهد.

یادگیری تقویتی در بازی‌ها، رباتیک، کنترل و برخی روش‌های آموزش سامانه‌های هوش مصنوعی کاربرد دارد.

شبکه‌های عصبی مصنوعی

شبکهٔ عصبی مصنوعی خانواده‌ای از مدل‌های محاسباتی است که از واحدهای پردازشی به‌هم‌پیوسته تشکیل شده است.

ایدهٔ اولیهٔ آنها تا حدی از ساختار شبکه‌های عصبی زیستی الهام گرفته شده، اما شبکهٔ عصبی مصنوعی را نباید مدل دقیقی از مغز انسان دانست.

شبکه‌های عصبی جدید می‌توانند شامل لایه‌های متعدد و میلیون‌ها یا میلیاردها پارامتر باشند.

یادگیری عمیق

یادگیری عمیق (Deep Learning) زیرشاخه‌ای از یادگیری ماشین است که عمدتاً بر شبکه‌های عصبی چندلایه استوار است.

یادگیری عمیق در دههٔ ۲۰۱۰ موجب پیشرفت‌های چشمگیر در:

  • تشخیص تصویر؛
  • تشخیص گفتار؛
  • ترجمهٔ ماشینی؛
  • پردازش زبان طبیعی؛
  • تولید تصویر؛
  • و مدل‌های زبانی

شد.

جفری هینتون، یوشوا بنجیو و یان لکون از پژوهشگران اثرگذار در توسعهٔ یادگیری عمیق معاصر بوده‌اند.

یادگیری ماشین و هوش مصنوعی

هوش مصنوعی مفهومی گسترده‌تر از یادگیری ماشین است.

هوش مصنوعی شامل روش‌ها و سامانه‌هایی است که برای انجام وظایفی مرتبط با ادراک، استدلال، برنامه‌ریزی، زبان، تصمیم‌گیری یا حل مسئله طراحی می‌شوند.

یادگیری ماشین یکی از مهم‌ترین روش‌های ساخت چنین سامانه‌هایی است.

به صورت مفهومی می‌توان نوشت:

هوش مصنوعی
     ↓
یادگیری ماشین
     ↓
یادگیری عمیق

این رابطه نشان‌دهندهٔ یک تقسیم‌بندی رایج است، نه تعریف کامل همهٔ شاخه‌های هوش مصنوعی.

یادگیری ماشین و هوش مصنوعی مولد

هوش مصنوعی مولد به سامانه‌هایی گفته می‌شود که قادر به تولید محتوایی مانند متن، تصویر، صوت، ویدئو یا کد هستند.

بسیاری از سامانه‌های مولد جدید با روش‌های یادگیری ماشین و به‌ویژه یادگیری عمیق آموزش داده می‌شوند.

بنابراین:

هر یادگیری ماشینی هوش مصنوعی مولد نیست، اما بسیاری از سامانه‌های هوش مصنوعی مولد معاصر بر یادگیری ماشین متکی هستند.

یادگیری ماشین و مدل‌های زبانی بزرگ

مدل‌های زبانی بزرگ نمونه‌ای مهم از کاربرد یادگیری ماشین هستند.

این مدل‌ها با استفاده از مجموعه‌های بزرگ متن و روش‌های یادگیری عمیق آموزش داده می‌شوند تا الگوهای زبان را بیاموزند.

در بسیاری از مدل‌های خودرگرسیو، یکی از وظایف اصلی آموزشی پیش‌بینی توکن بعدی بر اساس توکن‌های پیشین است.

مدل از طریق این فرایند می‌تواند ساختارهای زبانی و بسیاری از روابط آماری موجود در داده را بیاموزد.

ترنسفورمر

یکی از معماری‌های بسیار اثرگذار در یادگیری عمیق ترنسفورمر (Transformer) است.

اشیش واسوانی و همکاران در سال ۲۰۱۷ مقالهٔ Attention Is All You Need را منتشر کردند و معماری ترنسفورمر را معرفی کردند.[۶]

ترنسفورمر بر سازوکار توجه (Attention) تکیه دارد و پایهٔ بسیاری از مدل‌های زبانی و سامانه‌های مولد معاصر شده است.

کاربرد در پردازش زبان طبیعی

یادگیری ماشین در پردازش زبان طبیعی برای وظایفی مانند:

  • ترجمهٔ ماشینی؛
  • خلاصه‌سازی؛
  • تحلیل احساسات؛
  • پاسخ به پرسش؛
  • تشخیص موجودیت‌ها؛
  • طبقه‌بندی متن؛
  • و تولید زبان

استفاده می‌شود.

مدل‌های زبانی بزرگ توسعهٔ این حوزه را به مرحلهٔ تازه‌ای رسانده‌اند.

کاربرد در بینایی ماشین

بینایی ماشین (Computer Vision) به توسعهٔ سامانه‌هایی برای پردازش و تحلیل تصاویر و ویدئو می‌پردازد.

یادگیری ماشین در این حوزه برای:

  • تشخیص اشیا؛
  • طبقه‌بندی تصاویر؛
  • تقسیم‌بندی تصویر؛
  • تشخیص چهره؛
  • تحلیل تصاویر پزشکی؛
  • و هدایت سامانه‌های خودکار

کاربرد دارد.

تشخیص گفتار

مدل‌های یادگیری ماشین می‌توانند سیگنال صوتی را به متن تبدیل کنند.

این فناوری در:

  • دستیارهای صوتی؛
  • زیرنویس خودکار؛
  • رونویسی جلسات؛
  • جست‌وجوی صوتی؛
  • و سامانه‌های دسترس‌پذیری

کاربرد دارد.

موتورهای جست‌وجو

موتورهای جست‌وجو از روش‌های یادگیری ماشین برای درک پرس‌وجو، رتبه‌بندی نتایج، تشخیص هرزنامه و بهبود ارتباط نتایج استفاده می‌کنند.

مدل‌های یادگیری می‌توانند از سیگنال‌های متعدد برای تخمین ارتباط یک صفحه با نیاز کاربر استفاده کنند.

سامانه‌های توصیه‌گر

سامانه‌های توصیه‌گر از کاربردهای گستردهٔ یادگیری ماشین هستند.

فروشگاه‌های اینترنتی، خدمات پخش موسیقی و ویدئو و شبکه‌های اجتماعی می‌توانند از رفتار کاربران برای پیش‌بینی محتوای مورد علاقهٔ آنها استفاده کنند.

این سامانه‌ها ممکن است از:

  • سابقهٔ مشاهده؛
  • خرید؛
  • امتیازدهی؛
  • تعامل؛
  • یا شباهت میان کاربران و محتوا

استفاده کنند.

پزشکی

یادگیری ماشین در پزشکی برای تحلیل تصاویر، پیش‌بینی خطر بیماری، پردازش پرونده‌های پزشکی و پژوهش دارویی مورد مطالعه و استفاده قرار گرفته است.

اما عملکرد مدل پزشکی به کیفیت داده و جمعیتی که مدل روی آن آموزش و ارزیابی شده وابسته است.

مدلی که روی یک جمعیت عملکرد مطلوبی دارد الزاماً همان عملکرد را در جمعیتی متفاوت نخواهد داشت.

از این رو ارزیابی بالینی و نظارت تخصصی اهمیت اساسی دارد.

اقتصاد و امور مالی

در حوزهٔ مالی، یادگیری ماشین در:

  • ارزیابی ریسک؛
  • کشف تقلب؛
  • تحلیل بازار؛
  • اعتبارسنجی؛
  • پیش‌بینی؛
  • و پردازش اسناد

کاربرد دارد.

در این حوزه نیز تصمیم‌های الگوریتمی می‌توانند پیامدهای اقتصادی مستقیم برای افراد داشته باشند و به همین دلیل شفافیت، قابلیت ارزیابی و سوگیری الگوریتمی اهمیت پیدا می‌کند.

صنعت

در صنعت، یادگیری ماشین می‌تواند برای:

  • نگهداری پیش‌بینانهٔ تجهیزات؛
  • کنترل کیفیت؛
  • تشخیص خرابی؛
  • بهینه‌سازی تولید؛
  • مدیریت انرژی؛
  • و رباتیک

استفاده شود.

برای مثال، داده‌های حسگرهای یک دستگاه می‌توانند برای پیش‌بینی احتمال خرابی پیش از وقوع آن تحلیل شوند.

کشاورزی

یادگیری ماشین در کشاورزی برای تحلیل تصاویر ماهواره‌ای، تشخیص بیماری گیاهان، پیش‌بینی محصول و مدیریت منابع آب به کار می‌رود.

ترکیب داده‌های حسگرها، تصاویر هوایی و مدل‌های پیش‌بینی می‌تواند اطلاعات بیشتری دربارهٔ وضعیت مزرعه فراهم کند.

آموزش

در آموزش، الگوریتم‌های یادگیری ماشین می‌توانند برای سامانه‌های آموزشی تطبیقی، تحلیل عملکرد دانش‌آموزان و تولید یا پیشنهاد محتوای آموزشی استفاده شوند.

با این حال استفاده از داده‌های دانش‌آموزان مسائل مربوط به حریم خصوصی، امنیت و انصاف را نیز مطرح می‌کند.

خودروهای خودران

سامانه‌های رانندگی خودکار از مجموعه‌ای از فناوری‌ها از جمله یادگیری ماشین، بینایی ماشین، حسگرها، مکان‌یابی و کنترل استفاده می‌کنند.

مدل‌های یادگیری می‌توانند برای تشخیص:

  • عابر پیاده؛
  • خودرو؛
  • علائم راهنمایی؛
  • خطوط جاده؛
  • و دیگر عناصر محیط

به کار روند.

در این کاربرد، خطای مدل می‌تواند پیامد ایمنی مستقیم داشته باشد.

الگوریتم‌های شناخته‌شده

یادگیری ماشین شامل خانوادهٔ بزرگی از الگوریتم‌هاست.

از جمله:

  • رگرسیون خطی؛
  • رگرسیون لجستیک؛
  • درخت تصمیم؛
  • جنگل تصادفی؛
  • ماشین بردار پشتیبان؛
  • K نزدیک‌ترین همسایه؛
  • K-means؛
  • شبکه‌های عصبی؛
  • الگوریتم‌های تقویتی؛
  • و مدل‌های مبتنی بر ترنسفورمر.

هیچ الگوریتمی برای همهٔ مسائل بهترین انتخاب نیست.

انتخاب روش به نوع داده، هدف، حجم داده، محدودیت محاسباتی و معیار ارزیابی بستگی دارد.

تابع زیان

تابع زیان مقدار اختلاف میان پیش‌بینی مدل و نتیجهٔ مطلوب را اندازه‌گیری می‌کند.

برای نمونه اگر مدل قیمت یک خانه را ۳۰۰ هزار واحد پیش‌بینی کند اما قیمت واقعی ۳۲۰ هزار باشد، تابع زیان می‌تواند میزان این اختلاف را به عدد تبدیل کند.

فرایند آموزش تلاش می‌کند مقدار زیان را کاهش دهد.

انتخاب تابع زیان بر آنچه مدل برای بهبود آن تلاش می‌کند اثر دارد.

گرادیان نزولی

گرادیان نزولی (Gradient Descent) یکی از روش‌های رایج بهینه‌سازی مدل‌هاست.

الگوریتم با محاسبهٔ جهت تغییر تابع زیان، پارامترهای مدل را به‌گونه‌ای اصلاح می‌کند که زیان کاهش یابد.

در شبکه‌های عصبی، گرادیان‌ها معمولاً با استفاده از روش پس‌انتشار (Backpropagation) محاسبه می‌شوند.

ابرپارامتر

ابرپارامتر (Hyperparameter) مقداری است که معمولاً پیش از آموزش یا در فرایند تنظیم مدل تعیین می‌شود و برخلاف پارامترهای مدل مستقیماً از همان فرایند یادگیری معمول آموخته نمی‌شود.

نمونه‌ها می‌توانند شامل:

  • نرخ یادگیری؛
  • تعداد لایه‌ها؛
  • اندازهٔ دسته؛
  • و برخی پارامترهای منظم‌سازی

باشند.

انتخاب ابرپارامترها می‌تواند تأثیر قابل توجهی بر عملکرد مدل داشته باشد.

معیارهای ارزیابی

عملکرد مدل باید با معیار مناسب اندازه‌گیری شود.

در طبقه‌بندی، معیارهایی مانند:

  • Accuracy؛
  • Precision؛
  • Recall؛
  • F1 Score

استفاده می‌شوند.

اما انتخاب معیار باید با هدف مسئله متناسب باشد.

برای مثال در تشخیص یک بیماری نادر، دقت کلی به‌تنهایی ممکن است گمراه‌کننده باشد؛ زیرا مدلی که تقریباً همهٔ افراد را «سالم» اعلام کند ممکن است Accuracy بالایی داشته باشد اما بیماران را تشخیص ندهد.

داده و کیفیت مدل

عبارت شناخته‌شدهٔ علوم رایانه:

Garbage In, Garbage Out

به این معناست که دادهٔ نامناسب می‌تواند به خروجی نامناسب منجر شود.

اگر داده‌ها ناقص، نادرست یا غیرنماینده باشند، مدل ممکن است الگوهایی را بیاموزد که در جهان واقعی قابل اعتماد نیستند.

بنابراین آماده‌سازی و ارزیابی داده یکی از مراحل مهم پروژه‌های یادگیری ماشین است.

سوگیری الگوریتمی

سوگیری الگوریتمی یکی از مسائل مهم یادگیری ماشین است.

اگر دادهٔ آموزشی منعکس‌کنندهٔ نابرابری‌های تاریخی یا دارای نمونه‌گیری نامتوازن باشد، مدل می‌تواند بخشی از همان الگوها را بازتولید کند.

NIST تأکید کرده است که سوگیری در هوش مصنوعی تنها به داده یا الگوریتم محدود نیست و می‌تواند دارای منشأ سیستمی، آماری و محاسباتی یا شناختی انسانی باشد.[۷]

بنابراین ارزیابی مدل باید فراتر از دقت کلی آن باشد و پیامدهای عملکرد برای گروه‌های مختلف نیز بررسی شود.

حریم خصوصی

آموزش مدل‌های یادگیری ماشین گاهی به حجم بزرگی از داده‌های کاربران نیاز دارد.

این امر پرسش‌هایی دربارهٔ:

  • جمع‌آوری داده؛
  • رضایت؛
  • نگهداری؛
  • ناشناس‌سازی؛
  • امنیت؛
  • و استفادهٔ ثانویه از داده

ایجاد می‌کند.

روش‌هایی مانند حریم خصوصی تفاضلی (Differential Privacy) برای کاهش برخی خطرهای افشای اطلاعات مورد مطالعه قرار گرفته‌اند.

توضیح‌پذیری

برخی مدل‌های یادگیری ماشین بسیار پیچیده‌اند و درک دلیل دقیق یک پیش‌بینی در آنها دشوار است.

این مسئله به حوزهٔ هوش مصنوعی توضیح‌پذیر (Explainable AI) مربوط می‌شود.

توضیح‌پذیری در کاربردهایی مانند پزشکی، اعتبارسنجی و تصمیم‌های اداری اهمیت بیشتری دارد، زیرا فرد ممکن است نیاز داشته باشد بداند چرا سامانه تصمیم خاصی گرفته است.

توهم هوش مصنوعی

توهم هوش مصنوعی بیشتر در ارتباط با مدل‌های مولد مطرح می‌شود و به تولید محتوای نادرست یا فاقد پشتوانه اشاره دارد.

این مفهوم را نباید با خطای معمول یک مدل طبقه‌بندی یکسان دانست.

برای مثال اگر مدل تشخیص تصویر یک سگ را گربه تشخیص دهد، این یک خطای طبقه‌بندی است.

اما اگر یک مدل زبانی نام کتاب، نویسنده و منبعی را که وجود خارجی ندارد تولید کند، این رفتار معمولاً «توهم» نامیده می‌شود.

حملات خصمانه

مدل‌های یادگیری ماشین می‌توانند در برابر نمونه‌های خصمانه (Adversarial Examples) آسیب‌پذیر باشند.

در چنین حملاتی، تغییراتی طراحی‌شده در ورودی می‌تواند مدل را به پیش‌بینی اشتباه سوق دهد، حتی اگر تغییر برای انسان بسیار کوچک یا کم‌اهمیت به نظر برسد.

این حوزه بخشی از پژوهش‌های امنیت یادگیری ماشین است.

تغییر توزیع داده

مدلی که در یک محیط آموزش دیده است ممکن است با تغییر شرایط عملکرد ضعیف‌تری داشته باشد.

برای مثال الگوی رفتار مشتریان، زبان کاربران یا شرایط اقتصادی ممکن است در طول زمان تغییر کند.

اگر توزیع داده‌های واقعی از داده‌های آموزشی فاصله بگیرد، مدل نیازمند پایش و گاهی آموزش مجدد خواهد بود.

این مسئله با مفاهیمی مانند Data Drift و Concept Drift ارتباط دارد.

محدودیت‌های یادگیری ماشین

یادگیری ماشین با وجود توانایی‌های گسترده محدودیت‌هایی دارد.

از جمله:

  • وابستگی به داده؛
  • امکان بیش‌برازش؛
  • دشواری تعمیم خارج از توزیع آموزشی؛
  • سوگیری؛
  • هزینهٔ محاسباتی؛
  • مشکلات توضیح‌پذیری؛
  • آسیب‌پذیری امنیتی؛
  • و وابستگی به معیارهایی که انسان برای آموزش و ارزیابی انتخاب می‌کند.

مدل همچنین لزوماً رابطهٔ علّی را از همبستگی آماری تشخیص نمی‌دهد.

همبستگی و علیت

یکی از نکات مهم در تفسیر مدل‌های یادگیری ماشین تفاوت میان همبستگی و علیت است.

اگر دو متغیر در داده با یکدیگر ارتباط داشته باشند، این ارتباط به‌تنهایی ثابت نمی‌کند که یکی علت دیگری است.

مدل ممکن است برای پیش‌بینی از همبستگی‌هایی استفاده کند که هیچ رابطهٔ علّی مستقیمی ندارند.

بنابراین خروجی یک مدل پیش‌بینی را نباید بدون شواهد اضافی به عنوان اثبات رابطهٔ علت و معلولی تفسیر کرد.

یادگیری ماشین و تصمیم انسانی

سامانهٔ یادگیری ماشین می‌تواند ابزار پشتیبان تصمیم باشد، اما میزان اتکا به آن باید متناسب با خطر کاربرد تعیین شود.

در حوزه‌های حساس باید پرسید:

  • نرخ خطا چقدر است؟
  • مدل روی چه داده‌ای آموزش دیده است؟
  • عملکرد آن برای گروه‌های مختلف چگونه است؟
  • آیا تصمیم قابل اعتراض است؟
  • چه کسی مسئول نتیجه است؟
  • و آیا انسان اختیار واقعی برای بازبینی تصمیم دارد؟

این پرسش‌ها یادگیری ماشین را از یک مسئلهٔ صرفاً فنی به موضوعی اجتماعی و حقوقی نیز تبدیل می‌کنند.

یادگیری ماشین و قدرت

گسترش سامانه‌های یادگیری ماشین در استخدام، اعتبارسنجی، رسانه، تبلیغات، نظارت و خدمات عمومی به این الگوریتم‌ها نقش بیشتری در توزیع فرصت و اطلاعات داده است.

بنابراین مطالعهٔ یادگیری ماشین تنها بررسی دقت الگوریتم نیست؛ بلکه شامل بررسی نحوهٔ استفاده از آن نیز می‌شود.

سامانه‌ای که از نظر آماری دقیق است می‌تواند در صورت استفادهٔ نامناسب پیامد اجتماعی نامطلوب داشته باشد.

یادگیری ماشین و دموکراسی

کاربرد یادگیری ماشین در شبکه‌های اجتماعی، تبلیغات سیاسی، تعدیل محتوا و سامانه‌های توصیه‌گر موجب طرح پرسش‌هایی دربارهٔ آزادی بیان، دسترسی به اطلاعات و پلورالیسم سیاسی شده است.

الگوریتم‌های توصیه‌گر می‌توانند بر آنچه کاربران مشاهده می‌کنند اثر بگذارند.

با این حال تأثیر واقعی هر سامانه باید بر اساس داده و شواهد مربوط به همان سامانه بررسی شود و نمی‌توان صرف استفاده از الگوریتم را به معنای دستکاری سیاسی دانست.

یادگیری ماشین در ایران

یادگیری ماشین در ایران نیز در دانشگاه‌ها، شرکت‌های فناوری و کاربردهایی مانند پردازش زبان فارسی، تحلیل داده، تشخیص تصویر، خدمات مالی و سامانه‌های هوشمند مورد استفاده و پژوهش قرار گرفته است.

برای زبان فارسی، توسعهٔ مجموعه‌داده‌های باکیفیت و متنوع اهمیت ویژه‌ای دارد.

کمبود یا عدم توازن داده می‌تواند بر کیفیت سامانه‌های پردازش زبان فارسی اثر بگذارد.

همچنین استفادهٔ حکومتی از فناوری‌های تشخیص چهره، تحلیل داده یا تصمیم‌گیری خودکار، در صورت تأثیرگذاری بر حقوق شهروندان، ضرورت شفافیت، پاسخگویی و نظارت مستقل را مطرح می‌کند. ارزیابی هر ادعای مشخص دربارهٔ چنین سامانه‌هایی نیازمند داده و منابع قابل راستی‌آزمایی است.

یادگیری ماشین و آیندهٔ هوش مصنوعی

یادگیری ماشین در چند دههٔ اخیر از حوزه‌ای تخصصی در علوم رایانه به یکی از فناوری‌های بنیادی اقتصاد دیجیتال تبدیل شده است.

مدل‌های بنیادی، هوش مصنوعی مولد، سامانه‌های چندوجهی، رباتیک و عامل‌های هوشمند از حوزه‌هایی هستند که توسعهٔ آنها به روش‌های یادگیری ماشین وابستگی گسترده‌ای دارد.

در عین حال، افزایش توان مدل‌ها موجب افزایش اهمیت پژوهش دربارهٔ ایمنی، قابلیت اعتماد، مصرف منابع، حریم خصوصی، سوگیری و پاسخگویی شده است.

جمع‌بندی

یادگیری ماشین شاخه‌ای از هوش مصنوعی است که به توسعهٔ الگوریتم‌ها و مدل‌هایی می‌پردازد که از داده یا تجربه الگو می‌آموزند و از این الگوها برای پیش‌بینی، طبقه‌بندی، تصمیم‌گیری یا تولید استفاده می‌کنند.

ریشه‌های آن به پژوهش‌های اولیهٔ هوش مصنوعی، آمار و تشخیص الگو در میانهٔ سدهٔ بیستم بازمی‌گردد. پژوهش آرتور ساموئل دربارهٔ برنامهٔ بازی چکرز در سال ۱۹۵۹ از آثار اولیهٔ این حوزه بود.[۸]

یادگیری نظارت‌شده، بدون نظارت، نیمه‌نظارت‌شده، خودنظارت‌شده و تقویتی از رویکردهای مهم این حوزه هستند. یادگیری عمیق نیز به عنوان زیرشاخه‌ای از یادگیری ماشین، پایهٔ بسیاری از پیشرفت‌های معاصر در بینایی ماشین، پردازش زبان و هوش مصنوعی مولد را فراهم کرده است.

با این حال، عملکرد مدل به داده، روش آموزش، معیار ارزیابی و شرایط کاربرد وابسته است. بیش‌برازش، سوگیری الگوریتمی، مشکلات حریم خصوصی، دشواری توضیح‌پذیری و تغییر توزیع داده از چالش‌های مهم این حوزه‌اند.

از این رو یادگیری ماشین را نمی‌توان صرفاً «توانایی رایانه برای یادگرفتن» توصیف کرد؛ بلکه مجموعه‌ای از روش‌های آماری و محاسباتی است که تلاش می‌کنند از داده مدل‌هایی بسازند که در برابر نمونه‌های جدید نیز عملکرد قابل اندازه‌گیری و قابل تعمیم داشته باشند.

جستارهای وابسته

منابع

کتاب‌شناسی

  • Bishop, Christopher M. Pattern Recognition and Machine Learning. New York: Springer, 2006.
  • Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016.
  • Hastie, Trevor, Robert Tibshirani, and Jerome Friedman. The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd ed. New York: Springer, 2009.
  • Mitchell, Tom M. Machine Learning. New York: McGraw-Hill, 1997.
  • Murphy, Kevin P. Machine Learning: A Probabilistic Perspective. Cambridge, MA: MIT Press, 2012.
  • Russell, Stuart, and Peter Norvig. Artificial Intelligence: A Modern Approach. 4th ed. Hoboken, NJ: Pearson, 2021.
  • Samuel, Arthur L. “Some Studies in Machine Learning Using the Game of Checkers.” IBM Journal of Research and Development 3, no. 3 (1959): 210–229.
  • Turing, Alan M. “Computing Machinery and Intelligence.” Mind 59, no. 236 (1950): 433–460.
  • Vaswani, Ashish, Noam Shazeer, Niki Parmar, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017).