یادگیری ماشینی
| شناسنامه | |
|---|---|
| نامهای دیگر | یادگیری ماشینی، ML |
| حوزه | هوش مصنوعی، علوم رایانه، آمار، علم داده، بهینهسازی |
| خاستگاه | علوم رایانه، آمار، نظریهٔ اطلاعات، تشخیص الگو و پژوهشهای اولیهٔ هوش مصنوعی |
| اندیشه و تاریخ | |
| مفاهیم کلیدی | دادهٔ آموزشی، ویژگی، مدل، آموزش، استنتاج، تعمیم، یادگیری نظارتشده، یادگیری بدون نظارت، یادگیری تقویتی، بیشبرازش، کمبرازش |
| جریانهای مرتبط | هوش مصنوعی، یادگیری عمیق، شبکههای عصبی مصنوعی، پردازش زبان طبیعی، بینایی ماشین، علم داده، هوش مصنوعی مولد |
| تأثیرپذیرفته از | آمار، احتمال، نظریهٔ اطلاعات، علوم رایانه، علوم شناختی، عصبشناسی محاسباتی و بهینهسازی |
| تأثیرگذار بر | هوش مصنوعی مولد، موتورهای جستوجو، سامانههای توصیهگر، تشخیص تصویر و گفتار، خودروهای خودران، پزشکی محاسباتی و تحلیل داده |
| نقد و ارزیابی | |
یادگیری ماشین یا یادگیری ماشینی (به انگلیسی: Machine Learning و به اختصار ML) شاخهای از هوش مصنوعی و علوم رایانه است که به توسعهٔ الگوریتمها و مدلهایی میپردازد که میتوانند از دادهها الگو استخراج کنند و بر اساس تجربهٔ حاصل از داده، در وظایفی مانند پیشبینی، طبقهبندی، تشخیص الگو، تصمیمگیری یا تولید محتوا عمل کنند.
در یادگیری ماشین به جای آنکه برنامهنویس همهٔ قواعد لازم برای حل مسئله را بهصورت صریح در برنامه بنویسد، سامانه با استفاده از داده و یک روش یادگیری، پارامترهای مدلی را تنظیم میکند که بتواند رابطهها و الگوهای مورد نظر را بازنمایی کند. این ویژگی، یادگیری ماشین را برای مسائلی مانند تشخیص تصویر، شناسایی گفتار، ترجمهٔ ماشینی و کشف الگو در مجموعههای بزرگ داده مناسب کرده است.[۱]
یادگیری ماشین زیربنای بسیاری از پیشرفتهای معاصر در هوش مصنوعی است. یادگیری عمیق، مدلهای زبانی بزرگ و بسیاری از سامانههای هوش مصنوعی مولد بر روشهای یادگیری ماشین استوارند.
تعریف
تعریف واحدی که همهٔ پژوهشگران برای یادگیری ماشین به کار ببرند وجود ندارد، اما عنصر مشترک بیشتر تعریفها یادگیری از داده یا تجربه است.
آرتور ساموئل، از پیشگامان این حوزه، در پژوهشهای خود دربارهٔ برنامهٔ بازی چکرز از اصطلاح Machine Learning استفاده کرد و سامانهای را توسعه داد که میتوانست عملکرد خود را بر اساس تجربه بهبود دهد.[۲]
تام میچل بعدها تعریف صوری شناختهشدهای ارائه کرد. بر اساس آن، یک برنامهٔ رایانهای از تجربهٔ E نسبت به دستهای از وظایف T و معیار عملکرد P یاد میگیرد، اگر عملکرد آن در وظایف T، بر اساس معیار P، با تجربهٔ E بهبود یابد.[۳]
این تعریف سه عنصر اساسی را مشخص میکند:
- وظیفه؛
- تجربه؛
- معیار عملکرد.
تاریخچه
ریشههای نظری یادگیری ماشین را میتوان در آمار، منطق، علوم رایانه، نظریهٔ اطلاعات و پژوهشهای اولیه دربارهٔ هوش مصنوعی جستوجو کرد.
در سال ۱۹۵۰، آلن تورینگ در مقالهٔ مشهور Computing Machinery and Intelligence مسئلهٔ توانایی ماشین برای نشاندادن رفتار هوشمند را بررسی کرد.[۴]
در دههٔ ۱۹۵۰ پژوهشگران به ساخت برنامههایی پرداختند که میتوانستند بر اساس تجربه عملکرد خود را تغییر دهند.
آرتور ساموئل در شرکت IBM برنامهای برای بازی چکرز ایجاد کرد که از تجربهٔ بازی استفاده میکرد. مقالهٔ او در سال ۱۹۵۹ از آثار اولیه و اثرگذار در شکلگیری حوزهٔ یادگیری ماشین محسوب میشود.[۵]
پرسپترون
یکی دیگر از تحولات مهم اولیه، توسعهٔ پرسپترون (Perceptron) توسط فرانک روزنبلات در دههٔ ۱۹۵۰ بود.
پرسپترون یکی از مدلهای اولیهٔ شبکهٔ عصبی مصنوعی بود و برای یادگیری دستهبندیهای ساده طراحی شد.
این مدل نقش مهمی در تاریخ شبکههای عصبی داشت، اگرچه محدودیتهای ریاضی آن بعدها موجب کاهش توجه به برخی رویکردهای شبکهٔ عصبی شد.
پژوهش دربارهٔ شبکههای عصبی در دهههای بعد دوباره گسترش یافت و نهایتاً یکی از پایههای یادگیری عمیق شد.
تفاوت برنامهنویسی سنتی و یادگیری ماشین
در برنامهنویسی سنتی، برنامهنویس معمولاً قواعد لازم برای تبدیل ورودی به خروجی را مشخص میکند.
به صورت ساده:
داده + قواعد → پاسخ
برای مثال، اگر هدف محاسبهٔ مالیات بر اساس مجموعهای از قواعد مشخص باشد، برنامهنویس میتواند همان قواعد را مستقیماً در کد بنویسد.
در یادگیری ماشین رابطه متفاوت است:
داده + پاسخهای نمونه → فرایند آموزش → مدل
و سپس:
دادهٔ جدید + مدل → پیشبینی
در اینجا بسیاری از قواعد به صورت دستی نوشته نمیشوند؛ مدل آنها را از الگوهای موجود در داده استخراج میکند.
داده
داده یکی از عناصر بنیادی یادگیری ماشین است.
مدلها برای یادگیری به نمونههایی نیاز دارند که بتوان از آنها روابط آماری استخراج کرد.
داده میتواند شامل:
- متن؛
- تصویر؛
- صدا؛
- ویدئو؛
- اعداد؛
- سوابق تراکنش؛
- اطلاعات حسگرها؛
- دادههای پزشکی؛
- یا ترکیبی از آنها
باشد.
کیفیت، تنوع، اندازه و نمایندگی دادهها میتواند تأثیر قابل توجهی بر عملکرد مدل داشته باشد.
مجموعهٔ آموزشی
مجموعهٔ آموزشی (Training Set) دادهای است که برای آموزش مدل استفاده میشود.
مدل در فرایند آموزش پارامترهای خود را بر اساس این دادهها تنظیم میکند.
اما ارزیابی مدل صرفاً بر اساس دادهای که قبلاً دیده است کافی نیست.
مدلی که دادههای آموزشی را بهخوبی حفظ کرده باشد ممکن است روی دادههای جدید عملکرد ضعیفی داشته باشد.
به همین دلیل دادهها معمولاً به مجموعههای مختلفی مانند آموزش، اعتبارسنجی و آزمون تقسیم میشوند.
مجموعهٔ اعتبارسنجی
مجموعهٔ اعتبارسنجی (Validation Set) برای ارزیابی انتخابهای مربوط به مدل در فرایند توسعه استفاده میشود.
برای مثال، پژوهشگر ممکن است چند معماری یا مجموعهٔ متفاوت از ابرپارامترها را آزمایش کند و بر اساس عملکرد روی دادهٔ اعتبارسنجی یکی را انتخاب کند.
این مجموعه به جلوگیری از تنظیم مدل صرفاً بر اساس دادهٔ آموزشی کمک میکند.
مجموعهٔ آزمون
مجموعهٔ آزمون (Test Set) برای ارزیابی نهایی عملکرد مدل روی دادههایی استفاده میشود که در آموزش مدل به کار نرفتهاند.
هدف آن تخمین توانایی مدل برای تعمیم به نمونههای جدید است.
اگر دادهٔ آزمون در فرایند آموزش یا تنظیم مدل وارد شود، ارزیابی ممکن است تصویری بیش از حد خوشبینانه از عملکرد واقعی ارائه دهد.
ویژگی
ویژگی (Feature) متغیر یا اطلاعاتی است که برای پیشبینی مورد استفاده قرار میگیرد.
برای مثال در مدلی برای پیشبینی قیمت خانه، ویژگیها ممکن است شامل:
- مساحت؛
- تعداد اتاقها؛
- سن ساختمان؛
- موقعیت جغرافیایی؛
- و فاصله از مرکز شهر
باشند.
در یادگیری عمیق، بسیاری از بازنماییهای مورد نیاز به جای طراحی دستی، توسط خود شبکه در جریان آموزش آموخته میشوند.
مدل
مدل ساختاری ریاضی یا محاسباتی است که رابطهای را از دادهها میآموزد.
مدل میتواند از یک رگرسیون خطی ساده تا شبکهای عصبی با میلیاردها پارامتر متغیر باشد.
هدف آموزش آن است که پارامترهای مدل به گونهای تنظیم شوند که معیار مورد نظر بهبود یابد.
آموزش
آموزش (Training) فرایندی است که طی آن پارامترهای مدل با استفاده از داده تنظیم میشوند.
در بسیاری از الگوریتمها یک تابع زیان (Loss Function) میزان اختلاف میان خروجی مدل و هدف مورد نظر را اندازهگیری میکند.
الگوریتم بهینهسازی تلاش میکند این زیان را کاهش دهد.
به شکل ساده:
داده ↓ مدل ↓ پیشبینی ↓ مقایسه با هدف ↓ محاسبهٔ خطا ↓ اصلاح پارامترها ↓ تکرار
استنتاج
پس از آموزش، مدل میتواند برای دادههای جدید استفاده شود.
این مرحله استنتاج (Inference) نامیده میشود.
برای مثال، یک مدل تشخیص تصویر پس از آموزش میتواند تصویر جدیدی را دریافت کند و احتمال دهد که تصویر متعلق به چه دستهای است.
آموزش و استنتاج بنابراین دو مرحلهٔ متفاوتاند.
تعمیم
یکی از اهداف بنیادی یادگیری ماشین تعمیم (Generalization) است.
مدل مطلوب نباید تنها نمونههای آموزشی را حفظ کند، بلکه باید الگوهایی را بیاموزد که در دادههای جدید نیز کاربرد داشته باشند.
اگر مدلی در دادههای آموزشی بسیار دقیق باشد اما در دادههای جدید عملکرد ضعیفی داشته باشد، با مسئلهٔ بیشبرازش روبهرو هستیم.
بیشبرازش
بیشبرازش (Overfitting) زمانی رخ میدهد که مدل بیش از اندازه با ویژگیها یا نویز دادههای آموزشی تطبیق پیدا کند و توانایی تعمیم آن کاهش یابد.
برای مثال، دانشآموزی را میتوان تصور کرد که پاسخهای یک آزمون را حفظ کرده اما مفهوم درس را نیاموخته است.
ممکن است در همان آزمون عملکرد عالی داشته باشد، اما با پرسشهای جدید مشکل پیدا کند.
مدل بیشبرازششده نیز رفتاری مشابه دارد.
کمبرازش
کمبرازش (Underfitting) زمانی رخ میدهد که مدل به اندازهٔ کافی قادر به یادگیری ساختار داده نباشد.
در این حالت مدل حتی روی دادههای آموزشی نیز عملکرد مطلوبی ندارد.
مدلی بسیار ساده برای مسئلهای پیچیده ممکن است دچار کمبرازش شود.
بنابراین طراحی مدل معمولاً نیازمند ایجاد تعادل میان ظرفیت یادگیری و توانایی تعمیم است.
انواع اصلی یادگیری ماشین
روشهای یادگیری ماشین را میتوان بر اساس نوع داده و شیوهٔ دریافت بازخورد به چند دسته تقسیم کرد.
از شناختهشدهترین آنها عبارتاند از:
- یادگیری نظارتشده؛
- یادگیری بدون نظارت؛
- یادگیری نیمهنظارتشده؛
- یادگیری خودنظارتشده؛
- یادگیری تقویتی.
مرز میان این دستهها همیشه مطلق نیست و روشهای ترکیبی نیز وجود دارند.
یادگیری نظارتشده
یادگیری نظارتشده (Supervised Learning) زمانی است که مدل با نمونههایی آموزش میبیند که برای آنها خروجی یا برچسب هدف مشخص شده است.
برای مثال:
تصویر گربه → گربه تصویر سگ → سگ تصویر اسب → اسب
مدل رابطه میان ورودی و برچسب را میآموزد و سپس تلاش میکند برچسب دادههای جدید را پیشبینی کند.
دو وظیفهٔ رایج یادگیری نظارتشده طبقهبندی و رگرسیون هستند.
طبقهبندی
طبقهبندی (Classification) مسئلهای است که خروجی در آن یکی از چند دسته است.
برای مثال:
ایمیل → هرزنامه / عادی
تصویر → گربه / سگ
تراکنش → مشکوک / عادی
مدل بر اساس ویژگیهای ورودی تلاش میکند دستهٔ مناسب را تعیین کند.
رگرسیون
رگرسیون (Regression) برای پیشبینی مقادیر پیوسته استفاده میشود.
برای مثال:
- قیمت خانه؛
- میزان مصرف انرژی؛
- دمای آینده؛
- یا مقدار فروش.
رگرسیون خطی از سادهترین روشهای این حوزه است، اما مدلهای بسیار پیچیدهتری نیز برای مسائل رگرسیون استفاده میشوند.
یادگیری بدون نظارت
در یادگیری بدون نظارت (Unsupervised Learning) دادهها دارای برچسب هدف از پیش تعیینشده نیستند.
مدل تلاش میکند ساختارها یا الگوهای موجود در داده را کشف کند.
از کاربردهای شناختهشده میتوان به:
- خوشهبندی؛
- کاهش ابعاد؛
- کشف ساختار؛
- و شناسایی برخی الگوهای غیرعادی
اشاره کرد.
خوشهبندی
خوشهبندی (Clustering) تلاش میکند نمونههای مشابه را در گروههایی قرار دهد.
برای مثال، یک فروشگاه ممکن است مشتریان را بر اساس الگوهای خرید به چند گروه تقسیم کند.
در این حالت برچسب گروهها از ابتدا مشخص نیست؛ الگوریتم ساختارهای مشابه را در داده پیدا میکند.
K-means یکی از الگوریتمهای شناختهشدهٔ خوشهبندی است.
یادگیری نیمهنظارتشده
یادگیری نیمهنظارتشده (Semi-Supervised Learning) از ترکیبی از دادههای برچسبخورده و بدون برچسب استفاده میکند.
این روش زمانی مفید است که تهیهٔ دادهٔ خام آسان اما برچسبگذاری آن پرهزینه باشد.
برای مثال ممکن است میلیونها تصویر در دسترس باشند اما تنها بخشی از آنها توسط انسان برچسبگذاری شده باشند.
یادگیری خودنظارتشده
یادگیری خودنظارتشده (Self-Supervised Learning) روشی است که در آن هدف آموزشی از ساختار خود داده استخراج میشود.
برای مثال، در آموزش برخی مدلهای زبانی میتوان بخشی از متن را پنهان کرد و از مدل خواست آن را پیشبینی کند؛ یا مدل را برای پیشبینی ادامهٔ توالی آموزش داد.
یادگیری خودنظارتشده نقش مهمی در توسعهٔ مدلهای بنیادی و مدلهای زبانی بزرگ داشته است.
یادگیری تقویتی
یادگیری تقویتی (Reinforcement Learning) بر تعامل یک عامل با یک محیط استوار است.
عامل عملی انجام میدهد، محیط تغییر میکند و عامل پاداش یا بازخورد دریافت میکند.
به صورت ساده:
عامل → عمل → محیط ↑ ↓ ←──── پاداش ────
هدف عامل یادگیری سیاستی است که پاداش مورد انتظار را در طول زمان افزایش دهد.
یادگیری تقویتی در بازیها، رباتیک، کنترل و برخی روشهای آموزش سامانههای هوش مصنوعی کاربرد دارد.
شبکههای عصبی مصنوعی
شبکهٔ عصبی مصنوعی خانوادهای از مدلهای محاسباتی است که از واحدهای پردازشی بههمپیوسته تشکیل شده است.
ایدهٔ اولیهٔ آنها تا حدی از ساختار شبکههای عصبی زیستی الهام گرفته شده، اما شبکهٔ عصبی مصنوعی را نباید مدل دقیقی از مغز انسان دانست.
شبکههای عصبی جدید میتوانند شامل لایههای متعدد و میلیونها یا میلیاردها پارامتر باشند.
یادگیری عمیق
یادگیری عمیق (Deep Learning) زیرشاخهای از یادگیری ماشین است که عمدتاً بر شبکههای عصبی چندلایه استوار است.
یادگیری عمیق در دههٔ ۲۰۱۰ موجب پیشرفتهای چشمگیر در:
- تشخیص تصویر؛
- تشخیص گفتار؛
- ترجمهٔ ماشینی؛
- پردازش زبان طبیعی؛
- تولید تصویر؛
- و مدلهای زبانی
شد.
جفری هینتون، یوشوا بنجیو و یان لکون از پژوهشگران اثرگذار در توسعهٔ یادگیری عمیق معاصر بودهاند.
یادگیری ماشین و هوش مصنوعی
هوش مصنوعی مفهومی گستردهتر از یادگیری ماشین است.
هوش مصنوعی شامل روشها و سامانههایی است که برای انجام وظایفی مرتبط با ادراک، استدلال، برنامهریزی، زبان، تصمیمگیری یا حل مسئله طراحی میشوند.
یادگیری ماشین یکی از مهمترین روشهای ساخت چنین سامانههایی است.
به صورت مفهومی میتوان نوشت:
هوش مصنوعی
↓
یادگیری ماشین
↓
یادگیری عمیق
این رابطه نشاندهندهٔ یک تقسیمبندی رایج است، نه تعریف کامل همهٔ شاخههای هوش مصنوعی.
یادگیری ماشین و هوش مصنوعی مولد
هوش مصنوعی مولد به سامانههایی گفته میشود که قادر به تولید محتوایی مانند متن، تصویر، صوت، ویدئو یا کد هستند.
بسیاری از سامانههای مولد جدید با روشهای یادگیری ماشین و بهویژه یادگیری عمیق آموزش داده میشوند.
بنابراین:
هر یادگیری ماشینی هوش مصنوعی مولد نیست، اما بسیاری از سامانههای هوش مصنوعی مولد معاصر بر یادگیری ماشین متکی هستند.
یادگیری ماشین و مدلهای زبانی بزرگ
مدلهای زبانی بزرگ نمونهای مهم از کاربرد یادگیری ماشین هستند.
این مدلها با استفاده از مجموعههای بزرگ متن و روشهای یادگیری عمیق آموزش داده میشوند تا الگوهای زبان را بیاموزند.
در بسیاری از مدلهای خودرگرسیو، یکی از وظایف اصلی آموزشی پیشبینی توکن بعدی بر اساس توکنهای پیشین است.
مدل از طریق این فرایند میتواند ساختارهای زبانی و بسیاری از روابط آماری موجود در داده را بیاموزد.
ترنسفورمر
یکی از معماریهای بسیار اثرگذار در یادگیری عمیق ترنسفورمر (Transformer) است.
اشیش واسوانی و همکاران در سال ۲۰۱۷ مقالهٔ Attention Is All You Need را منتشر کردند و معماری ترنسفورمر را معرفی کردند.[۶]
ترنسفورمر بر سازوکار توجه (Attention) تکیه دارد و پایهٔ بسیاری از مدلهای زبانی و سامانههای مولد معاصر شده است.
کاربرد در پردازش زبان طبیعی
یادگیری ماشین در پردازش زبان طبیعی برای وظایفی مانند:
- ترجمهٔ ماشینی؛
- خلاصهسازی؛
- تحلیل احساسات؛
- پاسخ به پرسش؛
- تشخیص موجودیتها؛
- طبقهبندی متن؛
- و تولید زبان
استفاده میشود.
مدلهای زبانی بزرگ توسعهٔ این حوزه را به مرحلهٔ تازهای رساندهاند.
کاربرد در بینایی ماشین
بینایی ماشین (Computer Vision) به توسعهٔ سامانههایی برای پردازش و تحلیل تصاویر و ویدئو میپردازد.
یادگیری ماشین در این حوزه برای:
- تشخیص اشیا؛
- طبقهبندی تصاویر؛
- تقسیمبندی تصویر؛
- تشخیص چهره؛
- تحلیل تصاویر پزشکی؛
- و هدایت سامانههای خودکار
کاربرد دارد.
تشخیص گفتار
مدلهای یادگیری ماشین میتوانند سیگنال صوتی را به متن تبدیل کنند.
این فناوری در:
- دستیارهای صوتی؛
- زیرنویس خودکار؛
- رونویسی جلسات؛
- جستوجوی صوتی؛
- و سامانههای دسترسپذیری
کاربرد دارد.
موتورهای جستوجو
موتورهای جستوجو از روشهای یادگیری ماشین برای درک پرسوجو، رتبهبندی نتایج، تشخیص هرزنامه و بهبود ارتباط نتایج استفاده میکنند.
مدلهای یادگیری میتوانند از سیگنالهای متعدد برای تخمین ارتباط یک صفحه با نیاز کاربر استفاده کنند.
سامانههای توصیهگر
سامانههای توصیهگر از کاربردهای گستردهٔ یادگیری ماشین هستند.
فروشگاههای اینترنتی، خدمات پخش موسیقی و ویدئو و شبکههای اجتماعی میتوانند از رفتار کاربران برای پیشبینی محتوای مورد علاقهٔ آنها استفاده کنند.
این سامانهها ممکن است از:
- سابقهٔ مشاهده؛
- خرید؛
- امتیازدهی؛
- تعامل؛
- یا شباهت میان کاربران و محتوا
استفاده کنند.
پزشکی
یادگیری ماشین در پزشکی برای تحلیل تصاویر، پیشبینی خطر بیماری، پردازش پروندههای پزشکی و پژوهش دارویی مورد مطالعه و استفاده قرار گرفته است.
اما عملکرد مدل پزشکی به کیفیت داده و جمعیتی که مدل روی آن آموزش و ارزیابی شده وابسته است.
مدلی که روی یک جمعیت عملکرد مطلوبی دارد الزاماً همان عملکرد را در جمعیتی متفاوت نخواهد داشت.
از این رو ارزیابی بالینی و نظارت تخصصی اهمیت اساسی دارد.
اقتصاد و امور مالی
در حوزهٔ مالی، یادگیری ماشین در:
- ارزیابی ریسک؛
- کشف تقلب؛
- تحلیل بازار؛
- اعتبارسنجی؛
- پیشبینی؛
- و پردازش اسناد
کاربرد دارد.
در این حوزه نیز تصمیمهای الگوریتمی میتوانند پیامدهای اقتصادی مستقیم برای افراد داشته باشند و به همین دلیل شفافیت، قابلیت ارزیابی و سوگیری الگوریتمی اهمیت پیدا میکند.
صنعت
در صنعت، یادگیری ماشین میتواند برای:
- نگهداری پیشبینانهٔ تجهیزات؛
- کنترل کیفیت؛
- تشخیص خرابی؛
- بهینهسازی تولید؛
- مدیریت انرژی؛
- و رباتیک
استفاده شود.
برای مثال، دادههای حسگرهای یک دستگاه میتوانند برای پیشبینی احتمال خرابی پیش از وقوع آن تحلیل شوند.
کشاورزی
یادگیری ماشین در کشاورزی برای تحلیل تصاویر ماهوارهای، تشخیص بیماری گیاهان، پیشبینی محصول و مدیریت منابع آب به کار میرود.
ترکیب دادههای حسگرها، تصاویر هوایی و مدلهای پیشبینی میتواند اطلاعات بیشتری دربارهٔ وضعیت مزرعه فراهم کند.
آموزش
در آموزش، الگوریتمهای یادگیری ماشین میتوانند برای سامانههای آموزشی تطبیقی، تحلیل عملکرد دانشآموزان و تولید یا پیشنهاد محتوای آموزشی استفاده شوند.
با این حال استفاده از دادههای دانشآموزان مسائل مربوط به حریم خصوصی، امنیت و انصاف را نیز مطرح میکند.
خودروهای خودران
سامانههای رانندگی خودکار از مجموعهای از فناوریها از جمله یادگیری ماشین، بینایی ماشین، حسگرها، مکانیابی و کنترل استفاده میکنند.
مدلهای یادگیری میتوانند برای تشخیص:
- عابر پیاده؛
- خودرو؛
- علائم راهنمایی؛
- خطوط جاده؛
- و دیگر عناصر محیط
به کار روند.
در این کاربرد، خطای مدل میتواند پیامد ایمنی مستقیم داشته باشد.
الگوریتمهای شناختهشده
یادگیری ماشین شامل خانوادهٔ بزرگی از الگوریتمهاست.
از جمله:
- رگرسیون خطی؛
- رگرسیون لجستیک؛
- درخت تصمیم؛
- جنگل تصادفی؛
- ماشین بردار پشتیبان؛
- K نزدیکترین همسایه؛
- K-means؛
- شبکههای عصبی؛
- الگوریتمهای تقویتی؛
- و مدلهای مبتنی بر ترنسفورمر.
هیچ الگوریتمی برای همهٔ مسائل بهترین انتخاب نیست.
انتخاب روش به نوع داده، هدف، حجم داده، محدودیت محاسباتی و معیار ارزیابی بستگی دارد.
تابع زیان
تابع زیان مقدار اختلاف میان پیشبینی مدل و نتیجهٔ مطلوب را اندازهگیری میکند.
برای نمونه اگر مدل قیمت یک خانه را ۳۰۰ هزار واحد پیشبینی کند اما قیمت واقعی ۳۲۰ هزار باشد، تابع زیان میتواند میزان این اختلاف را به عدد تبدیل کند.
فرایند آموزش تلاش میکند مقدار زیان را کاهش دهد.
انتخاب تابع زیان بر آنچه مدل برای بهبود آن تلاش میکند اثر دارد.
گرادیان نزولی
گرادیان نزولی (Gradient Descent) یکی از روشهای رایج بهینهسازی مدلهاست.
الگوریتم با محاسبهٔ جهت تغییر تابع زیان، پارامترهای مدل را بهگونهای اصلاح میکند که زیان کاهش یابد.
در شبکههای عصبی، گرادیانها معمولاً با استفاده از روش پسانتشار (Backpropagation) محاسبه میشوند.
ابرپارامتر
ابرپارامتر (Hyperparameter) مقداری است که معمولاً پیش از آموزش یا در فرایند تنظیم مدل تعیین میشود و برخلاف پارامترهای مدل مستقیماً از همان فرایند یادگیری معمول آموخته نمیشود.
نمونهها میتوانند شامل:
- نرخ یادگیری؛
- تعداد لایهها؛
- اندازهٔ دسته؛
- و برخی پارامترهای منظمسازی
باشند.
انتخاب ابرپارامترها میتواند تأثیر قابل توجهی بر عملکرد مدل داشته باشد.
معیارهای ارزیابی
عملکرد مدل باید با معیار مناسب اندازهگیری شود.
در طبقهبندی، معیارهایی مانند:
- Accuracy؛
- Precision؛
- Recall؛
- F1 Score
استفاده میشوند.
اما انتخاب معیار باید با هدف مسئله متناسب باشد.
برای مثال در تشخیص یک بیماری نادر، دقت کلی بهتنهایی ممکن است گمراهکننده باشد؛ زیرا مدلی که تقریباً همهٔ افراد را «سالم» اعلام کند ممکن است Accuracy بالایی داشته باشد اما بیماران را تشخیص ندهد.
داده و کیفیت مدل
عبارت شناختهشدهٔ علوم رایانه:
Garbage In, Garbage Out
به این معناست که دادهٔ نامناسب میتواند به خروجی نامناسب منجر شود.
اگر دادهها ناقص، نادرست یا غیرنماینده باشند، مدل ممکن است الگوهایی را بیاموزد که در جهان واقعی قابل اعتماد نیستند.
بنابراین آمادهسازی و ارزیابی داده یکی از مراحل مهم پروژههای یادگیری ماشین است.
سوگیری الگوریتمی
سوگیری الگوریتمی یکی از مسائل مهم یادگیری ماشین است.
اگر دادهٔ آموزشی منعکسکنندهٔ نابرابریهای تاریخی یا دارای نمونهگیری نامتوازن باشد، مدل میتواند بخشی از همان الگوها را بازتولید کند.
NIST تأکید کرده است که سوگیری در هوش مصنوعی تنها به داده یا الگوریتم محدود نیست و میتواند دارای منشأ سیستمی، آماری و محاسباتی یا شناختی انسانی باشد.[۷]
بنابراین ارزیابی مدل باید فراتر از دقت کلی آن باشد و پیامدهای عملکرد برای گروههای مختلف نیز بررسی شود.
حریم خصوصی
آموزش مدلهای یادگیری ماشین گاهی به حجم بزرگی از دادههای کاربران نیاز دارد.
این امر پرسشهایی دربارهٔ:
- جمعآوری داده؛
- رضایت؛
- نگهداری؛
- ناشناسسازی؛
- امنیت؛
- و استفادهٔ ثانویه از داده
ایجاد میکند.
روشهایی مانند حریم خصوصی تفاضلی (Differential Privacy) برای کاهش برخی خطرهای افشای اطلاعات مورد مطالعه قرار گرفتهاند.
توضیحپذیری
برخی مدلهای یادگیری ماشین بسیار پیچیدهاند و درک دلیل دقیق یک پیشبینی در آنها دشوار است.
این مسئله به حوزهٔ هوش مصنوعی توضیحپذیر (Explainable AI) مربوط میشود.
توضیحپذیری در کاربردهایی مانند پزشکی، اعتبارسنجی و تصمیمهای اداری اهمیت بیشتری دارد، زیرا فرد ممکن است نیاز داشته باشد بداند چرا سامانه تصمیم خاصی گرفته است.
توهم هوش مصنوعی
توهم هوش مصنوعی بیشتر در ارتباط با مدلهای مولد مطرح میشود و به تولید محتوای نادرست یا فاقد پشتوانه اشاره دارد.
این مفهوم را نباید با خطای معمول یک مدل طبقهبندی یکسان دانست.
برای مثال اگر مدل تشخیص تصویر یک سگ را گربه تشخیص دهد، این یک خطای طبقهبندی است.
اما اگر یک مدل زبانی نام کتاب، نویسنده و منبعی را که وجود خارجی ندارد تولید کند، این رفتار معمولاً «توهم» نامیده میشود.
حملات خصمانه
مدلهای یادگیری ماشین میتوانند در برابر نمونههای خصمانه (Adversarial Examples) آسیبپذیر باشند.
در چنین حملاتی، تغییراتی طراحیشده در ورودی میتواند مدل را به پیشبینی اشتباه سوق دهد، حتی اگر تغییر برای انسان بسیار کوچک یا کماهمیت به نظر برسد.
این حوزه بخشی از پژوهشهای امنیت یادگیری ماشین است.
تغییر توزیع داده
مدلی که در یک محیط آموزش دیده است ممکن است با تغییر شرایط عملکرد ضعیفتری داشته باشد.
برای مثال الگوی رفتار مشتریان، زبان کاربران یا شرایط اقتصادی ممکن است در طول زمان تغییر کند.
اگر توزیع دادههای واقعی از دادههای آموزشی فاصله بگیرد، مدل نیازمند پایش و گاهی آموزش مجدد خواهد بود.
این مسئله با مفاهیمی مانند Data Drift و Concept Drift ارتباط دارد.
محدودیتهای یادگیری ماشین
یادگیری ماشین با وجود تواناییهای گسترده محدودیتهایی دارد.
از جمله:
- وابستگی به داده؛
- امکان بیشبرازش؛
- دشواری تعمیم خارج از توزیع آموزشی؛
- سوگیری؛
- هزینهٔ محاسباتی؛
- مشکلات توضیحپذیری؛
- آسیبپذیری امنیتی؛
- و وابستگی به معیارهایی که انسان برای آموزش و ارزیابی انتخاب میکند.
مدل همچنین لزوماً رابطهٔ علّی را از همبستگی آماری تشخیص نمیدهد.
همبستگی و علیت
یکی از نکات مهم در تفسیر مدلهای یادگیری ماشین تفاوت میان همبستگی و علیت است.
اگر دو متغیر در داده با یکدیگر ارتباط داشته باشند، این ارتباط بهتنهایی ثابت نمیکند که یکی علت دیگری است.
مدل ممکن است برای پیشبینی از همبستگیهایی استفاده کند که هیچ رابطهٔ علّی مستقیمی ندارند.
بنابراین خروجی یک مدل پیشبینی را نباید بدون شواهد اضافی به عنوان اثبات رابطهٔ علت و معلولی تفسیر کرد.
یادگیری ماشین و تصمیم انسانی
سامانهٔ یادگیری ماشین میتواند ابزار پشتیبان تصمیم باشد، اما میزان اتکا به آن باید متناسب با خطر کاربرد تعیین شود.
در حوزههای حساس باید پرسید:
- نرخ خطا چقدر است؟
- مدل روی چه دادهای آموزش دیده است؟
- عملکرد آن برای گروههای مختلف چگونه است؟
- آیا تصمیم قابل اعتراض است؟
- چه کسی مسئول نتیجه است؟
- و آیا انسان اختیار واقعی برای بازبینی تصمیم دارد؟
این پرسشها یادگیری ماشین را از یک مسئلهٔ صرفاً فنی به موضوعی اجتماعی و حقوقی نیز تبدیل میکنند.
یادگیری ماشین و قدرت
گسترش سامانههای یادگیری ماشین در استخدام، اعتبارسنجی، رسانه، تبلیغات، نظارت و خدمات عمومی به این الگوریتمها نقش بیشتری در توزیع فرصت و اطلاعات داده است.
بنابراین مطالعهٔ یادگیری ماشین تنها بررسی دقت الگوریتم نیست؛ بلکه شامل بررسی نحوهٔ استفاده از آن نیز میشود.
سامانهای که از نظر آماری دقیق است میتواند در صورت استفادهٔ نامناسب پیامد اجتماعی نامطلوب داشته باشد.
یادگیری ماشین و دموکراسی
کاربرد یادگیری ماشین در شبکههای اجتماعی، تبلیغات سیاسی، تعدیل محتوا و سامانههای توصیهگر موجب طرح پرسشهایی دربارهٔ آزادی بیان، دسترسی به اطلاعات و پلورالیسم سیاسی شده است.
الگوریتمهای توصیهگر میتوانند بر آنچه کاربران مشاهده میکنند اثر بگذارند.
با این حال تأثیر واقعی هر سامانه باید بر اساس داده و شواهد مربوط به همان سامانه بررسی شود و نمیتوان صرف استفاده از الگوریتم را به معنای دستکاری سیاسی دانست.
یادگیری ماشین در ایران
یادگیری ماشین در ایران نیز در دانشگاهها، شرکتهای فناوری و کاربردهایی مانند پردازش زبان فارسی، تحلیل داده، تشخیص تصویر، خدمات مالی و سامانههای هوشمند مورد استفاده و پژوهش قرار گرفته است.
برای زبان فارسی، توسعهٔ مجموعهدادههای باکیفیت و متنوع اهمیت ویژهای دارد.
کمبود یا عدم توازن داده میتواند بر کیفیت سامانههای پردازش زبان فارسی اثر بگذارد.
همچنین استفادهٔ حکومتی از فناوریهای تشخیص چهره، تحلیل داده یا تصمیمگیری خودکار، در صورت تأثیرگذاری بر حقوق شهروندان، ضرورت شفافیت، پاسخگویی و نظارت مستقل را مطرح میکند. ارزیابی هر ادعای مشخص دربارهٔ چنین سامانههایی نیازمند داده و منابع قابل راستیآزمایی است.
یادگیری ماشین و آیندهٔ هوش مصنوعی
یادگیری ماشین در چند دههٔ اخیر از حوزهای تخصصی در علوم رایانه به یکی از فناوریهای بنیادی اقتصاد دیجیتال تبدیل شده است.
مدلهای بنیادی، هوش مصنوعی مولد، سامانههای چندوجهی، رباتیک و عاملهای هوشمند از حوزههایی هستند که توسعهٔ آنها به روشهای یادگیری ماشین وابستگی گستردهای دارد.
در عین حال، افزایش توان مدلها موجب افزایش اهمیت پژوهش دربارهٔ ایمنی، قابلیت اعتماد، مصرف منابع، حریم خصوصی، سوگیری و پاسخگویی شده است.
جمعبندی
یادگیری ماشین شاخهای از هوش مصنوعی است که به توسعهٔ الگوریتمها و مدلهایی میپردازد که از داده یا تجربه الگو میآموزند و از این الگوها برای پیشبینی، طبقهبندی، تصمیمگیری یا تولید استفاده میکنند.
ریشههای آن به پژوهشهای اولیهٔ هوش مصنوعی، آمار و تشخیص الگو در میانهٔ سدهٔ بیستم بازمیگردد. پژوهش آرتور ساموئل دربارهٔ برنامهٔ بازی چکرز در سال ۱۹۵۹ از آثار اولیهٔ این حوزه بود.[۸]
یادگیری نظارتشده، بدون نظارت، نیمهنظارتشده، خودنظارتشده و تقویتی از رویکردهای مهم این حوزه هستند. یادگیری عمیق نیز به عنوان زیرشاخهای از یادگیری ماشین، پایهٔ بسیاری از پیشرفتهای معاصر در بینایی ماشین، پردازش زبان و هوش مصنوعی مولد را فراهم کرده است.
با این حال، عملکرد مدل به داده، روش آموزش، معیار ارزیابی و شرایط کاربرد وابسته است. بیشبرازش، سوگیری الگوریتمی، مشکلات حریم خصوصی، دشواری توضیحپذیری و تغییر توزیع داده از چالشهای مهم این حوزهاند.
از این رو یادگیری ماشین را نمیتوان صرفاً «توانایی رایانه برای یادگرفتن» توصیف کرد؛ بلکه مجموعهای از روشهای آماری و محاسباتی است که تلاش میکنند از داده مدلهایی بسازند که در برابر نمونههای جدید نیز عملکرد قابل اندازهگیری و قابل تعمیم داشته باشند.
جستارهای وابسته
- هوش مصنوعی
- هوش مصنوعی مولد
- یادگیری عمیق
- مدل زبانی بزرگ
- شبکه عصبی مصنوعی
- پردازش زبان طبیعی
- بینایی ماشین
- ترنسفورمر
- توکن (هوش مصنوعی)
- پرامپت (هوش مصنوعی)
- توهم هوش مصنوعی
- سوگیری الگوریتمی
- الگوریتم
- علم داده
- علوم رایانه
منابع
- ↑ IBM، «What Is Machine Learning?»
- ↑ Arthur L. Samuel، “Some Studies in Machine Learning Using the Game of Checkers”، IBM Journal of Research and Development، 1959
- ↑ Tom M. Mitchell، Machine Learning، McGraw-Hill، 1997
- ↑ Alan M. Turing، “Computing Machinery and Intelligence”، Mind، 1950
- ↑ Samuel، “Some Studies in Machine Learning Using the Game of Checkers”
- ↑ Ashish Vaswani et al.، “Attention Is All You Need”، 2017
- ↑ NIST، Towards a Standard for Identifying and Managing Bias in Artificial Intelligence، 2022
- ↑ Arthur L. Samuel، “Some Studies in Machine Learning Using the Game of Checkers”، 1959
کتابشناسی
- Bishop, Christopher M. Pattern Recognition and Machine Learning. New York: Springer, 2006.
- Goodfellow, Ian, Yoshua Bengio, and Aaron Courville. Deep Learning. Cambridge, MA: MIT Press, 2016.
- Hastie, Trevor, Robert Tibshirani, and Jerome Friedman. The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2nd ed. New York: Springer, 2009.
- Mitchell, Tom M. Machine Learning. New York: McGraw-Hill, 1997.
- Murphy, Kevin P. Machine Learning: A Probabilistic Perspective. Cambridge, MA: MIT Press, 2012.
- Russell, Stuart, and Peter Norvig. Artificial Intelligence: A Modern Approach. 4th ed. Hoboken, NJ: Pearson, 2021.
- Samuel, Arthur L. “Some Studies in Machine Learning Using the Game of Checkers.” IBM Journal of Research and Development 3, no. 3 (1959): 210–229.
- Turing, Alan M. “Computing Machinery and Intelligence.” Mind 59, no. 236 (1950): 433–460.
- Vaswani, Ashish, Noam Shazeer, Niki Parmar, et al. “Attention Is All You Need.” Advances in Neural Information Processing Systems 30 (2017).