یادگیری ماشینی به بیان ساده به معنای استخراج دانش از دادهها است. دادهها شامل مجموعهای از اعداد و ارقام است که شاید در نگاه اول مفهومی نداشته باشد. در یادگیری ماشینی تلاش میشود که الگوهای معنیداری از دادهها استخراج شود یا دادهها به گروههای معنیداری طبقهبندی شود.
یادگیری ماشینی به دو دستهی بزرگ تقسیم میشود: یادگیری نظارت شده و یادگیری بدون نظارت.
۱. در یادگیری نظارت شده، ابتدا مجموعهای از ورودیها و خروجی مطلوب آنها به رایانه داده میشود. سپس، وقتی که رایانه به اندازهی کافی «آموزش» داده شد، ورودیها به آن داده میشود تا خروجی مناسب را تولید نماید.
۲. در یادگیری بدون نظارت، صرفاً دادهها به رایانه دیده میشود تا الگو یا ساختار موجود در دادهها را پیدا کند.
نوع دیگری از دستهبندی نیز برای یادگیری ماشینی وجود دارد و آن دستهبندی بر اساس خروجی مطلوب است:
۱. در طبقهبندی، هدف آن است که رایانه ورودیها را به دستههای مختلفی که از قبل مشخص هستند، طبقهبندی کند.
۲. در رگرسیون، ورودیها بهصورت مقادیر عددی پیوسته هستند و رایانه تلاش میکند همبستگی بین آنها را کشف کند.
۳. در خوشهبندی، هدف آن است که ورودیها در خوشههای مختلفی (که بر خلاف طبقهبندی از قبل مشخص نیستند)، قرار گیرند.
۴. در برآورد چگالی، برنامه تلاش میکند توزیع ورودیها را مشخص کند.
۵. در روش کاهش ابعاد، تلاش میشود تعداد ابعاد (یا خصوصیات) ورودیها کاهش داده شود.