Пятый курс специализации Машинное обучение и анализ данных от МФТИ и Яндекс.
Всё, что творится внутри этой папки, подвержено своим законам.
- Homework содержит домашние задания. Названия папок начинаются с номера недели на курсе
- Lectures содержит лекции 😂
- Notebooks содержит ноутбуки из лекций. Названия папок начинаются с номера недели на курсе
- Slides содержит слайды
- Tests содержит ноутбуки, на основе которых были решены тесты
- Бизнес-задачи
- Анализ медиа
- Анализ текстов
- Рекомендации и ранжирование
Методы машинного обучения — будь то алгоритмы классификации или регрессии, методы кластеризации или алгоритмы понижения размерности — применяются к подготовленным данным с вычисленными признаками для решения уже сформулированной задачи. Однако специалисты по анализу данных редко оказываются в такой идеальной ситуации. Обычно перед ними ставят задачи, которые нуждаются в уточнении формулировки, выборе метрики качества и протокола тестирования итоговой модели. Данные, с которыми нужно работать, часто представлены в непригодном виде: они зашумлены, содержат ошибки и выбросы, хранятся в неудобном формате и т. д.
В этом курсе мы разберем прикладные задачи из различных областей анализа данных: анализ текста и информационный поиск, коллаборативная фильтрация и рекомендательные системы, бизнес-аналитика, прогнозирование временных рядов. На их примере вы узнаете, как извлекать признаки из разнородных данных, какие при этом возникают проблемы и как их решать. Вы научитесь сводить задачу заказчика к формальной постановке задачи машинного обучения и поймёте, как проверять качество построенной модели на исторических данных и в онлайн-эксперименте. На каждой задаче мы изучим плюсы и минусы пройденных алгоритмов машинного обучения.
Прослушав этот курс, вы познакомитесь с распространенными типами прикладных задач и будете понимать схемы их решения.