Перед началом
О чём вообще эта лаба
У магазина есть данные о 2240 покупателях. Мы учимся делать с данными четыре вещи: доставать ответы на вопросы, рассматривать графики, чинить дыры в данных и делить покупателей на группы.
| Раздел | Что делаем | Баллы |
|---|---|---|
| 1. pandas и SQL | Читаем таблицы и отвечаем на 2 вопроса двумя способами | 4 |
| 2. EDA | Разбираем графики, придумываем и проверяем гипотезу | 3 |
| 3. Предобработка и kNN | Заполняем 24 пропущенных дохода по похожим клиентам | 2 |
| 4. Кластеры | Готовый kMeans делит клиентов на 4 группы, объясняем их | 1 |
| 5. Свой kMeans | Пишем тот же алгоритм руками на игрушечных точках | 4 |
| Итого | 14 |
Три слова, без которых дальше никак
- Python
- Язык программирования, на нём написан весь код лабы.
- Ноутбук (Colab)
- Документ из ячеек: в одних код, в других текст. Ячейку запускают кнопкой, и под ней появляется результат.
- Библиотека
- Готовый набор команд, который подключают строкой
import. Нам нужны pandas (таблицы), numpy (числа), matplotlib и seaborn (графики), sklearn (машинное обучение).
На пальцах. Вся лаба похожа на работу аналитика в магазине. Сначала он отвечает на простые вопросы начальника («у кого какой доход»), потом рассматривает графики, потом чинит анкеты, где не заполнен доход, и в конце делит покупателей на группы, чтобы каждой слать свою рекламу.