Курс "Специалист по искусственному интеллекту". Урок 7. Выбросы, кодирование категорий, визуализация
Седьмой урок курса «Специалист по искусственному интеллекту». Подробно разбираем математический метод очистки выбросов IQR, особенности кодирования категорий (Label Encoding vs One-Hot Encoding), боремся с «проклятием размерности» и проводим продвинутую визуализацию (jointplot, pairplot) в Seaborn. В этой лекции мы подробно обсудим: – Понятие выбросов (Outliers) и их влияние на качество обучения (почему выбросы критически вредят весам линейных моделей). – Эффект Билла Гейтса в баре: разницу между средним арифметическим и медианой в статистике. – Как визуализировать выбросы с помощью графиков Box Plot («ящик с усами»). – Математический метод IQR (межквартильного размаха): расчет границ нормального распределения. – Реализацию итеративного алгоритма очистки выбросов стоимости жилья по категориям комнат. – Категориальные признаки: почему машины понимают только числа и как оцифровать текст. – Метод Label Encoding (Порядковое кодирование): когда его уместно использовать и почему он создает ложную иерархию на номинальных данных. – Метод One-Hot Encoding (дамми-кодирование) и его преимущества. – Понятие «проклятия размерности» (Curse of Dimensionality) как главного недостатка OHE-кодирования. – Практическую реализацию дамми-кодирования в Pandas при помощи метода pd.get_dummies(). – Зачем отбрасывать первый признак (параметр drop_first=True) и как это борется с избыточностью информации (мультиколлинеарностью). – Финальную очистку и экспорт подготовленного датасета в файл rent_dataset.csv. – Продвинутую визуализацию взаимосвязей признаков и совместных распределений с помощью sns.jointplot. – Панорамный анализ структуры данных и корреляций через sns.pairplot (использование параметра hue). – Сводный обзор типичных «болезней» данных (пропуски, асимметрия, несбалансированность классов) и методы их лечения. Практическая работа выполняется в интерактивной облачной среде Google Colab. Сайт автора курса: https://leolukin.ru Таймкоды / таймметки 00:00 — Понятие выбросов (Outliers) и их влияние на анализ данных 01:21 — Причины возникновения выбросов: аномалии vs ошибки ввода 03:20 — Какие проблемы создают выбросы: искажение средних и стандартного отклонения 04:02 — Эффект Билла Гейтса в баре: разница между средним и медианой 05:22 — Как выбросы притягивают линию регрессии в методе наименьших квадратов (MSE) 06:40 — Когда выбросы полезны: задачи обнаружения аномалий и мошенничества 08:08 — Методы обнаружения выбросов: ящик с усами (Box Plot) и диаграмма рассеяния 11:28 — Как устроен ящик с усами: медиана, квартили (Q1, Q3) и межквартильный размах (IQR) 11:58 — Стратегии борьбы с выбросами: удаление, замена границами или логарифмирование 12:12 — Почему в устойчивых моделях (деревья решений) выбросы можно оставлять 21:00 — Визуализация выбросов стоимости жилья на графиках Seaborn (sns.boxplot) 22:42 — Сегментация выбросов по категориям (количеству комнат) 33:40 — Итеративный процесс: алгоритм фильтрации выбросов по методу IQR в цикле 36:38 — Почему после первого раунда очистки могут снова появляться «мягкие» выбросы 38:56 — Категориальные признаки: почему машины понимают только числа 40:06 — Метод 1: Порядковое кодирование (Label Encoding) — когда его уместно использовать 41:22 — Проблема ложной иерархии при использовании Label Encoding на номинальных данных 47:07 — Метод 2: Дамми-кодирование (One-Hot Encoding, OHE) и его преимущества 48:48 — «Проклятие размерности» (Curse of Dimensionality) как главный недостаток OHE 51:52 — Реализация OHE в Pandas с помощью pd.get_dummies() 53:32 — Зачем отбрасывать первый признак (drop_first=True) и как это борется с избыточностью 01:01.02 — Финальная очистка и экспорт подготовленного датасета в файл rent_dataset.csv 01:05.00 — Продвинутая визуализация взаимосвязей признаков с помощью sns.jointplot 01:06.00 — Панорамный анализ структуры данных и корреляций через sns.pairplot 01:12.40 — Сводный обзор типичных «болезней» данных (пропуски, асимметрия, мало строк)
Седьмой урок курса «Специалист по искусственному интеллекту». Подробно разбираем математический метод очистки выбросов IQR, особенности кодирования категорий (Label Encoding vs One-Hot Encoding), боремся с «проклятием размерности» и проводим продвинутую визуализацию (jointplot, pairplot) в Seaborn. В этой лекции мы подробно обсудим: – Понятие выбросов (Outliers) и их влияние на качество обучения (почему выбросы критически вредят весам линейных моделей). – Эффект Билла Гейтса в баре: разницу между средним арифметическим и медианой в статистике. – Как визуализировать выбросы с помощью графиков Box Plot («ящик с усами»). – Математический метод IQR (межквартильного размаха): расчет границ нормального распределения. – Реализацию итеративного алгоритма очистки выбросов стоимости жилья по категориям комнат. – Категориальные признаки: почему машины понимают только числа и как оцифровать текст. – Метод Label Encoding (Порядковое кодирование): когда его уместно использовать и почему он создает ложную иерархию на номинальных данных. – Метод One-Hot Encoding (дамми-кодирование) и его преимущества. – Понятие «проклятия размерности» (Curse of Dimensionality) как главного недостатка OHE-кодирования. – Практическую реализацию дамми-кодирования в Pandas при помощи метода pd.get_dummies(). – Зачем отбрасывать первый признак (параметр drop_first=True) и как это борется с избыточностью информации (мультиколлинеарностью). – Финальную очистку и экспорт подготовленного датасета в файл rent_dataset.csv. – Продвинутую визуализацию взаимосвязей признаков и совместных распределений с помощью sns.jointplot. – Панорамный анализ структуры данных и корреляций через sns.pairplot (использование параметра hue). – Сводный обзор типичных «болезней» данных (пропуски, асимметрия, несбалансированность классов) и методы их лечения. Практическая работа выполняется в интерактивной облачной среде Google Colab. Сайт автора курса: https://leolukin.ru Таймкоды / таймметки 00:00 — Понятие выбросов (Outliers) и их влияние на анализ данных 01:21 — Причины возникновения выбросов: аномалии vs ошибки ввода 03:20 — Какие проблемы создают выбросы: искажение средних и стандартного отклонения 04:02 — Эффект Билла Гейтса в баре: разница между средним и медианой 05:22 — Как выбросы притягивают линию регрессии в методе наименьших квадратов (MSE) 06:40 — Когда выбросы полезны: задачи обнаружения аномалий и мошенничества 08:08 — Методы обнаружения выбросов: ящик с усами (Box Plot) и диаграмма рассеяния 11:28 — Как устроен ящик с усами: медиана, квартили (Q1, Q3) и межквартильный размах (IQR) 11:58 — Стратегии борьбы с выбросами: удаление, замена границами или логарифмирование 12:12 — Почему в устойчивых моделях (деревья решений) выбросы можно оставлять 21:00 — Визуализация выбросов стоимости жилья на графиках Seaborn (sns.boxplot) 22:42 — Сегментация выбросов по категориям (количеству комнат) 33:40 — Итеративный процесс: алгоритм фильтрации выбросов по методу IQR в цикле 36:38 — Почему после первого раунда очистки могут снова появляться «мягкие» выбросы 38:56 — Категориальные признаки: почему машины понимают только числа 40:06 — Метод 1: Порядковое кодирование (Label Encoding) — когда его уместно использовать 41:22 — Проблема ложной иерархии при использовании Label Encoding на номинальных данных 47:07 — Метод 2: Дамми-кодирование (One-Hot Encoding, OHE) и его преимущества 48:48 — «Проклятие размерности» (Curse of Dimensionality) как главный недостаток OHE 51:52 — Реализация OHE в Pandas с помощью pd.get_dummies() 53:32 — Зачем отбрасывать первый признак (drop_first=True) и как это борется с избыточностью 01:01.02 — Финальная очистка и экспорт подготовленного датасета в файл rent_dataset.csv 01:05.00 — Продвинутая визуализация взаимосвязей признаков с помощью sns.jointplot 01:06.00 — Панорамный анализ структуры данных и корреляций через sns.pairplot 01:12.40 — Сводный обзор типичных «болезней» данных (пропуски, асимметрия, мало строк)
