BI Consult Desktop Logo BI Consult Mobile Logo
  • Russian BI Исследование российских bi
  • Перейти на Fine BI
  • Контакты
  • +7 812 334-08-01
    +7 499 608-13-06
  • Отправить сообщение
  • Главная
  • Продукты Эксперт-BI
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Сельское хозяйство
    • Энергетика
    • FMCG
    • Девелоперы
    • Маркетплейсы
    • Пищевая промышленность
    • Фармацевтика
    • Построение Data Platform
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и FP&A
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • IBP
    • ИТ (CIO)
    • Закупки
  • Платформы
    • Системы бизнес-анализа (BI)
    • Интегрированное бизнес-планирование (IBP)
    • Хранилища данных (DWH / Lakehouse)
    • Каталоги данных (Data Catalog)
    • Системы ETL и ELT
    • AI / Исскуственный интеллект
    • Шина данных (ESB)
    • Система управления мастер-данными (MDM)
    • Семантический слой
  • Услуги
    • Переход на отечественные BI и DWH системы
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений и DWH
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Курсы
    • Учебный курс Информационная грамотность (Data Literacy)
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Greenplum
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt (Data Build Tool)
  • Компания
    • Руководство
    • Новости
    • Клиенты
    • Карьера
    • Скачать
    • Контакты

BI

  • FineBI
  • FineReport
  • FineDataLink
  • FineChatBI (FineAI)
  • Коннекторы данных из 1С в BI
  • Airflow / Nifi
  • Visiology
  • PIX BI
  • Modus BI
  • Yandex.DataLens
  • Open-source BI: Superset/Metabase
  • Luxms BI
  • AW BI + Alpha BI
  • FlyBI + Форсайт. Аналитическая Платформа
  • Loginom
  • Триафлай
  • AI / Исскуственный интеллект
  • Optimacros
  • Навигатор BI
  • Семантический слой

СУБД

  • Arenadata
  • ClickHouse
  • Greenplum
  • Postgres Professional
  • TData

Другое

  • Построение Data Platform
    • Аналитическое хранилище данных
    • Data Lake и Data Engineering
    • Подробнее про Data Lake
    • Внедрение Lakehouse
      • Apache Doris
      • StarRocks
      • Trino
    • Миграция витрин из пропиетарных DWH на новый стек
    • Учебный курс "Современная архитектура хранилища данных"
Главная » Курсы по системам бизнес-анализа и методологии » Учебный курс по MLOps и Data Science (ML, AI) » Гребневая(ридж) регрессия и регрессия Лассо и их реализация с помощью Python

Гребневая(ридж) регрессия и регрессия Лассо и их реализация с помощью Python

В этой статье я расскажу вам о гребневой регрессии и регрессии Лассо в машинном обучении и о том, как реализовать ее с помощью языка программирования Python.

Гребневая(ридж) модель регрессии и модель регрессии Лассо – это регуляризованные линейные модели, хороший способ уменьшить переобучение и упорядочить модель: чем меньше у нее степеней свободы, тем сложнее будет переобучить данные. Простой способ регуляризации полиномиальной модели – уменьшить количество степеней полинома.

Для линейной модели регуляризация обычно выполняется путем ограничения весов модели. А сейчас мы рассмотрим гребневую регрессию и регрессию Лассо, которые реализуют различные способы ограничения весов.

 

Гребневая (ридж) регрессия

Гребневая(ридж) регрессия – это регуляризованная версия линейной регрессии. Она заставляет алгоритм обучения не только соответствовать данным, но и сохранять веса модели как можно меньшими.

Обратите внимание, что срок начисления следует добавлять к функции затрат только во время обучения. После обучения модели вы хотите использовать нерегулируемую меру производительности для оценки производительности модели.

 

Регрессия Лассо

Наименьшее абсолютное сжатие и регрессия оператора выбора (обычно называется регрессия Лассо) – это еще одна регуляризованная версия линейной регрессии: так же, как пиковая регрессия, она добавляет член регуляризации к функции стоимости, но использует норму ℓ1 весового вектора вместо половины квадрата нормы ℓ2.

 

Гребневая (ридж) регрессия и регрессия Лассо с Python

Как и в других задачах, в этой задаче, чтобы показать реализацию гребневой регрессии и регрессии Лассо с Python, я начну с импорта необходимых пакетов и модулей Python:

 

import pandas as pd
import numpy as np
import matplotlib.pyplot as plt

 

А теперь давайте импортируем данные, проведем очистку и посмотрим, как выглядят данные, с которыми мы собираемся работать. Вы можете скачать набор данных, который я использую в этой задаче, отсюда:

 

data = pd.read_csv("Advertising.csv")
print(data.head())

 

Результат:

   Unnamed: 0     TV  Radio  Newspaper  Sales

0           1  230.1   37.8       69.2   22.1

1           2   44.5   39.3       45.1   10.4

2           3   17.2   45.9       69.3    9.3

3           4  151.5   41.3       58.5   18.5

4           5  180.8   10.8       58.4   12.9

 

Теперь удалим безымянный столбец:

 

data.drop(["Unnamed: 0"], axis=1, inplace=True)

 

Сейчас у нас всего три рекламных медиа, и наша целевая переменная – продажи. Давайте посмотрим, как каждая переменная влияет на продажи, и для этого создадим диаграмму рассеяния. Сначала мы создаем вспомогательную функцию для построения диаграммы рассеяния:

 

def scatter_plot(feature, target):
    plt.figure(figsize=(16, 18))
    plt.scatter(data[feature],
                data[target],
                c='black'
                )
    plt.xlabel("Money Spent on {} ads ($)".format(feature))
    plt.ylabel("Sales ($k)")
    plt.show()
scatter_plot("TV", "Sales")
scatter_plot("Radio", "Sales")
scatter_plot("Newspaper", "Sales")

 

 

 

 

 

Алгоритм множественной линейной регрессии

Модели гребневой(ридж) регрессии и регрессии Лассо являются способом регуляризации линейных моделей, но нам сначала нужно подготовить линейную модель. Итак, давайте рассмотрим код для подготовки модели множественной линейной регрессии:

 

from sklearn.model_selection import cross_val_score
from sklearn.linear_model import LinearRegression

xs = data.drop(["Sales"], axis=1)
y = data["Sales"].values.reshape(-1,1)
linreg = LinearRegression()
MSE = cross_val_score(linreg, xs, y, scoring="neg_mean_squared_error", cv=5)

mean_MSE = np.mean(MSE)
print(mean_MSE)

 

Теперь нам нужно посмотреть, что лучше: гребневая(ридж) регрессия или регрессия Лассо.

 

Гребневая(ридж) регрессия

Для алгоритма гребневой(ридж) регрессии я буду использовать модель GridSearchCV, предоставленную Scikit-learn, которая позволит нам автоматически выполнить 5-кратную перекрестную проверку, чтобы найти оптимальное значение альфа.

Вот как выглядит код для алгоритма гребневой(ридж)  регрессии:

 

# Ridge Regression
from sklearn.model_selection import GridSearchCV
from sklearn.linear_model import Ridge
ridge = Ridge()

parameters = {"alpha":[1e-15, 1e-10, 1e-8, 1e-4, 1e-3, 1e-2, 1, 5, 10, 20]}
ridge_regression = GridSearchCV(ridge, parameters, scoring='neg_mean_squared_error', cv=5)
ridge_regression.fit(xs, y)

 

И тогда мы можем легко найти лучший параметр и лучшую MSE, используя следующие команды:

 

print(ridge_regression.best_params_)
print(ridge_regression.best_score_)

 

Результат:

{‘alpha’: 20}
-3.0726713383411424

 

 

Регрессия Лассо

Для регрессии Лассо нам также необходимо следовать тому же процессу, что и для гребневой(ридж) регрессии. Вот как выглядит код:

 

from sklearn.linear_model import Lasso
lasso = Lasso()

parameters = {"alpha":[1e-15, 1e-10, 1e-8, 1e-4, 1e-3, 1e-2, 1, 5, 10, 20]}
lasso_regression = GridSearchCV(lasso, parameters, scoring='neg_mean_squared_error', cv=5)
lasso_regression.fit(xs, y)

print(lasso_regression.best_params_)
print(lasso_regression.best_score_)

 

Результат:

{‘alpha’: 1}
-3.041405896751369

Надеюсь, теперь вы знаете, как реализовать гребневую(ридж) регрессию и регрессию Лассо в машинном обучении с помощью языка программирования Python. В этом случае лучшим методом настройки будет лассо со значением регуляризации, равным 1.

Надеюсь, вам понравилась эта статья о том, как реализовать алгоритмы гребневой(ридж) регрессии и регрессии Лассо в машинном обучении с помощью языка программирования Python.

 

Узнать стоимость решенияЗапросить видео презентацию

← Предыдущая статья
Алгоритмы поиска на графах с Python
Следующая статья →
StandardScaler в машинном обучении

 

Внедряем AI в бизнес-процессы крупных компаний
От стратегии и инфраструктуры до AI-агентов, интеграций и промышленной эксплуатации.

Подробнее об AI-решениях

 

Решения

Анализировать ФинансыУвеличивайте ПродажиОптимальный Склад и ЛогистикаМаркетинговые Метрики

Клиенты
  • В «Пивоваренной компании «Балтика» аналитическая платформа Loginom применяется для моделирования процессов или построения отчетов, в том числе для формирования рекомендаций по корректировке плана промоактивностей.
     
  •  ООО «ММК-Информсервис» создает высокотехнологичные решения для эффективной работы предприятий. Разрабатывают и внедряют телекоммуникационные и бизнес-приложения, автоматизируют производство, выстраивают и поддерживают корпоративную IT-инфраструктуру.

  • ПАО АНК «Башнефть» — российская вертикально-интегрированная нефтяная компания, с 2016 года входит в ПАО НК «Роснефть». Главный офис расположен в городе Уфе (Башкортостан). Добыча углеводородов – более 21 млн тонн нефти в год. Объем переработки – более 18 млн тонн нефти в год. Число сотрудников – более 33 тыс. человек.

  • ГК «Акрон Холдинг», одно из крупнейших в России промышленно-металлургических предприятий, запустил проект по модернизации управления данными. В качестве целевого решения для анализа ключевых данных компания выбрала систему PIX BI. В компании уже более 100 пользователей PIX BI, и в этом году в планах увеличить их число в два раза.

  • Решения
    • Дистрибуция
    • Розничная торговля
    • Производство
    • Операторы связи
    • Страхование
    • Банки
    • Лизинг
    • Логистика
    • Нефтегазовый сектор
    • Медицина
    • Сеть ресторанов
    • E-Commerce
    • Энергетика
    • Фармацевтика
  • Услуги
    • Переход на отечественные BI и DWH
    • Консалтинг
    • Пилотный проект
    • Обучение и сертификация
    • Бесплатное обучение
    • Техническая поддержка
    • Технические задания
    • Сбор требований для проекта внедрения BI-системы
    • CI/CD для DWH
    • Аудит BI приложений
    • Выделенная команда
    • Настойка и поддержка баз данных
    • Разработка BI Стратегии
    • Styleguide для BI-системы
    • Как выбрать BI-систему
  • Платформы
    • FineBI
    • FineReport
    • FineDataLink
    • Коннекторы данных из 1С в BI
    • Airflow + NiFi
    • Visiology
    • Luxms BI
    • Modus BI
    • PIX BI
    • Arenadata
    • ClickHouse
    • Greenplum
    • Postgres Professional
    • Open-source BI: Superset/Metabase
    • Loginom
    • Yandex.DataLens
    • AI / Исскуственный интеллект
    • Optimacros
    • Шины данных
  • Курсы
    • Учебный курс Информационная грамотность
    • Учебный курс для бизнес-аналитиков
    • Учебный курс для системных аналитиков
    • Учебный курс по Data Governance
    • Учебный курс Как стать CDO
    • Учебный курс Современная архитектура хранилища данных
    • Учебный курс по Fine BI
    • Учебный курс по FineReport
    • Учебный курс по DWH
    • Учебный курс по Data Science (ML, AI)
    • Учебный курс по PostgreSQL
    • Учебный курс по Apache Airflow и NiFi
    • Учебный курс по Open-source BI
    • Учебный курс по ClickHouse
    • Учебный курс по DataLens
    • Учебный курс по Loginom
    • Учебный курс по Modus BI и ETL
    • Учебный курс по Visiology
    • Учебный курс по dbt
  • Функциональные решения
    • Создание Data Lake
    • Цифровая трансформация
    • Управление по KPI
    • Финансы
    • Продажи
    • Склад
    • HR
    • Маркетинг
    • Внутренний аудит
    • Категорийный менеджмент
    • S&OP и прогнозная аналитика
    • Геоаналитика
    • Цепочки поставок (SCM)
    • AutoML
    • Process Mining
    • Сквозная аналитика
  • Компания
    • О нас
    • Руководство
    • Новости
    • Клиенты
    • Скачать
    • Контакты
    • Политика конфиденциальности
RutubeVkontakteLinkedInYouTube
ООО "Би Ай Консалт",
ИНН: 7811437757,
ОГРН: 1097847154184
199178, Россия,
Санкт-Петербург,
6-ая линия В.О., Д. 63, 4 этаж
Тел: +7 (812) 334-08-01
Тел: +7 (499) 608-13-06
E-mail: info@biconsult.ru

 

 

 

 

 

×

Пользуясь сайтом, вы соглашаетесь с использованием cookies и политикой конфиденциальности.