1.3. Ридж Регрессия ядра#
Ридж Регрессия ядра (Kernel ridge regression - KRR) [M2012] сочетает в себе Ридж регрессия и классификация (линейный метод наименьших квадратов с регуляризацией по норме l2) с трюком ядра. Таким образом, он изучает линейную функцию в пространстве, индуцированную соответствующим ядром и данными. Для нелинейных ядер это соответствует нелинейной функции в исходном пространстве.
Форма модели, изученной KernelRidge, идентична модели Метода Опорных Векторов регрессии (SVR). Однако используются разные функции потерь: KRR использует потери в квадрате ошибок, а регрессия опорного вектора использует потери, нечувствительные к \(\epsilon\), и то и другое в сочетании с регуляризацией l2. В отличие от SVR, обучение KernelRidge может быть выполнена в закрытой форме и обычно выполняется быстрее для наборов данных среднего размера. С другой стороны, изученная модель не является разреженной и, следовательно, медленнее, чем SVR, который изучает разреженную модель для \(\epsilon > 0\) во время прогнозирования.
На следующем рисунке сравниваются KernelRidge и SVR на искусственном наборе данных, который состоит из синусоидальной целевой функции и сильного шума, добавленного к каждой пятой точке данных.
Построена изученная модель KernelRidge и SVR, в которой сложность/регуляризация и пропускная способность ядра RBF были оптимизированы с использованием поиска по сетке.
Изученные функции очень похожи; однако обучение KernelRidge происходит примерно в семь раз быстрее, чем обучение SVR (оба с поиском по сетке).
Однако прогнозирование 100 000 целевых значений выполняется более чем в три раза быстрее с помощью SVR, поскольку он обучил разреженную модель, используя только примерно 1/3 из 100 обучающих точек данных в качестве опорных векторов.
На следующем рисунке сравнивается время подбора и прогнозирования KernelRidge и SVR для разных размеров обучающего набора.
Обучение KernelRidge выполняется быстрее, чем SVR для обучающих наборов среднего размера (менее 1000 выборок); однако для больших обучающих наборов SVR лучше масштабируется.
Что касается времени прогнозирования, SVR быстрее, чем KernelRidge для всех размеров обучающего набора из-за изученного разреженного решения.
Обратите внимание, что степень разреженности и, следовательно, время прогнозирования зависят от параметров \(\epsilon\) и \(C\) SVR; \(\epsilon = 0\) будет соответствовать плотной модели.
Примеры