YaChudo

Регуляризація (математика)

Переглядів: 0. Оновлено 10.10.2026.

Обидві функції точно описують експериментальні точки з нульовою похибкою. Навчена модель може бути схильна вибирати зелену функцію, що може бути ближчою до справжньої невідомої функції розподілу, за допомогою  λ {\displaystyle \lambda } , ваги регуляризуючого виразу.

Регуляризація, в математиці і статистиці, а також в задачах машинного навчання і обернених задачах, означає додавання деякої додаткової інформації, щоб знайти розв'язок некоректно поставленої задачі, або щоб уникнути перенавчання.

Використання регуляризації для класифікації

Регуляризацію використовують у задачах класифікації. Емпіричне навчання класифікаторів на скінченному набору даних завжди є недостатньо визначеною задачею, бо в загальному випадку ми намагаємось вивести функцію від довільного x {\displaystyle x} по декільком заданим прикладам x 1 , x 2 , . . . x n {\displaystyle x_{1},x_{2},...x_{n}} .

Загалом регуляризуючий вираз R ( f ) {\displaystyle R(f)} додається до функції втрат:

min f ∑ i = 1 n V ( f ( x ^ i ) , y ^ i ) + λ R ( f ) , {\displaystyle \min _{f}\sum _{i=1}^{n}V(f({\hat {x}}_{i}),{\hat {y}}_{i})+\lambda R(f),}

де V {\displaystyle V}  — функція, що визначає похибку передбачення f ( x ) {\displaystyle f(x)} для значень y {\displaystyle y} , (наприклад, квадрати похибок), а параметр λ {\displaystyle \lambda } визначає важливість доданка для регуляризації. Зазвичай R ( f ) {\displaystyle R(f)} визначається як штраф за складність функції f {\displaystyle f} . Зокрема, поняття складності включає обмеження на гладкість та на норму векторного простору.[1]

Фактично, процедура регуляризації є спробою застосувати лезо Оккама до розв'язку (див. малюнок вище). З погляду баєсового висновування, багато технік регуляризації є накладанням обмежень на апріорний вигляд розподілу параметрів моделі.

Узагальнення

Регуляризація може використовуватись як спосіб покращення узагальнення для моделі у машинному навчанні.

Основна задача машинного навчання полягає в тому, щоб знайти функцію, сумарна похибка передбачень якої для всіх можливих значень була б мінімальною. Очікувана похибка f n {\displaystyle f_{n}} виражається як:

I [ f n ] = ∫ X × Y V ( f n ( x ) , y ) ρ ( x , y ) d x d y {\displaystyle I[f_{n}]=\int _{X\times Y}V(f_{n}(x),y)\rho (x,y)\,dx\,dy}

Зазвичай в таких задачах лише частина усіх можливих даних, частково зашумлених, є доступною для навчання. Таким чином, очікувана похибка є необчислюваною величиною, і найкраще наближення — це емпірична похибка, що вираховується на базі N {\displaystyle N} доступних зразків:

I S [ f n ] = 1 n ∑ i = 1 N V ( f n ( x ^ i ) , y ^ i ) {\displaystyle I_{S}[f_{n}]={\frac {1}{n}}\sum _{i=1}^{N}V(f_{n}({\hat {x}}_{i}),{\hat {y}}_{i})}

Без обмежень складності функціонального простору, в якому проводиться пошук, модель може бути навчена так, щоб відповідна їй функція проходила через кожну точку наявних даних x i {\displaystyle x_{i}} . Але якщо значення x i {\displaystyle x_{i}} містять шум, то модель може "страждати" від перенавчання і видавати погані значення очікуваних помилок. Регуляризація вводить штраф за включення зайвих областей функціонального простору, що використовується для побудови моделі і це може покращити узагальнення.

Регуляризація Тихонова

При навчанні лінійною функцією, такою як f ( x ) = w ⋅ x {\displaystyle f(x)=w\cdot x} , в якій w {\displaystyle w} шуканий вектор, L 2 {\displaystyle L_{2}} -норма функції втрат відповідає регуляризації Тихонова. Ця, одна з найбільш використовуваних форм регуляризації, виражається як:

min w ∑ i = 1 n V ( x ^ i ⋅ w , y ^ i ) + λ ‖ w ‖ 2 2 {\displaystyle \min _{w}\sum _{i=1}^{n}V({\hat {x}}_{i}\cdot w,{\hat {y}}_{i})+\lambda \|w\|_{2}^{2}}

У випадку загальної функції, ми беремо норму функції у її гільбертовому просторі з відтворювальним ядром:

min f ∑ i = 1 n V ( f ( x ^ i ) , y ^ i ) + λ ‖ f ‖ H 2 {\displaystyle \min _{f}\sum _{i=1}^{n}V(f({\hat {x}}_{i}),{\hat {y}}_{i})+\lambda \|f\|_{\mathcal {H}}^{2}}

Оскільки норма L 2 {\displaystyle L_{2}} диференційовна, то проблема навчання з використанням регуляризації Тихонова, може бути розв'язана градієнтним спуском.

Регуляризація Тихонова для методу найменших квадратів

Навчання з функцією втрат, вираженою методом найменших квадратів і регуляризація Тихонова можна розв'язати аналітично.

min w 1 n ( X ^ w − Y ^ ) 2 + λ ‖ w ‖ 2 2 {\displaystyle \min _{w}{\frac {1}{n}}({\hat {X}}w-{\hat {Y}})^{2}+\lambda \|w\|_{2}^{2}}
∇ w = 2 n X ^ T ( X ^ w − Y ^ ) + 2 λ w {\displaystyle \nabla _{w}={\frac {2}{n}}{\hat {X}}^{T}({\hat {X}}w-{\hat {Y}})+2\lambda w} ← {\displaystyle \leftarrow } необхідна умова екстремуму
0 = X ^ T ( X ^ w − Y ^ ) + n λ w {\displaystyle 0={\hat {X}}^{T}({\hat {X}}w-{\hat {Y}})+n\lambda w}
w = ( X ^ T X ^ + λ n I ) − 1 ( X ^ T Y ^ ) {\displaystyle w=({\hat {X}}^{T}{\hat {X}}+\lambda nI)^{-1}({\hat {X}}^{T}{\hat {Y}})}

Відповідно до оптимізаційної задачи, інші значення w {\displaystyle w} будуть давати більші значення для функції втрат. Це можна перевірити за допомогою другої похідної ∇ w w {\displaystyle \nabla _{ww}} .

Цей алгоритм потребує O ( d 3 + n d 2 ) {\displaystyle O(d^{3}+nd^{2})} часу для тренування. Доданками тут є час на пошук зворотньої матриці і на обчислення X T X {\displaystyle X^{T}X} , відповідно. Перевірка займає час O ( n d ) {\displaystyle O(nd)} .

Рання зупинка

Рання зупинка може бути розглянута як регуляризація в часі. Загалом, такі методики як градієнтний спуск, мають тенденцію до створення все більш і більш складних функцій з часом. За допомогою регуляризації в часі складність моделі може контролюватися.

На практиці, для впровадження цієї методики, використовується додатковий валідаційний масив даних, статистично незалежний від того, що використовується для тренування. Модель тренується до тих пір, доки результативність на валідаційному масиві не перестає зростати. Після цього модель тестується на тестовому масиві.

Див. також

Примітки

  1. ↑ Bishop, Christopher M. (2007). Pattern recognition and machine learning (вид. Corr. printing.). New York: Springer. ISBN 978-0387310732.

Посилання



Джерело: стаття у Вікіпедії та історія редагувань (автори).