Isotonic Regression (등회귀)
- 확률 보정의 한 기법이고, 분류(classification) 문제에서는 모델의 예측값을 보정(calibration)할 때도 사용된다.
- 등회귀를 쓰기 위해서는 타겟 함수가 단조 증가함수(monotonous function)이어야 한다. 단조함수는 x1 < x2 일 때, f(x1) <= f(x2)인 함수를 말한다.

- 등회귀는 이런 어긋나는 지점을 해결하는데 이 글에서는 가장 간단한 알고리즘인 PAVA(Pool Adjacent Violators Algorithm)를 설명한다. 먼저 첫 단계에서는 규칙에 어긋나는 데이터를 찾는다. 예를 들어 f(xi)가 f(xi+1) 보다 큰 지점을 찾는 것이다.
- 두 번째 단계에서는 f'(xi) 값을 f'(xi+1) 값에 대입하여 SSE(Sum of Squared Errors, 오차제곱합)을 최소화한다. 그림으로 이해하자면 f(x3) 값을 f(x2) 위치로 끌어올리는 과정을 말한다.
- 이런 식으로 x값이 커짐에 따라 단조 증가함수의 규칙에 어긋나는 데이터 지점을 모두 끌어올리고 각 지점을 부분 선형 함수(piecewise linear function)로 연결하면 끝이다.
Code와 Discussion에 있는 것들만 참고하여 제출을 하니 엄청나게 상위권에 진입하게 되었다.
그리고 많은 Discussion의 의견들이 대회가 끝나면 엄청난 Big Shake up이 있을 것이라고 예상한다.
그도 그럴 것이 나 같은 초보자가 공개된 코드만으로 상위권에 진입을 하게 되었는데, 이상적인 대회는 아닌 느낌을 받는다.
이렇게 혼란스러운 상황에서 성적에 연연하지 않고, 내 공부하는 것을 목표로 천천히 나아가야겠다.
'TIL' 카테고리의 다른 글
| 23.06.28~29 - 잘못된 방향 (0) | 2023.06.29 |
|---|---|
| 23.06.27 - feature extracion (0) | 2023.06.27 |
| 23.06.23 (0) | 2023.06.24 |
| 23.06.22 - numpy.clip, numpy.bincount (0) | 2023.06.22 |
| 23.06.21 (0) | 2023.06.21 |