Log loss function
분류(Classification) 문제에서 모델의 성능을 평가하는 데 사용되는 손실 함수이다.
Log loss는 모델이 예측한 확률 값을 직접적으로 반영하여 평가한다.
최종적으로 맞춘 결과만 가지고 성능을 평가할 경우, 얼만큼의 확률로 해당 답을 얻은 건지 평가가 불가능하다. 답은 맞췄지만 20%의 확률로 그저 찍은 거라면 성능이 좋은 모델이라고 할 수 없을 것이다.
이를 보완하기 위해서는 확률 값을 평가 지표로 사용하면 된다.
확률 값을 음의 log함수에 넣어 변환을 시킨 값으로 평가하는데, 이는 잘못 예측할 수록, 페널티를 부여하기 위함이다.
예로, 100%의 확률(확신)로 답을 구한 경우 log loss는 -log(1.0) = 0이다. 80% 확률의 경우에는, -log(0.8) = 0.22314이다. 60% 확률의 경우에는, -log(0.6) = 0.51082이다.
확률이 낮아질 수록 log loss 값이 기하급수적으로 증가하는 것을 볼 수 있다. 이런 식으로 log loss는 확률이 낮을 때 페널티를 더 많이 부여하기 위해 음의 로그 함수를 사용한다.
Log loss 공식
실제 답안에 해당하는 확률 값을 음의 로그를 취해 모두 더하고 1/n해서 평균을 내면 된다.

강사님의 베이스 라인 코드를 처음부터 끝까지 필사하며 코드의 의미를 이해하려 노력해 봤다.
이해가 되는 부분은 이해를 하며, 이해가 되지 않으면 이해되지 않는 대로 넘어갔다.
그렇게 필사만 해도 처음보다 많이 갈피가 잡혔고, 코드를 제출하니 0.26점이 나왔다.
오늘 자 리더보드에선 0.11점부터 동메달권에 진입이 가능하다.
앞으로 남은 13일 동안 나의 목표는 "0.20"미만으로 내려보겠다.