어제 문제가 있었던 예측값은 좋아졌으나, LB score가 떨어진 건에 대해서 강사님께 여쭤보니, 두 가지 문제가 예상이 된다고 하셨다. 첫 번째는 train data에만 전처리를 해주고 test data에 해주지 않으면 그런 일이 있다고 하셨다.
이 얘기를 들었을 때, 아차! 싶었다. test data에는 전처리를 빼먹은 것 같았다. 하지만 확인해 보니 test data에는 integer로 변환해 줄 data가 없어 이 문제는 아니었다.
두 번째는 float->integer 처리가 train data에 overfitting 된 것이라고 말씀해 주셨는데, 이 경우가 더 맞는 것 같다.
다른 Discussion을 둘러보다 TapPFN과 XGBoost를 절반씩 사용한 코드가 보여 일단 제출을 해봤더니
LB score 0.17을 기록했다. 내일은 이 코드를 자세히 살펴봐야 겠다.
캐글이 처음인 나는 Code와 Discussion에 상당히 좋은 내용이 공유되어 있는 모습이 되게 낯설다.
경쟁인데 경쟁자와 함께 토론하고 자기의 Code를 나눠주는 모습이 "이것이 오픈 소스 문화다."라는 것을 정말 잘 보여주는 것 같다. 내가 처음부터 코드를 짰다면 0.17은커녕 0.5 밑으로도 낮추지 못했을 것이다.
이 점수가 내가 잘해서 기록한 점수가 전혀 아님을 다시 한번 상기하고 공유된 좋은 정보를 내 지식으로 만드는데 집중할 것이다.