01September 24, 2026
소형 모델 성능을 더 올릴 수는 없을까: 85%에서 더 오르지 않은 이유
지난 글에서 1.5B의 평가점수를 85%까지 올렸다. 더 올려보려 했는데 인용을 올리면 오탐이 늘고, 오탐을 잡으면 인용이 떨어지는 일이 다섯 번 반복됐다. 그래서 이게 모델의 성능한계인지, 평가하는 방 식의 문제인지, 또는 봇에게 주는 입력의 문제인지를 확인해봤다. 모델의 성능한계인가 삽질 시도 좋아진 것 나빠진 것 1차 학습 (79:21) 인용 3/15…
ZZOLLLMZZOLBotevaluation