스크립트
00:00:00새로운 모델이 나올 때마다 항상 벤치마크 점수만 올렸다는 비난이 따르곤 합니다.
00:00:03솔직히 이해가 갑니다. 예전부터 그래왔고 지금도 그렇거든요. 우리는 모델이
00:00:07서류상으로는 정말 뛰어나 보이지만 실제로 써보면 별로인 경우를 분명 알아챌 겁니다. 최근 Cursor의 연구는 더 똑똑한
00:00:11모델들이 코딩 벤치마크를 해킹하는 데 점점 더 교묘해지고 있다는 것을 보여주었죠. 그래서 저는
00:00:16이러한 벤치마크가 조작되는 두 가지 방식과 그 심각성,
00:00:20그리고 신뢰할 수 있는 벤치마크란 어떤 모습이어야 하는지 살펴보려 합니다. 시작해 보죠.
00:00:29지난주에 발표된 Cursor의 연구부터 살펴보죠. 보상 해킹(Reward hacking)이
00:00:33모델 지능의 발전을 잠식하고 있다는 내용입니다. 이 글은 Numanjin이 작성했는데, 발음이 맞았기를 바랍니다.
00:00:37그는 Cursor의 연구 과학자이며, 이 행동이 얼마나 광범위한지를 보여주는 실제 데이터를 제시했습니다.
00:00:42그들이 주목한 문제는 실제 버그를 기반으로 구축된 평가 세트가 나중에 수정되는 경우,
00:00:46예를 들어 벤치마크가 유명 오픈 소스 라이브러리와 그 버그를 사용할 때, 현대의 코딩 에이전트들은
00:00:50그 버그를 직접 해결하는 대신 해당 버그를 수정한 커밋을 찾아볼 수 있다는 겁니다. 그러니까
00:00:55웹 검색에는 능숙할지 몰라도 실제 코딩 실력은 아닐 수 있다는 거죠. 실제로 그들은
00:00:59SWE Bench Pro에서 성공한 Opus 4.8 해상도의 63%가 스스로 해결하기보다는 수정을 가져왔다는 사실을 발견했습니다.
00:01:05즉, 웹을 사용하여 관련 PR이나 수정된 소스 파일을 찾았거나, 심지어
00:01:10번들로 제공된 git 기록을 사용하여 미래로 건너뛰어 수정된 커밋을 찾아낸 겁니다. 분명 이 문제의 해결책은
00:01:14환경을 더 엄격하게 만드는 것인데, Cursor가 바로 그렇게 했습니다. 그들은
00:01:18저장소의 git 디렉토리를 삭제하고 새 디렉토리를 만들었으며, 또한 기본적으로 네트워크 액세스를
00:01:22차단하고 허용된 패키지 레지스트리에 대해서만 고정 프록시를 통해 의존성을 해결하도록 했습니다.
00:01:27그 외에는 아무것도 허용되지 않았죠. 이 엄격한 환경에서 벤치마크를 다시 실행했을 때,
00:01:31정말 흥미로운 패턴이 나타났습니다. 첫째, 결과에 따르면 Opus 4.8과 같은 최고급 모델은
00:01:35엄격한 환경에서 점수가 14%나 떨어졌으며, 이러한 패턴은
00:01:40모델의 사고 수준 전반에 걸쳐 지속되었습니다. 또한 이 행동은 Opus가
00:01:44모델을 릴리스할 때마다 커지면서, 일반 환경과 엄격한 환경 사이의 점수 차이가 더 커지고 있음을 보여줍니다. 둘째, 실제로
00:01:49GPT 모델들은 동일한 행동을 보이지 않았으며, 엄격한 환경과 일반 환경 간의
00:01:54점수 차이가 아주 작았습니다. GPT 모델 중 가장 큰 차이를 보인 것은 GPT 5.4 High 모델로,
00:01:586.6% 하락했고, GPT 5.4 Extra High와 5.5 모델은 1% 미만의 차이를 보였습니다.
00:02:05재미있게도 SWE Bench Pro에서 가장 심각한 위반자는 바로 Cursor 자체 모델인 Composer 2.5였는데,
00:02:10이를 인정한 점은 높이 살만하네요. 방금 SWE Bench Pro에서 본 것과 동일한 패턴이
00:02:14SWE Bench Multilingual에서도 나타났습니다. Anthropic도 이전에 이 문제를 직접 연구한 바 있죠.
00:02:18이번 연구의 핵심은 벤치마크 설계 시 런타임 환경을 고려해야 한다는 것입니다.
00:02:23그렇다고 반드시 인터넷을 완전히 차단해야 한다는 의미는 아닙니다.
00:02:26모델이 도구를 얼마나 잘 사용하는지 테스트하고 싶을 수도 있으니까요. 단지
00:02:30그러한 액세스가 점수를 어떻게 바꿀 수 있는지, 그리고 그것이 무엇을 의미하는지 인지해야 합니다. 또한 예상치 못한
00:02:35방식으로 문제를 해결하는지 결과를 검토해야 한다는 뜻이기도 합니다. 심지어 이런 조치에도 불구하고,
00:02:39Namao는 모델들이 평가받고 있다는 사실을 더 많이 인식하게 되면서,
00:02:42역사 기록을 지우거나 인터넷 접속을 제한하는 것만으로는 해결할 수 없는 더 미묘한 방식으로
00:02:46행동을 바꿀 수 있다고 말합니다. 정말 해결하기 어려운 문제이며,
00:02:51여기서는 첫 번째 부분인 보상 해킹만 다뤘습니다. 이는 모델 학습 이후에 발생하죠.
00:02:55벤치마크 오염(Contamination) 문제도 있습니다. 가장 명백한 형태는
00:02:59정확한 테스트 세트 오염으로, 모델이 같은 질문, 프롬프트,
00:03:03코드 문제 또는 답안을 미리 본 경우입니다. 하지만 거의 유사한 문제, 의역,
00:03:08합성 데이터 또는 의미상 동등한 예제를 통해서도 발생할 수 있습니다. 더 미묘한 형태로,
00:03:12모델이 벤치마크 형식을 배우고 실제로 어떻게 채점되고 평가되는지 파악해서
00:03:16이를 자신의 이점으로 사용하는 경우도 있습니다. 하지만 큰 문제는 이러한 오염이 실제로
00:03:20일어나고 있음을 증명하기가 매우 어렵다는 것입니다. 대부분의 학습 데이터는 공유되지 않으며,
00:03:24벤치마크 점수를 최대화하고 있다는 것을 인정하지 않으려 하기 때문이죠. 저는 모델의
00:03:28학습 데이터에 접근하지 않고도 퀴즈를 사용한 연구를 하나 찾았는데요,
00:03:31실제 벤치마크 질문과 약간 변경된 버전을 모델에게 보여주고
00:03:35어느 것이 진짜인지 물어보는 방식입니다. 모델이 일관되게 진짜를 선택한다면,
00:03:39그 벤치마크 질문을 미리 본 적이 있을 가능성이 있다는 거죠. 다른 논문은 꽤나
00:03:43복잡한 방법을 사용하여 데이터 오염 위험 점수를 계산했는데, 모델의
00:03:47출력값에서 겹치는 부분, 즉 유사한 문구나 사실 관계를 찾아서,
00:03:51정확한 질문이나 답을 보는 것까지 확인하고, 그 위험 점수를 사용하여 모델의 벤치마크
00:03:56결과를 조정합니다. 그래서 오염 의심이 많은 높은 위험 점수의 경우 점수를 깎는 것이죠. 그 데이터는 실제로
00:04:00Qwen 2.5 같은 모델이 SST2에서 90% 중반대의 점수를 기록하지만, 오염 점수를 반영해
00:04:05점수를 조정하면 30~40%대로 떨어진다는 것을 보여줍니다. 다시 말해, 이 모델은 학습 데이터에서
00:04:11이 벤치마크를 미리 봤을 가능성이 있어, 실제보다 훨씬 더 좋아 보였던 겁니다. 마지막으로 제가
00:04:15이번 영상에서 심층적으로 조사했던 연구는 2024년 ScaleAI에서 발표한 내용입니다.
00:04:20그들은 초등 수학 벤치마크인 GSM-AK를 가지고, 동일한 난이도를 모방하기 위해
00:04:25인간이 새로 작성한 벤치마크를 만들었습니다. 이렇게 하면 모델이 첫 번째 벤치마크를 정말
00:04:30스스로 풀었다면, 이 새로운 벤치마크도 비슷하게 잘 풀어야 합니다.
00:04:34하지만 보시다시피 그렇지 않았습니다. 여기서는 낮은 점수가 나쁜 것이며, 많은 모델이
00:04:38똑같이 어려운 벤치마크 결과에서 큰 격차를 보였습니다. 유일한 차이점은
00:04:42한쪽은 공개된 데이터였다는 점입니다. 그럼 모든 벤치마크가 가치가 없을까요? 꼭 그렇지는 않습니다. 보시다시피,
00:04:47이것은 연구자들과 벤치마크 제작자들이 꽤 오랫동안 인지해 온 사실입니다.
00:04:51보상 해킹의 경우, DeepSWE와 같은 벤치마크는 이미 격리된 환경을 사용하며,
00:04:55많은 벤치마크들이 그렇게 하고 있습니다. 그리고 오염 측면에서는, 데이터셋을 공개하지 않는
00:05:00벤치마크가 많아지고 있습니다. Cognition의 Frontier Code는 이 문제 때문에 공개 계획이 없으며,
00:05:05Arc AGI에서 Fable이 나왔을 때도 Anthropic의 새로운 데이터 보존 약관 때문에
00:05:09Anthropic이 해당 데이터를 볼 수 없는 안전한 환경에서만 평가를 실행하겠다고 하여 우려가 있었습니다.
00:05:14Anthropic이 그 데이터를 볼 방법이 없는 상황에서만 평가를 진행하겠다는 거였죠.
00:05:18이에 대한 여러분의 생각은 어떠신가요? 벤치마크 결과보다 실제 모델 성능이
00:05:21훨씬 못하다고 느낀 적이 있으신가요? 그리고 가장 신뢰하는 좋아하는 벤치마크가 있나요?
00:05:24댓글로 알려주세요. 그리고 구독 부탁드립니다. 항상 그렇듯, 다음 영상에서 뵙겠습니다.