2026년 09월 27일 Stories worth reading. Perspectives worth sharing.
LLM이 NetHack을 클리어했다 — 40년 된 최악의 게임이 AI 능력의 척도였던 이유
AI 기술 해설

LLM이 NetHack을 클리어했다 — 40년 된 최악의 게임이 AI 능력의 척도였던 이유

Caston 9월 24, 2026 1 min read

넷핵을 클리어한 AI가 나왔다는 소식을 처음 접했을 때 직감적으로 든 생각은 ‘늦었다’였다. 이 게임이 1987년에 나왔으니 거의 40년이 걸린 셈이다. 체스는 1997년에 AI가 인간 챔피언을 꺾었고, 바둑은 2016년에 딥마인드 알파고가 이세돌을 이겼다. 그런데 막상 배경을 살펴보면 오히려 이제 나왔다는 게 신기할 정도다. 2026년 9월 21일, GPT 6 Astra가 넷핵을 처음으로 클리어한 LLM 에이전트로 기록됐다.

넷핵이 어려운 이유

넷핵은 로그라이크(roguelike) 게임이다. 로그라이크는 던전이 매판 무작위로 생성되고, 캐릭터가 죽으면 처음부터 다시 시작해야 하는 방식의 게임 장르다. 공략을 외울 수도, 반복 훈련으로 특정 구간을 익힐 수도 없다. 이전 판에서 익힌 지식과 전략은 새 판의 구체적인 상황에 그대로 적용되지 않는다. 넷핵은 이 장르 안에서도 특히 복잡하다고 알려져 있다.

아이템만 해도 수백 가지다. 물약, 두루마리, 완드, 반지 같은 아이템들은 이름이 고정돼 있지 않다. 같은 ‘빨간 물약’이라도 어떤 판에서는 체력을 회복하고, 다른 판에서는 독이 된다. 이 배정이 매판 무작위로 바뀐다. 게임 안에서 직접 마셔보거나, 아이템 감정 두루마리를 찾거나, 상점 가격을 통해 역추론하는 등 단서를 모아야만 아이템의 정체를 알 수 있다.

클리어 조건도 단순하지 않다. 50층 이상의 던전을 내려가 아뮬렛 오브 옌도르를 찾고, 불·공기·땅·물 속성계 4개를 통과해 다시 지상으로 올라와야 한다. 속성계 각각은 별도의 지형 규칙과 적 구성을 갖고 있어 구간마다 다른 전략이 필요하다. Hardfought 서버 통계를 보면 인간 플레이어의 클리어율도 1%가 채 안 된다. GPT 6 Astra가 클리어까지 쓴 턴이 37,140번이었다는 기록이 남아 있다.

게임을 설계한 개발자들 자신도 게임 안에 무엇이 있는지 다 알지 못한다는 말이 있을 정도다. 상호작용 가능한 요소의 조합이 너무 많아서다. 날카로운 물체를 들고 미끄러운 바닥을 걸으면 넘어지며 부상을 입고, 촛불을 든 채 특정 지형을 지나면 화재가 일어날 수 있다. 이런 숨겨진 규칙들이 수백 개의 기저 시스템 위에 겹겹이 쌓여 있다. 어떤 행동이 언제 좋은 결과를 낳는지 일반적인 규칙을 추출하기 어렵다는 것이 AI에게 특히 까다로운 이유다.

강화학습이 막혔던 지점

강화학습은 AI가 행동을 반복하고 보상을 받으며 전략을 학습하는 방식이다. 넷핵에서 이 방식은 구조적인 벽에 부딪혔다. 게임을 클리어하거나 특정 층에 도달하는 이정표는 수천 번의 행동 끝에야 도달할 수 있고, 그 사이에 에이전트가 받는 보상 신호는 거의 없다. 보상 신호가 너무 드물게 주어진다는 게 핵심이었다.

게임 초반에 죽기를 반복하는 에이전트는 후반 구간에서 어떤 결정을 해야 하는지 경험할 기회가 없다. 경험이 없으면 학습도 없다. 2020년에 Meta(당시 Facebook Research)가 넷핵 학습 환경(NLE)을 공개했는데, 이 플랫폼에서도 희박한 보상 문제는 그대로였다. 수십억 번의 시뮬레이션을 돌려도 강화학습 에이전트는 손으로 짜인 심볼릭 봇보다 낮은 성능을 냈다. 학습 기반 AI가 규칙 기반 코드에 밀리는 상황은 이 분야에서 이례적인 결과였다.

2021년 NeurIPS 넷핵 챌린지에서도 결과는 비슷했다. 다양한 연구팀이 서로 다른 방법으로 에이전트를 만들어 경쟁했지만, 어떤 팀도 게임 클리어에 근접하지 못했다. 내재적 보상을 추가하거나, 사람이 짠 서브루틴을 계층적으로 연결하거나, 탐색 전략을 정교화하는 시도들도 있었지만 한계가 명확했다. 보상 설계만으로는 커버할 수 없는 복잡성이 있었다.

2024년에 발표된 BALROG 벤치마크에서도 이 어려움은 확인됐다. BALROG는 다양한 게임 환경에서 LLM 에이전트의 추론 능력을 비교하는 프레임워크다. 당시 테스트에서 GPT-4o, Claude 3.5 Sonnet 같은 최고 수준의 모델들도 던전 10층에 도달하는 데 그쳤다. 게임 전체 진척도 기준으로 12% 남짓이었다. 넷핵은 당시 기준으로 LLM 에이전트가 가장 고전하는 환경으로 분류됐다.

이번에 달라진 것

이번 클리어는 강화학습이 아니었다. GPT 6 Astra는 넷핵의 텍스트 화면을 직접 읽고, 상황을 파악한 뒤 명령을 입력하는 방식으로 작동했다. 넷핵은 그래픽 없이 ASCII 문자로만 이루어진 터미널 게임으로, ‘@’는 플레이어 캐릭터를, ‘d’는 개를, ‘%’는 음식을 나타낸다. 이미지나 픽셀 처리 없이 게임 상태를 텍스트로 직접 파악할 수 있어 LLM에게 유리한 조건이 됐다. 텍스트를 읽고 추론하는 LLM의 본래 강점이 그대로 적용되는 구조였다.

kenforthewin이 만든 하네스가 이 과정을 가능하게 했다. 하네스(harness)는 AI 에이전트가 게임과 상호작용하는 데 필요한 도구 묶음을 말한다. 이 하네스에는 터미널 세션 유지, 이동 명령 처리, 내비게이션 보조, 퍼즐 대응 스크립트 등이 포함됐다. GPT 6 Astra는 이 하네스를 통해 Hardfought 서버에서 CodexDelver라는 계정으로 게임을 진행했다. 하네스가 터미널 출력을 구조화된 형태로 전달하면 에이전트가 판단을 내리고 명령을 돌려보내는 루프로 작동했다.

세 번 시도했고 두 번은 실패했다. 세 번째에 드워프 발키리 캐릭터로 37,140턴 만에 클리어했고, 최종 점수는 1,766,446점이었다. v1.0.0 릴리스에는 성공 기록과 함께 두 번의 실패 기록도 포함됐다. 필터링된 이벤트 로그, 게임 입력과 관찰 내용, 서버 덤프 등 약 124MB 분량의 데이터가 공개됐다. 결과를 검증 가능하게 열어놓은 방식이었다.

알고 나니 생각이 달라진 게 있다. LLM이 복잡한 게임에서 약하다는 말을 자주 들어왔는데, 실제로는 인터페이스 문제가 컸다는 것이다. 시각 정보나 픽셀 기반 환경에서는 LLM이 불리하지만, 텍스트로 이루어진 환경에서는 다르다. Zork나 인포콤 텍스트 어드벤처처럼 명령어 기반으로 작동하는 게임들이 LLM 에이전트에게 적합한 이유도 같은 맥락이다. 넷핵이 우연히 LLM에게 적합한 구조를 가지고 있었던 셈이다.

게임 밖에서의 의미

넷핵이 AI 연구의 벤치마크로 오래 쓰여온 데는 이유가 있다. 단순한 반응 속도나 계산 능력이 아니라, 장기 계획과 불확실성 대응 능력을 테스트할 수 있어서다. 수십 개의 하위 목표를 순서대로 달성해야 하고, 예상치 못한 상황이 생기면 계획을 바꿔야 한다. 특정 아이템 없이는 진행이 막히는 구간도 있어 자원 관리와 우선순위 판단도 요구된다. 그 전 과정을 처음 보는 던전 위에서 해야 한다.

이 능력은 게임 밖에서도 의미가 있다. 현실의 많은 문제도 정보가 부분적으로만 주어지고, 목표까지의 경로가 단번에 보이지 않는다. 소프트웨어 디버깅에서 원인을 좁혀가는 과정이나, 낯선 코드베이스에서 변경 범위를 파악하는 일, 복잡한 절차를 단계별로 밟아가는 것이 모두 비슷한 구조다. 그런 환경에서 얼마나 멀리 나아갈 수 있는지를 보는 데 넷핵이 적합했던 것이다. 이번 클리어가 단순한 게임 기록이 아니라 에이전트 능력 전반에 대한 척도로 읽히는 이유다.

이번 결과의 한계도 짚어둘 필요가 있다. 완전한 자율 실행이 아니었다. 하네스 자체가 인간이 설계한 것이고, 내비게이션 보조 등 일부 구간은 스크립트가 직접 처리했다. 에이전트가 코딩 세션에서 도구를 조율하며 진행하는 방식이라는 점에서 비개입 자율 클리어와는 결이 다르다. 이 점은 kenforthewin도 명확히 밝혔다.

그래도 이 결과가 가리키는 방향은 분명하다. 텍스트를 읽고, 상황을 파악하고, 장기 계획을 세우는 능력이 어느 수준에 왔는지 이번 기록이 하나의 기준점이 됐다. 하네스 없이도, 더 까다로운 캐릭터 조합으로도 재현할 수 있는지 확인하는 시도들이 이어질 것이다. 앞으로 이 클리어를 출발점 삼아 더 엄격한 조건에서 재현을 시도하는 연구들이 나올 것이라는 건 충분히 예상할 수 있다.

함께 읽기

Leave a Comment