
서점 링크는 제휴 링크이며, 구매 시 북버스가 수수료를 받을 수 있습니다.
아티팩트 홈페이지 ↗ ai-master-book.com
출판사 제공 소개가 아직 없습니다.
출처: 알라딘 Open API 제공 도서 정보
강화학습이나 로보틱스를 공부하다 보면 「에이전트가 머릿속에서 미래를 굴려 본다」는 문장 앞에 멈춰 선 적이 있다. 실제 환경과 부딪히는 대신 내부 모델 안에서 수만 번을 상상해 보고 가장 좋아 보이는 행동을 고른다는 이야기를 들었거나, 그렇게 하면 로봇 팔을 망가뜨리지 않고도 학습할 수 있다는 설명을 본 적이 있을 것이다. 그러나 막상 월드 모델 논문을 열어 보면 첫 페이지부터 RSSM 과 사후 분포 붕괴·KL 균형·잠재 오버슈팅·「상상 지평에서의 λ-리턴」이 쏟아져 나온다. 정작 그 「상상」이 파이토치 코드의 어느 줄에 있는지는 어디에도 적혀 있지 않다. 「Dreamer」나 「월드 모델」로 검색하면 자료는 많이 나오지만 「이 KL 항을 내 손실 함수 어디에 끼워 넣어야 하나」라는 가장 실용적인 질문에 답하는 자료는 의외로 적다.
이것이 ML 엔지니어가 월드 모델 앞에서 멈춰서는 가장 흔한 지점이다. 제어 이론의 추상화와 딥러닝의 추상화 사이에 「학습된 잠재 동역학」이라는 다리가 있다는 사실을, 그리고 그 다리를 건너는 도구가 이미 평범한 파이토치 코드라는 사실을 모르기 때문이다. 우리는 논문의 수식을 손으로 따라가다 지치고 인코더와 동역학 모델과 정책을 따로따로 다루는 보일러플레이트에 묻혀 본질을 놓친다. 어느 시점에 깨닫는다. 이것은 강화학습의 문제가 아니라 표현의 문제다. 본 책은 그 깨달음에서 출발한다.
월드 모델은 새로운 개념이 아니다. Ha 와 Schmidhuber 의 논문은 2018 년에 나왔고 환경의 동역학을 학습한다는 발상 자체는 2000 년대 모델 기반 강화학습까지 거슬러 올라간다. 그런데도 이 분야는 한동안 조용했다. 예측은 시간이 갈수록 열화됐고, 긴 시야의 궤적은 무너졌고, 생성된 프레임은 몇 스텝 만에 뭉개졌다. 돌이켜 보면 아이디어가 틀린 것이 아니었다. 그 아이디어를 작동시킬 생성 능력이 아직 없었던 것이 문제였다. 확산 모델과 비디오 파운데이션 모델이 그 판을 바꿨다. AI 시스템이 시간적으로 일관된 연속적 세계 상태를 처음으로 만들어 낼 수 있게 된 것이다. 월드 모델은 마침내 실행 가능한 프로그램이 되었고 분야 전체가 「이론적 가능성」에서 「진단할 수 있는 코드」의 단계로 넘어갔다.
월드 모델을 배워야 할 이유는 단지 「인지과학적으로 그럴듯해서」가 아니다. 그 진짜 무대는 실제 상호작용 한 번의 값이 비싼 영역으로 활용도가 높아지고 있다.
출처: 국립중앙도서관 ISBN 서지정보(출판사 제출)
-김이영 / AI 개발자
"VAE 인코더부터 RSSM, Dreamer 에이전트, 평가 대시보드까지 실행되는 코드로 이어지니, 논문만 읽고 막혔던 지점을 직접 돌려 보며 넘어설 수 있다."
-박정현 / 피지컬 AI PM
"월드 모델이 무엇이고 지금 왜 쓰이는지, 어디서 무너지고 무엇을 걸어야 하는지를 통합 패턴 일곱 가지와 함정 일곱 가지로 짚어 주니, 기술 판단을 사업 언어로 옮길 근거가 생긴다."
- 이현중 / 책임 연구원
"크레이크와 예측 부호화에서 출발해 JEPA·Genie·LS-Imagine과 최전선 논쟁까지 한 줄기로 꿰면서도 진단 틀을 모델에 매이지 않게 세워 두었으니, 다음 실험의 가설을 여기서 고를 수 있다."
출처: 국립중앙도서관 ISBN 서지정보(출판사 제출)
저자 소개
Table of Contents (목차)
서문: 들어가며
Part 1: 내부 시뮬레이션 — 월드 모델의 역사와 직관
1.1 지적 기초 — 크레이크, 예측 부호화, 내부 모델 원리
1.2 월드 모델이란 무엇인가
1.3 분류 체계와 네 시대
1.4 왜 지금 월드 모델인가
1.5 이 책의 로드맵
Part 2: 관측 인코딩과 잠재 동역학
2.1 관측 인코딩
2.2 잠재 동역학
2.3 Dreamer 계열 아키텍처의 진화
2.4 코드구현 — VAE 인코더 학습
2.5 코드구현 — RSSM 동역학 모델
Part 3: 아키텍처와 계획
3.1 백본 선택 — RSSM · 트랜스포머 · 확산
3.2 계획과 제어 — CEM-MPC 와 잠재 액터-크리틱
3.3 계획과 제어 — TD-MPC 와 기제 비교
3.4 코드구현 — Dreamer 에이전트
3.5 코드구현 — 동역학 백본 갈아 끼우기
3.6 월드 모델 통합 패턴 일곱 가지
3.7 심화 — JEPA 와 RWM
3.8 심화 — Genie 와 잠재 행동
3.9 심화 — 공간 3D·4D 월드 모델
3.10 심화 — LoopWM · WAM 과 아키텍처 선택
3.11 심화 사례 — LS-Imagine
Part 4: 진단과 배포
4.1 모델에 매이지 않는 진단 틀
4.2 표현과 과제 신호 — Dreamer 사례
4.3 가치와 탐색 품질 — MuZero 사례
4.4 잠재 동역학과 계획 효율 — TD-MPC 사례
4.5 자기회귀 롤아웃 품질 — STORM 사례
4.6 물리적 일관성과 지평 표류
4.7 코드구현 — 월드 모델 평가 대시보드
4.8 코드구현 — 반사실 행동 조건부 월드 모델
4.9 실제 배포 평가 — 논문 지표를 넘어서
4.10 흔한 함정 일곱 가지와 배포 전략
4.11 진단 종합과 전망
Part 5: 최전선 논쟁
5.1 논쟁 하나와 둘 — 언어라는 아편, 그리고 쓰라린 교훈
5.2 논쟁 셋 — 월드 모델과 LLM 은 경쟁자인가 보완재인가
5.3 논쟁 넷 — 데이터는 어디서 오는가
5.4 각 노선의 핵심 베팅과 남는 물음
5.5 철학적 후주 — 발제적 인지와 월드 모델이 놓치는 것
출처: 국립중앙도서관 ISBN 서지정보(출판사 제출)
부가기호 05000: 독자 대상 교양 · 발행 형태 전자출판물 · 내용 분류 총류.
출처: 국립중앙도서관 ISBN 서지정보 · 부가기호 뜻은 국립중앙도서관 ISBN 안내 기준
아티팩트에서 2026-09-15에 출간했습니다. ISBN 9791124236178.
고우주 (지은이)입니다. 자세한 저자 소개는 출판사(아티팩트) 제공 자료를 참고하세요.
알라딘 등 온라인 서점에서 구매할 수 있습니다. ISBN 9791124236178으로 검색하면 정확한 판을 찾을 수 있습니다. 정가는 20,000원입니다.
2027 이기적 워드프로세서 필기+실기 올인원 - 최신 출제 기준 반영 + 동영상 강의 무료 + 막판정리 핸드북 제공