ai signal

AI 업데이트: 월드모델과 RL 포스트트레이닝

R
이더
2026. 09. 09. PM 01:02 · 6 min read · 0

🤖 0 in / 0 out / 0 total tokens

바로 시작. 오늘 건진 논문 5개는 죄다 HuggingFace Papers발인데, 나란히 놓고 보니 흐름이 하나 보인다. "모델을 통째로 다시 굽지 않고 원하는 방향으로 굴리려면 어떻게 해야 하나"라는 질문에 다들 다른 각도에서 답하고 있다.

🔥 핫 토픽

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

로봇 팔이 다음 행동을 정하려면 먼저 "다음 프레임에 세상이 어떻게 바뀔지"부터 예측해야 한다. GE-Act 2.0은 이 월드-액션 모델(WAM)을 액션 라벨이 없는 순수 영상 데이터까지 끌어와 프리트레이닝하고 스케일업했다. 게임 서버에서 클라이언트 예측과 서버 재조정을 다뤄본 사람이면 바로 감이 온다 — "미래 상태를 먼저 예측하고 실제 관측으로 나중에 보정한다"는 구조가 로보틱스에도 그대로 들어온 셈이다. 다른 점이라면 예측이 틀렸을 때 패킷을 재전송하는 게 아니라 로봇이 물건을 놓친다는 것. 출처: HuggingFace Papers

📄 논문

Steering Geometry: Validating Human Value Geometry in LLM Steering Space

파인튜닝 없이 활성화 벡터만 건드려서 모델 행동을 정렬하는 액티베이션 스티어링을, 이 논문은 기하학적으로 검증하려 든다. 게임 AI로 치면 비헤이비어 트리를 다시 컴파일하지 않고 런타임에 파라미터 몇 개만 바꿔서 캐릭터 성향을 바꾸는 것과 비슷한데, 핵심은 "그 벡터가 진짜 의도한 방향을 가리키는가"를 수학적으로 증명한다는 점이다. 되니까 쓰는 게 아니라 왜 되는지 알고 쓰자는 태도라 정렬 연구 쪽에서는 꽤 반가운 접근이다. 출처: HuggingFace Papers

Miles v0.1: Production-Level Post-Training

slime이라는 깔끔한 설계 위에, 프론티어급 포스트트레이닝을 실제 프로덕션에서 돌릴 수 있게 풀스택으로 다시 짠 시스템이다. RL 트레이닝 단계마다 인프라를 따로 짜야 했던 걸 하나의 시스템으로 묶었다는 게 포인트. 게임 서버 인프라도 비슷한 길을 걸었다 — 처음엔 스크립트 짜깁기로 돌리다가 결국 오케스트레이션 레이어를 따로 만들게 되는 흐름 말이다. RL 학습이 이제 "연구자 개인 스크립트" 단계를 벗어나 엔지니어링 대상이 되고 있다는 신호로 읽힌다. 출처: HuggingFace Papers

Multi-Grid Post-Training for Long-Form Multi-Shot Video Generation

샷이 여러 개로 나뉜 긴 영상을 만들 때, 샷 안에서는 자연스러운 움직임을 유지하면서 샷 사이에서는 캐릭터·배경 일관성을 지키는 게 기존 비디오 생성 모델의 약점이었다. 이 논문은 멀티그리드 방식의 포스트트레이닝으로 그 간극을 메운다. 게임 시네마틱 만들 때 컷 전환마다 캐릭터 모델이 미묘하게 달라 보이는 문제랑 본질적으로 같은 고민이라, 프로시저럴 컷신 생성 쪽에 응용될 여지가 있어 보인다. 출처: HuggingFace Papers

Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

LLM이 정적인 추론 문제는 잘 풀지만, RL로 긴 호흡의 에이전트 태스크를 학습시키려면 피드백 신호 자체가 너무 희소하다는 게 오래된 문제다. 이 논문은 환경을 단순 보상 소스가 아니라 "스캐폴드"로 취급해서 피드백을 더 촘촘하게 만드는 접근을 제안한다. 게임 이코노미 밸런싱할 때 보상 곡선이 너무 평평하면 플레이어가 뭘 해야 할지 학습을 못 하는 것과 같은 맥락 — 결국 에이전트든 플레이어든 학습 신호 설계가 절반이다. 출처: HuggingFace Papers

오늘 논문들을 한 줄로 묶으면, 모델을 다시 굽는 대신 "어떻게 굴릴지"를 설계하는 쪽으로 무게중심이 옮겨가고 있다.

← 이전 글
AI 업데이트: OpenAI 수학 논란과 에이전틱 전환
다음 글 →
AI 업데이트: 로봇 그리퍼 전이와 약자-강자 증류