이 글은 AI 검수에서 통과하지 못했습니다 (점수: 75/100)
⚠️ 비어있는 섹션이 있다 🚫 죽은 링크: https://openai.com/index/research-acceleration-view-inside-openai (403)
링크 오류, 품질 미달 등의 사유로 자동 분류된 글입니다.
🤖
0 in / 0 out / 0 total tokens
OpenAI가 내부에서 코딩 에이전트를 얼마나 쓰는지 공개했다. 이게 오늘 가장 눈에 띄는 소식이다.
🔥 핫 토픽
Research acceleration: The view inside OpenAI
OpenAI 내부에서 코딩 에이전트가 리서치 워크플로우 자체를 바꾸고 있다는 내용이다. 에이전트 사용량, 실험 속도, 태스크 복잡도 데이터를 공개했다.
혼자 사이드프로젝트 돌리면서 Claude Code로 이 블로그 파이프라인 짤 때도 비슷한 경험을 했다. 예전 같으면 하루 걸릴 리팩토링을 에이전트한테 맡기고 다른 일을 하는 식으로 실험 사이클이 짧아진다. 근데 이게 조직 단위로 커지면 「실험 속도」가 아니라 「복잡도 상한」이 문제가 된다. 에이전트가 태스크를 더 잘 처리할수록 사람이 리뷰해야 할 표면적도 같이 늘어난다. UE5에서 자동 생성 코드가 늘어나면 코드 리뷰가 병목이 되는 것과 똑같은 구조다.
출처: OpenAI Blog
📄 논문
VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement
영상 생성 모델이 그럴싸하게 보여도 물리적으로 말이 안 되는 경우가 많다는 문제의식에서 출발한 논문이다. 스칼라 점수 하나로는 「어디서 왜 깨졌는지」를 알 수 없으니, 에이전트 기반으로 물리 위반 지점을 짚어내는 프레임워크를 제안한다.
게임 엔진에서 물리 시뮬레이션 디버깅할 때 제일 답답한 게 딱 이거다. 「뭔가 이상한데 왜인지 모르겠다」는 상태. 이 논문 방향이 맞다면 나중에 월드모델 기반 시뮬레이션도 UE5 피직스 디버거처럼 위반 지점을 짚어주는 툴이 나올 수 있다.
Locked at the Entrance, Open Inside: Where RLVR Narrows the Solution Space
RLVR(검증 가능한 보상 기반 강화학습)이 pass@1은 확실히 올리는데, 정책이 찾아내는 풀이 공간 자체는 좁아진다는 분석이다. test-time scaling의 이득이 줄어드는 원인을 solution space 수축으로 설명한다.
서버 최적화할 때 지표 하나만 보고 튜닝하면 다른 경로가 다 죽는 현상이랑 비슷하다. 보상 함수 하나에 과적합되면 다양성을 잃는다는 건 RL이든 게임 AI든 똑같이 적용되는 원칙인 듯하다.
DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
프로그래매틱 체커가 없는 롱호라이즌 에이전트 태스크에서 credit assignment를 어떻게 할지 다루는 논문이다. outcome-blind 세팅에서 동적 루브릭으로 세밀하게 보상을 나눠준다.
이건 실전에서 제일 아쉬운 부분을 건드린다. 대부분의 실제 업무는 「성공/실패」 체커가 없다. 에이전트한테 장기 태스크 맡길 때마다 느끼는 문제인데, 이 방향 연구가 쌓이면 자율 에이전트 워크플로우의 실용성이 한 단계 올라갈 것 같다.
A Common Measure of Communication for Speech Brain-Computer Interfaces
Speech BCI는 신경 신호를 언어로 직접 변환해서 마비 환자의 발화를 복원하는 기술이다. 이 논문은 서로 다른 BCI 시스템 간 커뮤니케이션 성능을 비교할 공통 척도를 제안한다.
AI 뉴스에서는 비중이 작아 보이지만, 벤치마크가 없으면 그 분야 전체가 각자 다른 잣대로 논문 쓰는 걸로 끝난다. 공통 척도 만드는 작업 자체가 지루하지만 제일 중요한 일이라는 거, 코드베이스에 테스트 오라클 만드는 것과 비슷한 위치다.
에이전트가 빨라질수록 사람이 봐야 할 표면적도 늘어난다 — 속도보다 리뷰 구조가 진짜 병목이다.