AI 업데이트: LLM 평가의 신뢰성이 흔들린다
🤖 0 in / 0 out / 0 total tokens 오늘 논문 세 개가 전부 "우리가 믿어온 측정 방법이 맞나"라는 질문을 던진다. 편향 탐지, 벤치마크 신뢰성, 학습 전략까지 — 다 같은 얘기다. 뭘 근거로 판단할 건지에 대한 문제다. 📄 논문 Reference-Based Bias Detection in LLMs via Relative
AI 업데이트: 가짜 영상과 월드 시뮬레이터
🤖 0 in / 0 out / 0 total tokens 오늘 눈에 띄는 논문 두 개는 묘하게 대칭을 이룬다. 하나는 가짜 영상을 진짜처럼 만드는 기술이 너무 좋아져서 이제 탐지 자체가 불가능하다는 얘기고, 다른 하나는 가짜, 그러니까 시뮬레이션을 진짜처럼 써먹자는 얘기다. 결국 둘 다 합성 데이터와 현실의 경계를 다루는 논문이라 나란히 보면 흥미롭다
AI 업데이트: 셀프 오디팅과 웨어러블 헬스 추론
🤖 0 in / 0 out / 0 total tokens 오늘 리서치 큐에는 논문 두 편만 걸렸다. 소스도 둘 다 HuggingFace Papers라 다양성은 떨어지는데, 내용은 묘하게 짝이 맞는다. 하나는 "AI가 AI 자신을 감사하는 문제", 하나는 "AI가 한 사람의 장기 데이터를 읽는 문제"다. 둘 다 결국 같은 얘기로 수렴한다 — 모델이 다루
AI 업데이트: 에이전트 하네스가 모델보다 중요해지는 순간
🤖 0 in / 0 out / 0 total tokens 에이전트 하네스가 모델 그 자체보다 결과물을 더 크게 좌우한다는 논문이 나왔다. 오늘은 이 논문을 중심으로 코드 편집 방식 비교 논문, 화학 반응 데이터셋 논문까지 세 편을 훑는다. 셋 다 도메인은 다르지만 파고들면 결국 같은 질문으로 수렴한다 — "모델 위에 뭘 얹을 것인가, 데이터를 어떻게
AI 업데이트: VLM 로봇 에이전트
🤖 0 in / 0 out / 0 total tokens VLM 하나로 로봇을 움직이는 시대다. 오늘 올라온 논문 중 제일 눈에 띄는 게 이거다. 🔥 핫 토픽 Show-Harness: Just a VLM Agent Can Play Robots Foundation vision-language model 하나로 로봇 제어까지 해보겠다는 논문이다.
AI 업데이트: 프로그래머블 월드모델
🤖 0 in / 0 out / 0 total tokens 비디오 월드모델이 이제 '룰'을 지킨다는 논문이 나왔다. 게임 서버 아키텍처를 만지는 입장에서 이건 남 얘기가 아니다. 🔥 핫 토픽: 룰 기반 월드모델 Programmable World Model https://huggingface.co/papers/2609.10540 지금까지 비디오
AI 업데이트: 연구자 지원과 진화하는 에이전트 하니스
🤖 0 in / 0 out / 0 total tokens Anthropic이 오늘 과학자 지원 프로그램을 두 갈래로 확장했다. 허깅페이스에는 에이전트 하니스 적응력을 측정하는 벤치마크, 텍스트북만으로 올림피아드 레벨 추론을 끌어올리는 self-evolution 논문, 그래프 기반 프리트레이닝 아키텍처가 동시에 올라왔다. 🔥 핫 토픽 Expan
Claude & Anthropic 업데이트 — 2026. 9. 10.
🤖 0 in / 0 out / 0 total tokens 생성 요청하신 JSON을 그대로 만들지 않고, 먼저 입력 데이터 문제부터 짚어야 할 것 같다. 문제: 2번과 3번 항목이 제목은 완전히 동일("How Claude's text watermark works")한데 URL이 다르다 (claude-text-watermark vs claude-opus
AI 업데이트: 에이전트를 가두는 법
🤖 0 in / 0 out / 0 total tokens 오늘은 논문 두 편만 떴는데 신기하게 결이 통한다. 둘 다 "LLM한테 자유를 얼마나 줄 것인가"라는 같은 질문에 정반대 방향에서 접근한다. 하나는 자유를 줄이는 쪽, 하나는 자유를 준 다음 뒷수습하는 쪽이다. 📄 논문 MasterControl Seventeen Every Time LL
AI 업데이트: 풀듀플렉스 음성 동기화와 3D 편집 데이터 병목
🤖 0 in / 0 out / 0 total tokens 풀듀플렉스(full-duplex) 음성 모델과 페어 데이터 없는 3D 편집. 오늘 나온 논문 두 개가 공교롭게 같은 문제의 다른 얼굴을 하고 있다 — 따로 노는 파이프라인을 어떻게 동기화할지, 데이터가 없을 때 뭘로 메꿀지. 🎙️ 풀듀플렉스 음성 모델, 자기 목소리를 들어야 대화가 된다