한 달을 한 문장으로
논문의 관심이 "더 똑똑한 모델"에서 "실패를 관리하고 비용을 통제하면서 오래 일하는 시스템"으로 옮겨갔다.
7월 말 논문들은 아직 "계산을 더 주면 더 잘하나"를 묻고 있었다. 8월 말이 되면 질문이 바뀐다. 실패했을 때 되감을 수 있나, 지침을 더 붙이면 오히려 나빠지지 않나, 그 점수는 진짜인가.
이 변화가 업무에 주는 뜻은 하나다. 에이전트를 고를 때 모델 이름만 보면 안 된다. 같은 모델이라도 실행 구조가 다르면 사실상 다른 도구다.
반복해서 나온 결론 다섯
1. 계산을 더 준다고 계속 좋아지지 않는다
로컬 컴퓨터 사용 에이전트에 문맥을 늘리고 단계를 늘려도 성공률은 금방 포화됐다. 오히려 긴 실행이 잘못된 경로를 더 오래 지속시켰다.
2. 붙이면 좋아진다는 가정이 계속 깨졌다
스킬을 붙이면 좋아진다 — 아니었다. 도구를 많이 호출하면 에이전트답다 — 아니었다. 에이전트를 여러 개 붙이면 안전하다 — 아니었다. 같은 모델은 같은 곳에서 함께 틀린다.
3. 실패는 없애는 게 아니라 관리하는 것이다
체크포인트와 되감기, 이탈 감지, 트랜잭션, 실행 전 예행연습. 데이터베이스와 운영체제가 수십 년 전에 정리한 개념들이 에이전트로 그대로 넘어오는 중이다.
4. 점수는 생각보다 부정확하다
실패로 판정된 실행 기록을 사람이 다시 보니 15.3%가 오판이었다. 반대로, 실제 시장에서 돈을 받고 하는 업무를 끝까지 해내는 비율은 가장 강한 모델도 약 30%였다.
5. 성능을 좌우한 건 대개 모델 바깥이었다
하네스, 메모리 구조, 도구 설명서, 검증 절차. 같은 모델을 다른 하네스에 넣으면 결과가 크게 달라졌고, 도구 설명서만 고쳐도 성공률이 크게 올랐다.
주제별로 나눠 읽기
- 실패를 전제로 짠다 — 되감기, 이탈 감지, 트랜잭션, 실행 전 예행연습
- 메모리 — 많이 기억하기보다 언제 꺼내고 언제 무시할까
- 하네스 — 모델이 아니라 실행 구조가 성능을 만든다
- 스킬과 도구 — 더 붙이면 좋아지는가
- 평가 — 그 점수를 얼마나 믿을 것인가
- 멀티에이전트 — 여러 개 붙인다고 안전해지지 않는다
- 안전과 통제 — 이해했다고 말하는 것과 실제로 안 하는 것은 다르다
- 학습 — 100단계 중 어느 행동이 잘한 것인가
그래서 무엇을 다르게 할 것인가
도구를 고를 때 모델 이름 대신 이걸 본다 — 되돌릴 수 있나, 무엇을 실행했는지 기록이 남나, 권한을 어디까지 줄지 내가 정할 수 있나.
에이전트에게 일을 맡길 때 지침을 계속 늘리지 않는다. 겉보기에 관련 있어 보이는 지침이 가장 자주 성능을 떨어뜨렸다.
결과를 볼 때 최종 산출물만 확인하지 않는다. 목표는 달성했는데 중간에 엉뚱한 파일을 지웠을 수 있다.
벤치마크 숫자를 볼 때 그 숫자가 어떤 하네스에서 나온 것인지 확인한다. 모델 점수만으로는 내 환경에서 재현되지 않는다.
이 정리의 한계
이 페이지는 매일 받아 본 논문 감시 요약을 주제별로 재정리한 것이다. 원문을 직접 검증하지는 않았다. 수치는 각 논문 저자가 보고한 값이고, 대부분 preprint라 동료 심사를 거치지 않았다. 저자가 만든 벤치마크에서 저자의 방법이 좋았다는 형태의 결과가 많다는 점도 감안해서 읽어야 한다.
아래 목록에서 링크는 arXiv 번호가 확인된 것만 걸었다. 번호를 확인하지 못한 논문은 제목만 적었다.
전체 목록
7월 30일 공개
| 논문 | 한 줄 |
|---|---|
| Rethinking Inference-Time Scaling in Local Computer-Use Agents | 계산을 늘려도 성공률은 금방 포화된다 |
| MANTA: Multi-Agent Network Topology Adaptation | 협업 구조 자체를 실행 중에 바꾼다. 5개 벤치마크 평균 74.0점 |
| How Benchmarks Mis-Score Computer-Use Agents | 실패 판정의 15.3%가 오판이었다 |
| MIND: Memory Injection Defense via Intent-Aware Information Bottleneck | 메모리 주입 공격 성공률 약 55% 감소 |
| AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration | 중간 발견을 비동기로 공유. 32.3% → 62.1% |
| Sigma-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems | 어떤 에이전트를 믿을지를 누적 저장 |
| Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness | 능력 있다고 배포 준비된 것은 아니다 |
8월 3일 공개
| 논문 | 한 줄 |
|---|---|
| Real-Time Detection and Repair of LLM Agent Failures | 실행 신호만으로 실패 감지·되돌리기. 52% → 73% |
| Harness-R1: Learning to Edit Executable Runtime Harnesses | 모델이 아니라 하네스를 고친다. 44.3% → 53.6% |
| MemArbiter: Decision-Time Memory Arbitration | 검색한 기억이 행동에 안 쓰이는 문제. 최대 +25.4%p |
| HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents | 증거가 충분하면 검색을 멈춘다 |
| From Simple QA to Deep Research | 31개 주제 500개 딥리서치 과제를 자동 생성 |
8월 4~6일 공개
| 논문 | 한 줄 |
|---|---|
| OneDayAgent: Towards a Long-Horizon Harness | 분해·기억·검증·복구를 한 하네스에서 관리. 종합 0.821 |
| ABSeeker: Answer-Backtracked Credit Assignment | 정답에서 거꾸로 추적해 검색 단계를 평가 |
| HELENA: Hierarchical Sparse Coordination | 매 단계 필요한 연결만 활성화. 8개 벤치마크 평균 +3.47 |
| OctoLong: Mid-Training On Cross-Repository Code Contexts | 저장소 간 실제 의존 관계로 장문 학습 데이터를 만든다 |
| TRAJDEBUG: Tracing Error Lifecycle | 첫 오류가 아니라 최종 실패를 부른 핵심 오류를 찾는다 |
| EnvACE: Internalizing Environment Dynamics via World Rehearsal | 도구를 실제로 안 돌리고 머릿속에서 예행연습 |
| EcoAgent-Bench: Economic Decision-Making in Budget-Constrained Agents | 예산 고려 엄격 성공률 3.9~24.0% |
| Routing Is Least Learnable Where It Is Most Valuable | 복잡한 라우팅보다 하나를 고정하는 게 안정적이었다 |
| CodeGrep: An RL-Trained Retrieval Agent | 검색을 전문 에이전트로 분리. 토큰 19% 절감 |
| Activity Frames: Deterministic Screen-Activity Compilation | LLM 없이 화면 기록을 86배 압축 |
| The Illusion of Visual Tool-Use | 도구를 호출하고 결과를 안 보는 현상 |
| When Do Prompt-Side Agent Playbooks Transfer? | 플레이북 재사용은 환경이 바뀌면 위험하다 |
| Unified Agent: Managing Interactions across Devices | 기기를 넘나드는 상태 유지형 구조 |
8월 7일 공개
| 논문 | 한 줄 |
|---|---|
| Agent Memory Distillation | 큰 모델의 경험을 3단계 메모리로 작은 모델에 전달. AppWorld +27.2%p |
| Coupling Planning with Episodic Memory (PMCoder) | 계획이 기억을 바꾸고 기억이 계획을 바꾼다. +5.0%p |
| An End-to-End Agent Auditing Engine | 모델 + 하네스 + 도구 + 환경 전체를 평가 |
| NiyamAI: Intent-Bound Agent with ZK Guardrails | 안전 검사가 실제로 됐다는 걸 암호학적으로 증명 |
8월 10일 공개
| 논문 | 한 줄 |
|---|---|
| ActBench: Behavioral Safety in Cowork Agents | 일부 설정에서 공격 성공률 90% 초과 |
| OpenCodeReview: Determinism over Non-Determinism | 일부를 의도적으로 결정론적으로. 토큰 5~15배 감소 |
| Tree-of-Experience | 경험을 계층형 트리로 구조화 |
| Muscle Memory for Agents: Compile not Merely Retrieve | 반복 패턴을 전용 에이전트로 컴파일 |
| MESA: Task-Adaptive Multi-Structure Evidence Selection | 기억 구조를 골라 조합. 증거 토큰 41% 절감 |
| DocsChisel: Adaptive Tool Documentation Optimization | 모델이 아니라 도구 설명서를 고친다 |
| UserToolBench | 취향을 기억하는 게 아니라 행동에 반영하는가 |
| The CASE Framework | 기업 에이전트 실패의 82%가 여러 계층에 걸친 실패였다 |
8월 12~13일 공개
| 논문 | 한 줄 |
|---|---|
| Retry, Switch, or Abstain? | 도구가 망가졌을 때 어떻게 복구하는가 |
| Agent Skills Can Be Harmful | 스킬 때문에 생긴 실패 307건. 문제는 "관련 있어 보이는" 스킬 |
| CoAdapt-GUI | 처음 보는 앱에 현장 적응. 38.6% → 52.9% |
| Harness-IF | 기본 행동과 반대되는 지시는 준수율이 떨어진다 |
| The Sleeping Agent | 요약 압축이 날짜·시간을 잃는다. 3.05% → 62.39% |
| Agent Behavioral Contracts II | 실패의 90%가 함께 발생했다. 독립 가정이 깨진다 |
| SkillShapley | 스킬 안의 어느 문장이 기여했는지 계산 |
| Teach the Magnitude, Not the Direction | 턴 단위로 검증 가능한 보상을 나눈다 |
| Beyond Final Scores | 현재 에이전트는 연구자보다 최적화 엔지니어에 가깝다 |
| AutoDesign: Meta-Harness Optimization | 하네스 자체가 학습한다. 54.99 → 67.39 |
| StateBridge | 텍스트 대신 은닉 상태를 직접 전달 |
| OmniScientist | 원자료를 직접 보는 연구 에이전트 |
8월 14~15일 공개
| 논문 | 한 줄 |
|---|---|
| AgentRewind: Recoverable Execution | 컨텍스트와 환경 상태를 함께 체크포인트로 저장 |
| Second Thought: Reasoning in Parallel | 도구 기다리는 시간을 추론에 쓴다. 최대 43% 절감 |
| ScienceFlow | 연구를 저장·분기·복원 가능한 구간으로 나눈다 |
| Clearing the Fog | 행동 전에 무엇을 더 알아봐야 하는지 판단하는 능력 |
| Agentic Transaction: Towards ACID-Compliant Agent Systems | 에이전트 실행을 트랜잭션으로 관리. +10.6% |
| Graph-Based RL for Drift Diagnosis and Recovery | 작은 모델을 옆에 붙여 이탈을 감지·복구 |
| Hierarchical Agentic Incident Response with Digital-Twin Validation | 실행 전에 가상 환경에서 먼저 검증. +18~31% |
8월 17~19일 공개
| 논문 | 한 줄 |
|---|---|
| Agentic ESOpt | RL 대신 진화 전략. 역전파 없이 전체 파라미터 튜닝 |
| ClawGym II: Black-Box RL on Agent Harness | 하네스를 블랙박스로 둔 채 RL. Claude Code +14.81%p |
| Agent Lightning v1.0 | 실제 배포 하네스 안에서 RL. 41.8% → 56.4% |
| HarnessRisk | 위험을 90% 인식하고도 막지 못했다 |
| StartupBench | 실제 시장 업무 완수율 약 30% |
| SkillGate | 어떤 스킬을 읽을지 고르는 행위를 학습. 40.8% → 53.2% |
| RTPO | 뒤에서부터 각 턴을 결과와 연결 |
| FM-Bench | 축구 구단 20시즌 운영. 수백 번의 의사결정 |
| Beyond the Transcript | 은닉 상태를 통한 담합 탐지 |
| Eureka: Task-Conditioned Meta-Agent Orchestration | 작업마다 에이전트 조직 자체를 생성·수정 |
8월 20~21일 공개
| 논문 | 한 줄 |
|---|---|
| EnvHarness | 환경이 에이전트의 약점에 맞춰 진화한다 |
| AI4AI-Bench | 학습 알고리즘 자체를 개선하라. 최고 점수 0.250 |
| Task-CoEvolve | 후보들이 갈리는 문제만 평가. 평가 횟수 80% 감소 |
| ReguSim | 규칙을 이해했다고 말하는 것과 지키는 것은 다르다 |
| RGA-Designer | 통신 그래프를 희소하게. 토큰 20.5% 감소 |
| MemTrapBench | 정확한 기억도 추론을 망칠 수 있다 |
| PolicyGuide | 정책을 워크플로 그래프로 컴파일. 0.42 → 0.62 |
| SWE-bench Science | 실제 과학 코드베이스에서의 코딩 에이전트 |
| Don't Solve, Just Compare | 작은 모델은 풀지 말고 비교만 하게 한다 |
| AUSO | 스킬을 배우고, 내재화하고, 필요할 때만 꺼낸다 |
| CRATE | 각 행동 전후로 화면이 무엇이 바뀌었는지 평가 |
| CAS: Conformalized Agentic Search | 질문마다 필요한 검색 결과 수를 동적으로 |
8월 24일 공개
| 논문 | 한 줄 |
|---|---|
| Apodex 1.1 | 상태 유지·실패 복구·병렬 협업을 전면에 둔 시스템 |
| Prime Agent: A Self-Improving RLM Harness | 같은 모델도 하네스가 다르면 다른 에이전트다. 30% → 95.5% |
| MobilePA-Bench | 212개 모바일 도구를 쓰는 계획 에이전트 평가 |
| AutoSaddler | 실패를 영구적인 하네스 개선으로 축적. +9.0~10.0%p |
| Agent-G2 | 얼마만큼의 정답 앞부분을 보여줄지 동적으로 선택 |