논문

2026년 8월 에이전틱 AI 논문 — 한 달 흐름 정리

7월 30일부터 8월 24일까지 arXiv에 올라온 에이전트 논문 약 60편을 주제별로 묶었다. 결론부터 말하면, 경쟁 단위가 모델 하나에서 실행 시스템 전체로 넘어갔다.

확인 시점 2026-08-26오늘 확인

한 달을 한 문장으로

논문의 관심이 "더 똑똑한 모델"에서 "실패를 관리하고 비용을 통제하면서 오래 일하는 시스템"으로 옮겨갔다.

7월 말 논문들은 아직 "계산을 더 주면 더 잘하나"를 묻고 있었다. 8월 말이 되면 질문이 바뀐다. 실패했을 때 되감을 수 있나, 지침을 더 붙이면 오히려 나빠지지 않나, 그 점수는 진짜인가.

이 변화가 업무에 주는 뜻은 하나다. 에이전트를 고를 때 모델 이름만 보면 안 된다. 같은 모델이라도 실행 구조가 다르면 사실상 다른 도구다.

반복해서 나온 결론 다섯

1. 계산을 더 준다고 계속 좋아지지 않는다

로컬 컴퓨터 사용 에이전트에 문맥을 늘리고 단계를 늘려도 성공률은 금방 포화됐다. 오히려 긴 실행이 잘못된 경로를 더 오래 지속시켰다.

2. 붙이면 좋아진다는 가정이 계속 깨졌다

스킬을 붙이면 좋아진다 — 아니었다. 도구를 많이 호출하면 에이전트답다 — 아니었다. 에이전트를 여러 개 붙이면 안전하다 — 아니었다. 같은 모델은 같은 곳에서 함께 틀린다.

3. 실패는 없애는 게 아니라 관리하는 것이다

체크포인트와 되감기, 이탈 감지, 트랜잭션, 실행 전 예행연습. 데이터베이스와 운영체제가 수십 년 전에 정리한 개념들이 에이전트로 그대로 넘어오는 중이다.

4. 점수는 생각보다 부정확하다

실패로 판정된 실행 기록을 사람이 다시 보니 15.3%가 오판이었다. 반대로, 실제 시장에서 돈을 받고 하는 업무를 끝까지 해내는 비율은 가장 강한 모델도 약 30%였다.

5. 성능을 좌우한 건 대개 모델 바깥이었다

하네스, 메모리 구조, 도구 설명서, 검증 절차. 같은 모델을 다른 하네스에 넣으면 결과가 크게 달라졌고, 도구 설명서만 고쳐도 성공률이 크게 올랐다.

주제별로 나눠 읽기

  • 실패를 전제로 짠다 — 되감기, 이탈 감지, 트랜잭션, 실행 전 예행연습
  • 메모리 — 많이 기억하기보다 언제 꺼내고 언제 무시할까
  • 하네스 — 모델이 아니라 실행 구조가 성능을 만든다
  • 스킬과 도구 — 더 붙이면 좋아지는가
  • 평가 — 그 점수를 얼마나 믿을 것인가
  • 멀티에이전트 — 여러 개 붙인다고 안전해지지 않는다
  • 안전과 통제 — 이해했다고 말하는 것과 실제로 안 하는 것은 다르다
  • 학습 — 100단계 중 어느 행동이 잘한 것인가

그래서 무엇을 다르게 할 것인가

도구를 고를 때 모델 이름 대신 이걸 본다 — 되돌릴 수 있나, 무엇을 실행했는지 기록이 남나, 권한을 어디까지 줄지 내가 정할 수 있나.

에이전트에게 일을 맡길 때 지침을 계속 늘리지 않는다. 겉보기에 관련 있어 보이는 지침이 가장 자주 성능을 떨어뜨렸다.

결과를 볼 때 최종 산출물만 확인하지 않는다. 목표는 달성했는데 중간에 엉뚱한 파일을 지웠을 수 있다.

벤치마크 숫자를 볼 때 그 숫자가 어떤 하네스에서 나온 것인지 확인한다. 모델 점수만으로는 내 환경에서 재현되지 않는다.

이 정리의 한계

이 페이지는 매일 받아 본 논문 감시 요약을 주제별로 재정리한 것이다. 원문을 직접 검증하지는 않았다. 수치는 각 논문 저자가 보고한 값이고, 대부분 preprint라 동료 심사를 거치지 않았다. 저자가 만든 벤치마크에서 저자의 방법이 좋았다는 형태의 결과가 많다는 점도 감안해서 읽어야 한다.

아래 목록에서 링크는 arXiv 번호가 확인된 것만 걸었다. 번호를 확인하지 못한 논문은 제목만 적었다.

전체 목록

7월 30일 공개

논문 한 줄
Rethinking Inference-Time Scaling in Local Computer-Use Agents 계산을 늘려도 성공률은 금방 포화된다
MANTA: Multi-Agent Network Topology Adaptation 협업 구조 자체를 실행 중에 바꾼다. 5개 벤치마크 평균 74.0점
How Benchmarks Mis-Score Computer-Use Agents 실패 판정의 15.3%가 오판이었다
MIND: Memory Injection Defense via Intent-Aware Information Bottleneck 메모리 주입 공격 성공률 약 55% 감소
AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration 중간 발견을 비동기로 공유. 32.3% → 62.1%
Sigma-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems 어떤 에이전트를 믿을지를 누적 저장
Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness 능력 있다고 배포 준비된 것은 아니다

8월 3일 공개

논문 한 줄
Real-Time Detection and Repair of LLM Agent Failures 실행 신호만으로 실패 감지·되돌리기. 52% → 73%
Harness-R1: Learning to Edit Executable Runtime Harnesses 모델이 아니라 하네스를 고친다. 44.3% → 53.6%
MemArbiter: Decision-Time Memory Arbitration 검색한 기억이 행동에 안 쓰이는 문제. 최대 +25.4%p
HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents 증거가 충분하면 검색을 멈춘다
From Simple QA to Deep Research 31개 주제 500개 딥리서치 과제를 자동 생성

8월 4~6일 공개

논문 한 줄
OneDayAgent: Towards a Long-Horizon Harness 분해·기억·검증·복구를 한 하네스에서 관리. 종합 0.821
ABSeeker: Answer-Backtracked Credit Assignment 정답에서 거꾸로 추적해 검색 단계를 평가
HELENA: Hierarchical Sparse Coordination 매 단계 필요한 연결만 활성화. 8개 벤치마크 평균 +3.47
OctoLong: Mid-Training On Cross-Repository Code Contexts 저장소 간 실제 의존 관계로 장문 학습 데이터를 만든다
TRAJDEBUG: Tracing Error Lifecycle 첫 오류가 아니라 최종 실패를 부른 핵심 오류를 찾는다
EnvACE: Internalizing Environment Dynamics via World Rehearsal 도구를 실제로 안 돌리고 머릿속에서 예행연습
EcoAgent-Bench: Economic Decision-Making in Budget-Constrained Agents 예산 고려 엄격 성공률 3.9~24.0%
Routing Is Least Learnable Where It Is Most Valuable 복잡한 라우팅보다 하나를 고정하는 게 안정적이었다
CodeGrep: An RL-Trained Retrieval Agent 검색을 전문 에이전트로 분리. 토큰 19% 절감
Activity Frames: Deterministic Screen-Activity Compilation LLM 없이 화면 기록을 86배 압축
The Illusion of Visual Tool-Use 도구를 호출하고 결과를 안 보는 현상
When Do Prompt-Side Agent Playbooks Transfer? 플레이북 재사용은 환경이 바뀌면 위험하다
Unified Agent: Managing Interactions across Devices 기기를 넘나드는 상태 유지형 구조

8월 7일 공개

논문 한 줄
Agent Memory Distillation 큰 모델의 경험을 3단계 메모리로 작은 모델에 전달. AppWorld +27.2%p
Coupling Planning with Episodic Memory (PMCoder) 계획이 기억을 바꾸고 기억이 계획을 바꾼다. +5.0%p
An End-to-End Agent Auditing Engine 모델 + 하네스 + 도구 + 환경 전체를 평가
NiyamAI: Intent-Bound Agent with ZK Guardrails 안전 검사가 실제로 됐다는 걸 암호학적으로 증명

8월 10일 공개

논문 한 줄
ActBench: Behavioral Safety in Cowork Agents 일부 설정에서 공격 성공률 90% 초과
OpenCodeReview: Determinism over Non-Determinism 일부를 의도적으로 결정론적으로. 토큰 5~15배 감소
Tree-of-Experience 경험을 계층형 트리로 구조화
Muscle Memory for Agents: Compile not Merely Retrieve 반복 패턴을 전용 에이전트로 컴파일
MESA: Task-Adaptive Multi-Structure Evidence Selection 기억 구조를 골라 조합. 증거 토큰 41% 절감
DocsChisel: Adaptive Tool Documentation Optimization 모델이 아니라 도구 설명서를 고친다
UserToolBench 취향을 기억하는 게 아니라 행동에 반영하는가
The CASE Framework 기업 에이전트 실패의 82%가 여러 계층에 걸친 실패였다

8월 12~13일 공개

논문 한 줄
Retry, Switch, or Abstain? 도구가 망가졌을 때 어떻게 복구하는가
Agent Skills Can Be Harmful 스킬 때문에 생긴 실패 307건. 문제는 "관련 있어 보이는" 스킬
CoAdapt-GUI 처음 보는 앱에 현장 적응. 38.6% → 52.9%
Harness-IF 기본 행동과 반대되는 지시는 준수율이 떨어진다
The Sleeping Agent 요약 압축이 날짜·시간을 잃는다. 3.05% → 62.39%
Agent Behavioral Contracts II 실패의 90%가 함께 발생했다. 독립 가정이 깨진다
SkillShapley 스킬 안의 어느 문장이 기여했는지 계산
Teach the Magnitude, Not the Direction 턴 단위로 검증 가능한 보상을 나눈다
Beyond Final Scores 현재 에이전트는 연구자보다 최적화 엔지니어에 가깝다
AutoDesign: Meta-Harness Optimization 하네스 자체가 학습한다. 54.99 → 67.39
StateBridge 텍스트 대신 은닉 상태를 직접 전달
OmniScientist 원자료를 직접 보는 연구 에이전트

8월 14~15일 공개

논문 한 줄
AgentRewind: Recoverable Execution 컨텍스트와 환경 상태를 함께 체크포인트로 저장
Second Thought: Reasoning in Parallel 도구 기다리는 시간을 추론에 쓴다. 최대 43% 절감
ScienceFlow 연구를 저장·분기·복원 가능한 구간으로 나눈다
Clearing the Fog 행동 전에 무엇을 더 알아봐야 하는지 판단하는 능력
Agentic Transaction: Towards ACID-Compliant Agent Systems 에이전트 실행을 트랜잭션으로 관리. +10.6%
Graph-Based RL for Drift Diagnosis and Recovery 작은 모델을 옆에 붙여 이탈을 감지·복구
Hierarchical Agentic Incident Response with Digital-Twin Validation 실행 전에 가상 환경에서 먼저 검증. +18~31%

8월 17~19일 공개

논문 한 줄
Agentic ESOpt RL 대신 진화 전략. 역전파 없이 전체 파라미터 튜닝
ClawGym II: Black-Box RL on Agent Harness 하네스를 블랙박스로 둔 채 RL. Claude Code +14.81%p
Agent Lightning v1.0 실제 배포 하네스 안에서 RL. 41.8% → 56.4%
HarnessRisk 위험을 90% 인식하고도 막지 못했다
StartupBench 실제 시장 업무 완수율 약 30%
SkillGate 어떤 스킬을 읽을지 고르는 행위를 학습. 40.8% → 53.2%
RTPO 뒤에서부터 각 턴을 결과와 연결
FM-Bench 축구 구단 20시즌 운영. 수백 번의 의사결정
Beyond the Transcript 은닉 상태를 통한 담합 탐지
Eureka: Task-Conditioned Meta-Agent Orchestration 작업마다 에이전트 조직 자체를 생성·수정

8월 20~21일 공개

논문 한 줄
EnvHarness 환경이 에이전트의 약점에 맞춰 진화한다
AI4AI-Bench 학습 알고리즘 자체를 개선하라. 최고 점수 0.250
Task-CoEvolve 후보들이 갈리는 문제만 평가. 평가 횟수 80% 감소
ReguSim 규칙을 이해했다고 말하는 것과 지키는 것은 다르다
RGA-Designer 통신 그래프를 희소하게. 토큰 20.5% 감소
MemTrapBench 정확한 기억도 추론을 망칠 수 있다
PolicyGuide 정책을 워크플로 그래프로 컴파일. 0.42 → 0.62
SWE-bench Science 실제 과학 코드베이스에서의 코딩 에이전트
Don't Solve, Just Compare 작은 모델은 풀지 말고 비교만 하게 한다
AUSO 스킬을 배우고, 내재화하고, 필요할 때만 꺼낸다
CRATE 각 행동 전후로 화면이 무엇이 바뀌었는지 평가
CAS: Conformalized Agentic Search 질문마다 필요한 검색 결과 수를 동적으로

8월 24일 공개

논문 한 줄
Apodex 1.1 상태 유지·실패 복구·병렬 협업을 전면에 둔 시스템
Prime Agent: A Self-Improving RLM Harness 같은 모델도 하네스가 다르면 다른 에이전트다. 30% → 95.5%
MobilePA-Bench 212개 모바일 도구를 쓰는 계획 에이전트 평가
AutoSaddler 실패를 영구적인 하네스 개선으로 축적. +9.0~10.0%p
Agent-G2 얼마만큼의 정답 앞부분을 보여줄지 동적으로 선택