← 처음으로
논문
읽은 논문의 요점과, 그것이 실제 업무 사용을 무엇으로 바꾸는가. 논문 자체보다 "그래서 내일 뭘 다르게 할 것인가"를 적는다.
- 읽고 정리 · 2026-08-26 확인2026년 8월 에이전틱 AI 논문 — 한 달 흐름 정리7월 30일부터 8월 24일까지 arXiv에 올라온 에이전트 논문 약 60편을 주제별로 묶었다. 결론부터 말하면, 경쟁 단위가 모델 하나에서 실행 시스템 전체로 넘어갔다.
- 읽고 정리 · 2026-08-26 확인그 점수를 얼마나 믿을 것인가 — 에이전트 평가와 거품 판별실패 판정의 15.3%가 오판이었고, 실제 시장 업무를 끝까지 해내는 비율은 가장 강한 모델도 약 30%였다. 발표되는 숫자와 실제 능력 사이의 간격을 다룬 논문들.
- 읽고 정리 · 2026-08-26 확인에이전트는 실수한다 — 없애는 대신 되돌리는 쪽으로8월 논문의 가장 뚜렷한 흐름. 실수하지 않는 에이전트를 만드는 대신, 실수해도 시스템이 망가지지 않게 만든다. 체크포인트·되감기·트랜잭션·예행연습.
- 읽고 정리 · 2026-08-26 확인하네스 — 성능은 모델이 아니라 실행 구조에서 나온다같은 모델이라도 하네스가 다르면 사실상 다른 에이전트다. 8월 논문들은 하네스를 고치고, 자동으로 개선하고, 그 안에서 학습시키는 데까지 갔다.
- 읽고 정리 · 2026-08-26 확인에이전트 메모리 — 많이 기억하기보다, 언제 꺼내고 언제 무시할까기억을 잘 저장하고 잘 검색하면 좋아진다는 가정이 8월에 여러 방향에서 깨졌다. 정확한 기억도 판단을 망칠 수 있고, 요약 압축은 날짜부터 잃는다.
- 읽고 정리 · 2026-08-26 확인멀티에이전트 — 여러 개 붙인다고 안전해지지 않는다같은 모델 둘을 연결했더니 실패의 90%가 함께 발생했다. 8월 논문들은 에이전트 수를 늘리는 대신 누가 언제 누구와 정보를 주고받을지를 제한하는 쪽으로 갔다.
- 읽고 정리 · 2026-08-26 확인안전과 통제 — 이해했다고 말하는 것과 실제로 안 하는 것은 다르다위험을 90% 이상 인식하고도 실제 공격 행동을 막지 못한 에이전트가 있었다. 8월 논문들은 안전을 모델 정렬이 아니라 시스템 보안 문제로 다루기 시작했다.
- 읽고 정리 · 2026-08-26 확인스킬과 도구를 더 붙이면 좋아지는가 — 대체로 아니었다지침을 늘리면 강해질 것 같지만 8월 논문들은 반대 결과를 냈다. 문제가 된 건 엉뚱한 스킬이 아니라 겉보기에 관련 있어 보이는 스킬이었다.
- 읽고 정리 · 2026-08-26 확인학습 — 100단계 중 어느 행동이 잘한 것인가장기 에이전트를 훈련시킬 때 가장 어려운 문제는 성공/실패 하나로는 어느 단계가 기여했는지 알 수 없다는 것이다. 8월에 이 문제를 정면으로 다룬 논문이 여럿 나왔다.