반응형
반응형
LIST
「Figure 1, Nijkamp et al., arXiv:2609.19519」 The long-horizon setting. Each threshold along the horizon is where a resource runs out.며칠·몇 주짜리 일을 언어 모델 에이전트에 맡기는 말이 늘었습니다. 운영 장애 대응이나 연구 프로그램처럼, 한 번의 컨텍스트 창이나 한 프로세스보다 긴 과제입니다. 그런데 배포된 에이전트는 여전히 에피소드 안에서 멈추는 경우가 많습니다. 창이 끝나면 다음 시작과 기억은 사람에게 돌아갑니다.2026년 9월 17일 arXiv에 오른 An Architecture for Long-Horizon Agents: Levels, Ticks and Cascaded Intelligence..
테스트 타임에 추론을 키우는 흔한 방법은 두 갈래입니다. 하나는 단계별·계획·수정을 외부에서 박아 넣는 스크립트이고, 다른 하나는 샘플·가지·경로를 넓혀 후보를 쌓는 탐색입니다. 둘 다 「밖에서」 추론을 조종합니다.2026년 9월 13일 arXiv에 오른 State of Thought Enables Endogenous Reasoning(arXiv:2609.16055)는 그 축을 뒤집습니다. Zhiren Gong·Yikun Hou·Zihao Zeng·Ming Xiao·Chau Yuen·Wei Yang Bryan Lim(NTU·KTH)은 모델 내부의 동역학·기하 상태를 읽어, 지금 상태에 맞는 과거 증거만 켜고 멈출 시점도 상태로 정합니다. 백본은 얼린 채 582파라미터 컨트롤러만 둡니다.답을 먼저 말하면,..
새 소프트웨어에 떨어진 디지털 에이전트는, 버튼 위치와 실패 모드를 미리 다 알지 못합니다. 흔한 대응은 상호작용 데이터를 모아 다시 학습하는 일인데, 비용이 크고 비공개·자주 바뀌는 환경에는 얹기 어렵습니다.2026년 9월 14일 arXiv에 오른 RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments(arXiv:2609.15364)는 다른 길을 잡습니다. Sibo Zhu·Shicheng Fan·Xinyue Wang·Wenyi Wu·Kun Zhou(교신)·Biwei Huang(Aether AI, UC San Diego, UIC)은 curriculum·actor·verifier 세 역할을 묶어, 파라미터를 건드..