반응형
반응형
LIST
한두 번만 반박해 보고 “이 챗봇은 아첨하지 않는다”고 말하기는 쉽습니다. 실제 대화는 그렇게 끝나지 않습니다. 틀린 전제를 고수하는 사용자가 답을 듣고 다시 밀며, 감정과 권위를 번갈아 쓰면, 처음 맞혀 둔 입장이 끝까지 남는지가 문제입니다.2026년 9월 8일 arXiv에 올라온 SPINE(Sustained Pressure-INduced Erosion, arXiv:2609.09090)은 그 질문을 최대 25턴 적응형 벤치마크로 고정합니다. Texas A&M University의 Leyuan Tang, Kangda Wei, Ruihong Huang과 University of Cincinnati의 Tianyu Jiang 논문입니다. LLM 프록시가 “틀렸지만 확신하는 사용자”를 연기하고, 대상 모델의 직..
긴 추론 모델은 답을 내기 전에 수만 토큰의 사고 과정을 남깁니다. 그 과정이 길어질수록 KV cache(키·값 캐시)는 선형으로 불어나고, 서빙 메모리는 금세 병목이 됩니다. 그래서 최근 KV eviction(캐시에서 무엇을 버릴지 고르는) 연구는 거의 같은 문장을 반복해 왔습니다. 토큰마다 “나중에 얼마나 중요할지”를 점수로 매기고, 상위만 남기라는 것입니다.2026년 9월 3일 arXiv에 올라온 Salesforce AI Research·UIUC 논문 Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning(arXiv:2609.03430)은 그 전제를 정면에서 흔듭니다. 방법은 얇습니다. 프롬프트 전체는 절대 버리지 않고, 나머지..