RULER: 당신의 Long-Context 언어 모델, 실제 Context 크기는 얼마인가?
📏

RULER: 당신의 Long-Context 언어 모델, 실제 Context 크기는 얼마인가?

Tags
NLP
Test-time Scaling
LLM Reasoning
Computer Science
Published
August 5, 2026
Author

초록 (Abstract)

건초더미에서 바늘 찾기(needle-in-a-haystack, NIAH) 테스트는 긴 방해 텍스트(“haystack”) 속에 숨은 한 조각의 정보(“needle”)를 찾아내는 능력을 살펴본다. 이 테스트는 long-context 언어 모델(LM)을 평가하는 방법으로 널리 쓰여 왔다. 하지만 이렇게 단순히 검색만 시키는 방식으로는 long-context 이해력의 겉면밖에 보지 못한다. 우리는 long-context LM을 좀 더 촘촘하게 평가하기 위해, 시퀀스 길이와 과제 난이도를 원하는 대로 맞출 수 있는 새로운 합성(synthetic) 벤치마크 RULER를 만들었다. RULER는 기존 NIAH 테스트를 확장해, needle의 종류와 개수를 다양하게 바꾼 변형들을 아우른다. 나아가 문맥에서 무언가를 찾는(searching) 것 이상의 행동을 검증하기 위해 multi-hop tracing과 aggregation이라는 새로운 과제 범주를 도입했다. 우리는 RULER의 대표 과제 13개로 long-context LM 17종을 평가했다. 기본 NIAH 테스트에서는 거의 완벽한 정확도를 내지만, 문맥이 길어지면 대부분의 모델은 성능이 크게 떨어졌다. 이 모델들은 하나같이 32K 토큰 이상의 context 크기를 표방하지만, 32K 길이에서 만족스러운 성능을 지켜낸 모델은 절반뿐이었다. context 길이를 200K까지 지원하는 Yi-34B를 분석해 보니, 입력을 길게 하고 과제를 어렵게 만들수록 개선의 여지가 크다는 점이 드러났다. long-context LM을 폭넓게 평가하는 연구를 북돋우고자 RULER를 오픈소스로 공개한다.

1. 서론 (Introduction)

AI 시스템 엔지니어링(Dao et al., 2022; Jacobs et al., 2023; Fu et al., 2024)과 언어 모델 설계(Chen et al., 2023; Xiong et al., 2023)가 최근 크게 발전하면서 언어 모델의 context 길이를 효율적으로 늘리는 일이 가능해졌다(Liu et al., 2024a; Young et al., 2024). 그동안 여러 연구(AI21, 2024; X.AI, 2024; Reid et al., 2024; Anthropic, 2024)는 long-context LM을 평가할 때 passkey retrieval(Mohtashami & Jaggi, 2023)이나 needle-in-a-haystack(Kamradt, 2023) 같은 합성 과제를 흔히 써 왔다. 그러나 이런 평가는 연구마다 기준이 제각각인 데다, 검색 능력만 드러낼 뿐 long-context 이해의 다른 면모는 짚어 내지 못한다.
이 연구에서 우리는 언어 모델의 long-context 모델링 능력을 평가하는 새 벤치마크 RULER를 제안한다. RULER는 단순 검색을 넘어서는 행동(Ribeiro et al., 2020)을 검증하기 위해 네 가지 과제 범주를 담는다.
  1. Retrieval(검색): needle-in-a-haystack(Kamradt, 2023, NIAH) 테스트를 확장해, needle의 종류와 개수를 다양하게 바꿔 가며 검색 능력을 평가한다.
  1. Multi-hop Tracing(다중 홉 추적): coreference chain 해소를 본뜬 최소 과제 variable tracking을 제안한다. 여러 단계로 연결된 개체(entity)를 추적하는 행동을 확인한다.
  1. Aggregation(집계): 요약을 본뜬 과제 common/frequent words extraction을 제안한다. 넓은 범위에 걸쳐 흩어진 관련 정보를 모아 내는 능력을 확인한다.
  1. Question Answering(질의응답): 기존 short-context QA 데이터셋의 입력에 방해 정보를 섞어, 여러 context 크기에서 질의응답 능력을 평가한다.
기존의 현실형(realistic) 벤치마크(Table 1)와 견주면, RULER는 오로지 합성 과제로만 이루어져 있어 시퀀스 길이와 과제 난이도를 자유롭게 조절할 수 있다. RULER의 합성 입력은 parametric knowledge 의존을 줄이는데, 이 parametric knowledge는 현실형 과제에서 long-context 입력을 제대로 활용하지 못하게 방해하는 요인이다(Shaham et al., 2023; Bai et al., 2023).
우리는 RULER로 Gemini-1.5(Reid et al., 2024), GPT-4(OpenAI: Josh Achiam et al., 2023), 그리고 4k부터 128k까지의 context 길이를 지원하는 오픈소스 모델 15종을 평가했다. 기본 NIAH 테스트에서는 거의 완벽한 성능을 보이지만, RULER의 더 복잡한 과제에서는 시퀀스 길이가 길어질수록 거의 모든 모델이 크게 무너졌다. 모델들은 모두 32k 이상의 context 크기를 표방하지만, 우리 결과로는 정성적 기준선을 넘겨 32k 길이를 실제로 감당한 모델은 절반뿐이었다. 게다가 거의 모든 모델이 표방한 context 길이에 이르기 전에 이미 기준선 아래로 떨어졌다. 모델을 세밀하게 비교하기 위해, 우리는 4k부터 128k까지의 성능을, 실제 사용에서 나타나는 길이 분포를 흉내 낸 가중치로 평균 냈다. 상위 두 모델인 Gemini-1.5와 GPT-4는 가중 방식과 무관하게 다른 모델들을 꾸준히 앞섰다.
우리는 context 길이 200K를 표방하며 오픈소스 모델 가운데 RULER에서 제법 좋은 성능을 낸 Yi-34B를 좀 더 파고들었다. 그 결과, 입력 길이와 과제 난이도를 키울수록 Yi의 성능은 크게 떨어졌다. context가 커지면 Yi-34B는 답을 절반만 내놓거나 관련 정보를 정확히 짚어 내지 못하는 일이 잦았다. 나아가 context 크기가 커질 때 여러 모델에서 공통으로 나타나는 두 가지 행동을 관찰했다. 하나는 parametric knowledge에 더 기대는 것이고, 다른 하나는 검색이 아닌 과제에서도 문맥을 그대로 베껴 쓰려는 경향이다. 추가 ablation에서는, 더 긴 시퀀스로 학습한다고 해서 RULER 성능이 늘 좋아지지는 않는다는 점, 그리고 모델 크기가 클수록 long-context 능력과 양의 상관을 보인다는 점을 확인했다. 끝으로, RWKV나 Mamba 같은 non-Transformer 구조는 RULER에서 여전히 Transformer에 크게 뒤처진다는 것도 보였다.
우리 기여를 정리하면 다음과 같다.
  • 유연한 설정이 가능한 합성 과제로 long-context 언어 모델을 평가하는 새 벤치마크 RULER를 제안한다.
  • 긴 문맥에서 단순 검색이 아닌 다른 행동을 검증하기 위해, 특히 multi-hop tracing과 aggregation이라는 새 과제 범주를 도입한다.
  • RULER로 long-context LM 17종을 평가하고, 모델별·과제 난이도별로 분석한다.
long-context 언어 모델에 대한 후속 연구를 북돋우고자 RULER를 오픈소스로 공개한다.
Table 1. 기존 long-context 벤치마크와 RULER의 비교. “realistic”은 사람이 주석을 단 유형, “synthetic”은 자동 생성 유형을 가리킨다. RULER는 검색을 넘어 다양한 과제 도메인을 포함하고, 합성 입력으로 parametric knowledge 의존을 줄이며, 시퀀스 길이와 과제 난이도에 맞춰 문맥을 조절할 수 있게 한다. RULER에서는 관련 정보와 방해 정보의 양·위치를 바꿔 문맥을 조정한다.
벤치마크 & 과제
평균 길이
유형
다양한 과제
최소 Parametric Knowledge
문맥 조절 가능
ZeroSCROLLS
~10k
realistic
✓
✗
✗
L-Eval
~8k
realistic
✓
✗
✗
BAMBOO
~16k
realistic
✓
✗
✗
LongBench
~8k
hybrid
✓
✗
✗
LooGLE
~20k
hybrid
✓
✗
✗
InfiniteBench
~200k
hybrid
✓
✗
✗
Needle-in-a-haystack (NIAH)
any
synthetic
✗
✓
✓
Passkey / Line / KV Retrieval
any
synthetic
✗
✓
✓
RULER (Ours)
any
synthetic
✓
✓
✓

2. 관련 연구 (Related Work)

Long-context 언어 모델. long-context 언어 모델은 공학·구조·알고리즘 측면의 발전에 힘입어 최근 여럿 등장했다. Flash attention(Dao et al., 2022; Dao, 2023)과 Ring attention(Liu et al., 2023)은 긴 문맥을 처리하는 데 드는 메모리 부담을 크게 줄였다. shifted sparse attention(Chen et al., 2024), dilated attention(Ding et al., 2023), attention sink(Han et al., 2023; Xiao et al., 2024b) 같은 다양한 sparse attention 기법(Child et al., 2019; Jaszczur et al., 2021)도 효율적인 context 확장에 쓰였다. Transformer의 길이 외삽(length extrapolation)을 개선하려는 새로운 위치 임베딩도 여럿 제안됐다(Vaswani et al., 2017). ALiBi(Press et al., 2022), xPOS(Sun et al., 2023b), 그리고 RoPE(Su et al., 2023) 변형들(Chen et al., 2023; Xiong et al., 2023; Peng et al., 2024; Liu et al., 2024b; Ding et al., 2024; Zhu et al., 2024)이 여기에 해당한다. 또 다른 갈래는 context 크기 자체를 줄이는 데 초점을 맞춘다. recurrence 메커니즘으로 이전 문맥을 캐싱하거나(Zhang et al., 2024a; Bulatov et al., 2023; Martins et al., 2022; Wu et al., 2022), 문맥에서 관련 정보를 검색해 오거나(Xu et al., 2024a; Mohtashami & Jaggi, 2023; Wang et al., 2024; Tworkowski et al., 2024; Xiao et al., 2024a), 압축으로 핵심 정보만 보존하는(Jiang et al., 2023) 방식이 있다. 끝으로 Mamba(Gu & Dao, 2023)나 RWKV(Peng et al., 2023)처럼 long-context 입력을 효율적으로 다루기 위한 새로운 구조(Gu et al., 2022; Fu et al., 2023a; Poli et al., 2023; Fu et al., 2023b; Sun et al., 2023a; Beck et al., 2024; Sun et al., 2024)도 제안됐다.
Long-context 벤치마크와 과제. 우리 연구는 long-context 언어 모델을 벤치마킹하는 다른 연구들과 밀접하다. ZeroSCROLLS(Shaham et al., 2023)는 긴 문서 QA나 (질의 기반) 요약 같은 현실형 자연어 과제 열 가지를 다룬다. L-Eval(An et al., 2024) 역시 현실형 데이터를 쓰되, 품질을 담보하기 위해 사람이 직접 걸러 냈다. LongBench(Bai et al., 2023)는 이중 언어 환경의 과제를 담는다. InfiniteBench(Zhang et al., 2024b)는 길이가 100K 토큰을 넘는 과제를 포함한다. LTM(Castillo et al., 2024)은 장기 대화 평가를 겨냥한다. parametric knowledge의 영향을 떼어 내기 위해, 이전 연구들(Dong et al., 2023; Li et al., 2023b)은 특정 시점 이후에 올라온 문서를 쓰거나(Tanzer et al., 2024) 극도로 자료가 적은 언어를 활용하자고 제안하기도 했다. 현실형 벤치마크와 견주면, 합성 과제는 설정(예: 시퀀스 길이, 과제 난이도)을 더 유연하게 조절할 수 있고 parametric knowledge의 영향도 덜 받는다. 최근 연구는 주로 검색 기반 합성 과제에 집중해 왔지만(Kamradt, 2023; Mohtashami & Jaggi, 2023; Li et al., 2023a; Liu et al., 2024d; Lee et al., 2024), 사실 추론(Kuratov et al., 2024; Karpinska et al., 2024), 장거리 담화 모델링(Sun et al., 2022), 질의응답(Levy et al., 2024; Yuan et al., 2024), many-shot in-context learning(Agarwal et al., 2024; Bertsch et al., 2024; Xu et al., 2024b), 코드 이해(Liu et al., 2024c) 등 다른 측면을 파고든 연구도 일부 있다.

3. RULER 벤치마크 (The RULER Benchmark)

RULER는 네 범주에 걸친 과제로 이루어진다. retrieval, multi-hop tracing, aggregation, question answering이다. RULER의 평가 예제는 입력 설정(Table 2 참조)에 따라 자동으로 생성되며, 이 설정이 각 입력의 길이와 난이도를 정한다. RULER처럼 제한된 도메인 안에서는, 과제 난이도를 목표 출력 토큰 수와 문맥의 신호 대 잡음비(signal-to-noise ratio)의 함수로 볼 수 있다. long-context 언어 모델의 평가 과제 설계에 관한 더 폭넓은 논의는 Goldman et al. (2024)를 참고하기 바란다.

3.1 Retrieval: Needle-in-a-haystack (NIAH)

최근 연구들(Reid et al., 2024; Anthropic, 2023)은 long-context 모델링 능력을 평가할 때 needle-in-a-haystack(Kamradt, 2023, NIAH) 테스트를 흔히 쓴다. NIAH 테스트는 널리 연구된 associative recall 과제(Hopfield, 1982; Graves et al., 2014; Olsson et al., 2022; Arora et al., 2024)를 떠올리게 하는데, 충분한 질의가 주어졌을 때 문맥에서 관련 정보를 검색해 오는 과제다. RULER에는 검색 기반 과제를 여럿 넣어, 기본 NIAH 테스트를 세 가지 기준으로 확장했다. 검색 능력은 (1) “needle”과 “haystack”의 종류에 구애받지 않아야 하고(agnostic), (2) 어려운 방해 요소(hard distractor)를 무시할 만큼 튼튼해야 하며, (3) 여러 항목을 찾아야 할 때 높은 recall을 유지해야 한다. 이 기준을 바탕으로 NIAH 과제 네 가지를 만들었다. 각 과제에서 “needle”은 “haystack”(긴 방해 텍스트) 속에 끼워 넣은 key-value 쌍이다. query는 시퀀스 끝에 놓여, 문맥 속 key를 맞춰 찾은 뒤 그에 딸린 value를 끄집어내게 하는 단서 역할을 한다.
  • Single NIAH (S-NIAH): 기본 NIAH 테스트로, 단 하나의 “needle”을 “haystack”에서 찾아내야 한다. query/key/value는 단어, 숫자(7자리), UUID(32자리) 형태를 취할 수 있다. “haystack”은 반복되는 잡음 문장이거나 Paul Graham 에세이(Kamradt, 2023)일 수 있다.
  • Multi-keys NIAH (MK-NIAH): 여러 개의 “needle”을 “haystack”에 넣되, 그중 하나만 찾으면 된다. 나머지 “needle”은 어려운 방해 요소다. 가장 까다로운 설정은 “haystack” 전체를 방해용 needle로 채운 버전이다.
  • Multi-values NIAH (MV-NIAH): 같은 key를 공유하는 여러 “needle”을 “haystack”에 넣는다. 그 key에 딸린 value를 모두 찾아야 한다.
  • Multi-queries NIAH (MQ-NIAH): 여러 “needle”을 “haystack”에 넣는다. 서로 다른 key를 가진 모든 “needle”을 찾아야 한다. 이는 Arora et al. (2024)이 쓴 multi-query associative recall 과제와 같은 설정이다. MV-NIAH와 함께, 이 두 과제는 핵심 정보를 빠뜨리지 않고 검색하는지를 평가한다.

3.2 Multi-hop Tracing: Variable Tracking (VT)

담화를 제대로 이해하려면(van Dijk & Kintsch, 1983) 새로 언급된 개체를 알아차리고 긴 문맥 전반에 걸쳐 같은 개체를 가리키는 참조 사슬(chain of references)을 세울 수 있어야 한다(Karttunen, 1969). 우리는 최소 형태의 coreference chain 해소(Ng, 2010) 과제를 본떠 variable tracking이라는 새 과제를 만들었다. 이 과제는 관련된 동시 출현(co-occurrence) 패턴을 추적하고 긴 입력 안에서 건너뛴 연결을 이어 붙이는 행동을 확인한다. 구체적으로, 변수 X1을 값 V로 초기화한 뒤, 변수 이름 바인딩 문장(예: X2 = X1, X3 = X2, …)을 선형 chain으로 이어 붙여 입력 곳곳에 흩어 놓는다. 목표는 같은 값 V를 가리키는 모든 변수 이름을 되돌려 주는 것이다. 홉(hop, 이름 바인딩 횟수)을 늘리거나 chain을 늘리면 과제가 어려워지는데, 이는 MK-NIAH에서 어려운 방해 요소를 늘리는 것과 비슷하다.

3.3 Aggregation: Common Words (CWE)와 Frequent Words Extraction (FWE)

RULER에는 요약 과제를 대신할 새 범주를 넣었다. 관련 정보가 문맥에서 훨씬 큰 부분을 차지하고 목표 출력이 그 관련 입력을 정확히 집계(aggregate)하는 데 달려 있는 과제다. 구체적으로는, 미리 정한 (합성) 단어 목록에서 단어를 뽑아 입력 시퀀스를 만든다. common word extraction(CWE) 과제에서는 이산 균등분포(discrete uniform distribution)에서 단어를 뽑는데, common word 수는 고정하고 uncommon word 수만 시퀀스 길이에 따라 늘린다. frequent words extraction(FWE) 과제에서는 Zeta 분포에서 단어를 뽑는다. Figure 1은 이렇게 만든 입력의 단어 빈도를 그림으로 보여 준다. 모델은 문맥에서 상위 K개 빈출 단어를 되돌려 줘야 한다. CWE에서 K는 common word 수와 같다. FWE에서는 K를 3으로 두는데, K를 키우면 대부분의 모델이 작은 context 크기에서도 성능이 나빠지기 때문이다. common word 수나 Zeta 분포의 파라미터를 바꿔 과제 난이도를 조절할 수 있다.
Figure 1
Figure 1
Figure 1 aggregation 과제에서는 위 두 분포를 따라 어휘에서 단어를 뽑는다. common words extraction(CWE)은 균등분포에서 뽑는다. frequent words extraction(FWE)에서는 각 단어의 빈도가 어휘 안 순위(rank)와 Zeta 분포의 파라미터 α로 정해진다.
📊 그림 해설 — 집계 과제의 “난이도 손잡이”를 시각화 이 그림은 aggregation 과제 입력을 만드는 두 가지 단어 빈도 분포를 보여 준다. - 왼쪽(CWE): common word는 빈도 30으로 높게 고정, uncommon word는 3으로 낮게 깔린 계단 모양이다. 모델은 이 중 빈도가 높은 common word들만 골라내야 한다. - 오른쪽(FWE): 단어 빈도와 순위가 로그-로그 축에서 직선(Zipf 법칙)을 이룬다. α가 작아질수록 기울기가 완만해져 상위 빈출 단어와 나머지의 빈도 차이가 줄고, 그만큼 구별이 어려워진다.
의미: RULER가 내세우는 “설정 가능성(controllability)”의 실체를 aggregation 과제에서 구체화한 그림이다. α나 common word 개수라는 손잡이 하나로 목표 신호가 잡음 위로 얼마나 도드라지는지를 조절할 수 있음을 보여 준다. 검색과 달리, 집계는 정답이 특정 위치에 있지 않고 문맥 전체에 흩어져 있어 난이도 조절의 축이 다르다는 점이 핵심이다.

3.4 Question Answering (QA)

기존 QA 데이터셋(Rajpurkar et al., 2018; Yang et al., 2018; Trivedi et al., 2022)은 대부분 짧은 지문에 대한 질문에 답하도록 설계됐다. 이런 데이터셋은 방해 정보를 덧붙여 long-context 입력을 흉내 내도록 확장할 수 있다. 이 과제 범주에서는, 정답을 담은 문단(golden paragraph)을 같은 데이터셋에서 무작위로 뽑은 다른 문단들 사이에 무작위로 끼워 넣는다. 이 범주는 NIAH를 현실에 맞춰 각색한 것(Ivgi et al., 2023)으로 볼 수 있다. 질문이 query 역할을, golden paragraph가 “needle” 역할을, 방해 문단들이 “haystack” 역할을 한다.
Table 2. RULER의 유연한 설정을 활용한 과제 예시. 아래 예시에서 색으로 구분되던 요소를 표기로 대신한다 — query(질의), key(키), value(값), distractor(방해 요소). (원 논문은 색상으로 구분)
과제
설정
예시
Single NIAH (S-NIAH)
type_key=word, type_value=number, type_haystack=essay
(에세이) …… One of the special magic numbers for long-context is: 12345. …… What is the special magic number for long-context …? → 정답: 12345
Multi-keys NIAH (MK-NIAH)
num_keys=2
…… numbers for long-context is: 12345. …… numbers for large-model is: 54321. …… … for long-context …? → 정답: 12345
Multi-values NIAH (MV-NIAH)
num_values=2
…… for long-context is: 12345. …… for long-context is: 54321. …… What are all the … numbers for long-context …? → 정답: 12345 54321
Multi-queries NIAH (MQ-NIAH)
num_queries=2
…… long-context is: 12345. …… large-model is: 54321. …… … for long-context and large-model …? → 정답: 12345 54321
Variable Tracking (VT)
num_chains=2, num_hops=2
(잡음) VAR X1 = 12345 …… VAR Y1 = 54321 …… VAR X2 = X1 …… VAR Y2 = Y1 …… Find all variables assigned the value 12345. → 정답: X1 X2 X3
Common Words Extraction (CWE)
freq_cw=2, freq_ucw=1, num_cw=10
aaa ccc bbb aaa ddd eee ccc fff ggg hhh iii iii …… What are the 10 most common words …? → 정답: aaa ccc iii …
Frequent Words Extraction (FWE)
α=2
aaa bbb ccc aaa ddd eee ccc fff ggg aaa …… What are the 3 most frequently appeared words …? → 정답: aaa ccc iii
Question Answering (QA)
dataset=SQuAD
Document 1: … aaa … Document 2: … bbb … Document 3: … ccc … Question: {question} → 정답: bbb

4. 실험 및 결과 (Experiments & Results)

모델 및 추론 설정. long-context LLM 17종을 골랐다. 오픈소스 모델 15종과 클로즈드소스 모델 2종(Gemini-1.5-Pro, GPT-4)으로, 모델 크기는 7B부터 MoE 구조의 8x22B까지, 표방 context 길이는 32K부터 1M까지 다양하다. 이 모델들에 관한 자세한 정보는 Appendix A에 있다. 모든 모델은 효율적인 KV cache 메모리 관리를 지원하는 LLM 서빙 시스템 vLLM(Kwon et al., 2023)으로 평가했다. 모든 모델의 추론은 NVIDIA A100 GPU 8장에서 BFloat16, greedy decoding으로 돌렸다.
과제 설정. 모든 모델을 RULER 네 범주에서 뽑은, 난이도가 다양한 과제 13개로 테스트했다. 테스트 설정(Appendix B)은 Appendix C에 서술한 과제 상관 분석(task correlational study)을 바탕으로 골랐다. 대부분의 모델이 4K 토큰이라는 짧은 context 크기에서 제법 잘 해내는 과제를 골랐는데, 우리의 주된 관심사가 context 길이가 늘어나도 그 좋은 성능을 유지하는지를 보는 데 있기 때문이다. 각 과제마다 (4K, 8K, 16K, 32K, 64K, 128K) 시리즈의 길이별로 예제 500개씩을 생성해 각 모델을 평가했으며, 이때 각 모델에 필요한 chat template을 따랐다. 모델이 답을 거부하거나 설명을 늘어놓지 못하도록, 과제 입력 뒤에 answer prefix를 붙이고 목표 출력이 있는지를 recall 기반 정확도로 확인했다.
실효 Context 크기(Effective Context Size). RULER에서 입력 길이를 늘리면 모든 모델의 성능이 크게 떨어진다. 한 모델이 실효적으로(effectively) 감당할 수 있는 최대 context 크기를 정하기 위해, 고정된 임계값으로 각 모델을 채점해 평가 길이에서 만족스러운 성능을 냈는지를 통과/실패로 판정했다. 임계값은 Llama2-7b 모델의 4K context 길이 성능을 기준으로 삼았다. Table 3에는 이 임계값을 넘긴 최대 길이를 “effective length”로, 그리고 “claimed length”와 함께 보고한다.
모델 순위 기준. 임계값 기반 채점은 표방 길이와 실효 길이 사이의 괴리를 드러내지만, 모델을 세밀하게 비교하기에는 정보가 부족하다. 그래서 여러 context 크기의 성능을 하나로 모으는 가중 평균 점수를 써서 모델 순위를 매겼다. 두 가지 가중 방식으로 순위를 냈다. 시퀀스 길이에 따라 가중치가 각각 선형으로 커지는 wAvg. (inc)와 작아지는 wAvg. (dec)이다. 이상적으로는 각 길이의 가중치를 실제 모델 사용의 길이 분포로 정해야 하지만, 여기서는 긴 시퀀스(inc) 또는 짧은 시퀀스(dec)가 분포를 지배하는 두 시나리오를 흉내 내는 방식을 골랐다.
주요 결과. Table 3에는 long-context LM 17종의 결과를 Llama2-7B 기준선과 함께 실었다. 특정 길이에서의 성능은 RULER 13개 과제 전체의 평균이다. 클로즈드소스 모델 Gemini-1.5-Pro는 나머지 모델을 큰 폭으로 앞섰고, effective length가 우리가 테스트한 최대 길이보다도 길었다. 이 모델을 더 어려운 버전의 RULER로 압박 테스트(pressure testing)하는 것은 앞으로의 흥미로운 과제다. 나머지 모델들은 passkey retrieval과 기본 NIAH 과제(Appendix E)에서는 거의 완벽한 성능을 보이지만, 시퀀스 길이가 길어지면 RULER에서 하나같이 크게 무너졌고, 표방 길이에서조차 Llama2-7B 기준선을 넘기지 못했다. 상위권 오픈소스 모델들(Llama3.1, Qwen2, Command-R-plus)은 모델 크기가 크고 RoPE(Xiong et al., 2023)에서 더 큰 base frequency를 쓴다는 공통점이 있다. 좋은 long-context 성능을 내는 데 큰 학습 context window가 늘 필요한 것은 아니다. 상위 오픈소스 모델들은 무차별적(brute-force) context 확장(Llama3.1은 128K context 길이로 학습)과 추론 시점의 길이 외삽(Qwen2는 32K context 길이로 학습)을 모두 품고 있다. 성능이 떨어지는 축에는 훨씬 큰 context 크기로 학습한 모델도 있는데, 예컨대 LWM과 GradientAI/Llama3는 둘 다 1M context 길이로 학습했다. LWM은 긴 시퀀스에 더 큰 가중치가 실릴 때(wAvg. inc) Mistral-v0.2보다 높은 순위를 받고 context 크기가 커질 때 성능 하락이 덜하지만, 4K에서조차 Llama2-7B보다 못하다. 이 결과는 짧은 시퀀스에서 내는 절대 성능과 context 크기 확장에 따른 상대적 성능 하락 사이에 트레이드오프가 있음을 시사한다. 모델 크기와 최대 학습 길이에 관한 분석은 6장에서 더 다룬다.
Table 3. 4K~128K 길이에서 평가한 주요 모델의 Long Context 성능(%). 각 점수는 RULER 13개 과제의 정확도 평균이다. effective length는 Llama2-7B의 4K 성능(85.6%)을 임계값으로, 이를 넘긴 최대 길이다. 가중 평균 점수(wAvg.)는 모든 context 크기의 성능을 하나로 모은 값으로, 가중치가 길이에 따라 커지면 (inc), 작아지면 (dec)이다. 괄호 안은 각 모델의 순위. (모델 상세는 Appendix A)
모델
Claimed
Effective
4K
8K
16K
32K
64K
128K
Avg.
wAvg.(inc)
wAvg.(dec)
Llama2 (7B) 기준선
4K
—
—
—
—
—
—
—
85.6
—
—
Gemini-1.5-Pro
1M
>128K
96.7
95.8
96.0
95.9
95.9
94.4
95.8
95.5 (1st)
96.1 (1st)
GPT-4
128K
64K
96.6
96.3
95.2
93.2
87.0
81.2
91.6
89.0 (2nd)
94.1 (2nd)
Llama3.1 (70B)
128K
64K
96.5
95.8
95.4
94.8
88.4
66.6
89.6
85.5 (4th)
93.7 (3rd)
Qwen2 (72B)
128K
32K
96.9
96.1
94.9
94.1
79.8
53.7
85.9
79.6 (9th)
92.3 (4th)
Command-R-plus (104B)
128K
32K
95.6
95.2
94.2
92.0
84.3
63.1
87.4
82.7 (7th)
92.1 (5th)
GLM4 (9B)
1M
64K
94.7
92.8
92.1
89.9
86.7
83.1
89.9
88.0 (3rd)
91.7 (6th)
Llama3.1 (8B)
128K
32K
95.5
93.8
91.6
87.4
84.7
77.0
88.3
85.4 (5th)
91.3 (7th)
GradientAI/Llama3 (70B)
1M
16K
95.1
94.4
90.8
85.4
80.9
72.1
86.5
82.6 (8th)
90.3 (8th)
Mixtral-8x22B (39B/141B)
64K
32K
95.6
94.9
93.4
90.9
84.7
31.7
81.9
73.5 (11th)
90.3 (9th)
Yi (34B)
200K
32K
93.3
92.2
91.3
87.5
83.2
77.3
87.5
84.8 (6th)
90.1 (10th)
Phi3-medium (14B)
128K
32K
93.3
93.2
91.1
86.8
78.6
46.1
81.5
74.8 (10th)
88.3 (11th)
Mistral-v0.2 (7B)
32K
16K
93.6
91.2
87.2
75.4
49.0
13.8
68.4
55.6 (13th)
81.2 (12th)
LWM (7B)
1M
<4K
82.3
78.4
73.7
69.1
68.1
65.0
72.8
69.9 (12th)
75.7 (13th)
DBRX (36B/132B)
32K
8K
95.1
93.8
83.6
63.1
2.4
0.0
56.3
38.0 (14th)
74.7 (14th)
Together (7B)
32K
4K
88.2
81.1
69.4
63.0
0.0
0.0
50.3
33.8 (15th)
66.7 (15th)
LongChat (7B)
32K
<4K
84.7
79.9
70.8
59.3
0.0
0.0
49.1
33.1 (16th)
65.2 (16th)
LongAlpaca (13B)
32K
<4K
60.6
57.0
56.6
43.6
0.0
0.0
36.3
24.7 (17th)
47.9 (17th)
💡 핵심 요지: 모든 모델이 32K 이상을 표방하지만, effective length가 표방 길이에 이르는 모델은 Gemini-1.5-Pro뿐이다. 절반가량은 32K에서 이미 기준선 아래로 떨어진다 — “표방 길이”와 “실제로 쓸 수 있는 길이”의 괴리가 이 표의 메시지다.

5. 과제별 오류 분석 (Task Error Analysis)

과제 설정과 실패 양상이 RULER에서 어떻게 나타나는지 알아보기 위해, Yi-34B-200K를 더 복잡한 과제에서 더 긴 입력 길이(최대 256K)로 평가했다.
“needle” 종류에 약함. Figure 2(왼쪽)를 보면, 표준 passkey retrieval과 기본 NIAH처럼 word-number 쌍을 needle로 쓸 때 Yi는 거의 완벽한 성능을 낸다. 하지만 needle이 다른 형태를 띠면 성능이 떨어진다. 가장 큰 하락은 UUID 검색 과제에서 나타났는데, 입력이 길어지면(>128K) Yi가 32자리를 온전히 되돌려 주지 못하는 경우가 있었다.
방해 요소를 무시하지 못함. Figure 2(가운데-왼쪽)를 보면, 방해용 needle 수를 늘릴수록 성능이 꾸준히 낮아진다. 방해 요소를 극단적으로 채운 버전(#K=FULL)에서 Yi는 256K에서 약 40점이나 떨어졌다. 오류를 뜯어보니, 입력이 길어질 때 Yi는 어려운 방해 요소를 제대로 무시하지 못하고, 방해용 key에 딸린 value를 잘못 검색해 왔다. 극단 버전에서 Yi는 목표 부근의 value를 되돌려 주는 일이 잦았는데, 이는 대략적인 범위는 맞추지만 목표가 잡음과 같은 분포에 섞여 있을 때 key를 정확히 짚어 내지 못한다는 뜻이다.
정보를 일부만 되돌려 줌. 이전 연구들(Liu et al., 2024a; Reid et al., 2024)과 마찬가지로, 긴 입력에서 여러 항목을 검색해야 할 때 성능이 크게 떨어지는 것을 확인했다. 예컨대 query 수를 1에서 8로 늘리면 성능이 약 15점 떨어진다(Figure 2 오른쪽). 같은 key에 딸린 여러 value를 검색해야 할 때(Figure 2 가운데-오른쪽), Yi는 value 전체를 되돌려 주지 못하고 답을 중복해 내놓는 일이 잦았다. 이는 key와 각 value 사이의 연결이 고르지 않다는 것을 시사한다.
문맥을 그대로 베끼려는 경향. 입력 길이를 키우면 Yi는 문맥을 글자 그대로 베끼려는 강한 경향을 보인다. 이 경향은 시퀀스 첫머리에 in-context 예시(demonstration)를 하나 넣는 variable tracking(VT)과 common words extraction(CWE)에서 특히 두드러진다. 128K에서 Yi의 CWE 출력 중 80% 이상이 그 one-shot 예시를 그대로 베낀 문자열이었던 반면, 짧은 시퀀스에서는 이런 베끼기가 나타나지 않았다.1 이 베끼기 행동은 LWM과 LongAlpaca에서도 보였으나, Mixtral 같은 다른 모델에서는 덜했다. 이 발견은, 긴 입력이 주어졌을 때 검색 이외의 행동을 검증해야 할 필요성을 다시 한번 뒷받침한다.
문맥 안에서의 추적이 불안정함. variable tracking 과제에서는 chain을 늘리는 것과 hop을 늘리는 것 모두 Yi의 성능을 크게 떨어뜨렸다. Yi는 context 크기가 커질 때 hop이 많은 설정에서 꾸준히 성능이 나빠졌고(Figure 3 왼쪽), chain이 많은 설정에서는 128K를 넘는 길이에서 하락이 가장 두드러졌다(Figure 3 가운데-왼쪽). 앞서 말한 베끼기 문제 말고도, Yi는 빈 문자열을 잘못 내놓거나 다른 chain의 변수를 되돌려 주는 오류를 냈다. 이는 긴 문맥에서 같은 개체를 안정적으로 추적하는 능력이 부족하다는 뜻이다. 이런 오류는 베끼기 행동을 보이지 않는 모델에서도 자주 관찰됐다.
Figure 2
Figure 2
Figure 2
Figure 2. needle-in-a-haystack(NIAH) 과제에서 Yi-34B의 성능. 기본 설정은 key-value로 word-number 쌍을, haystack으로 Paul Graham 에세이를 쓴다. Yi는 needle 종류가 바뀌면 취약하고, 방해 요소가 늘면 성능이 떨어진다. (W: words; N: numbers; U: UUIDs; Full: entire haystack)
📊 그림 해설 — 200K 모델도 needle을 바꾸면 무너진다 시퀀스 길이(4k→256K)에 따른 정확도를 네 과제로 나눠 보여 준다. - S-NIAH(왼쪽): value가 UUID(K=U, V=U)일 때 하락이 가장 크다. 단순 passkey/기본 NIAH는 거의 만점이지만, needle 형태만 바꿔도 흔들린다. - MK-NIAH(가운데-왼쪽): 방해용 key(#K)를 4→8→FULL로 늘리면 급격히 떨어지고, 극단(#K=FULL, K=U, V=U)에서는 256K에서 40점 가까이 무너진다. - MV-NIAH / MQ-NIAH(오른쪽 둘): 찾아야 할 value(#V)나 query(#Q)가 늘수록 recall이 낮아진다.
의미: 기본 passkey 테스트에서 만점을 받는 200K 모델조차 needle 종류를 바꾸거나 방해 요소를 더하면 성능이 급락한다. 이는 기존 NIAH가 모델 능력을 과대평가한다는 논문의 문제의식을 뒷받침하며, RULER가 검색 과제를 여러 변형으로 확장한 이유를 그대로 보여 준다.
정확하게 집계하지 못함. aggregation 과제에서 흔한 실패 양상 두 가지를 관찰했다. parametric knowledge를 잘못 쓰는 것과 부정확한 집계다. CWE 과제에서 베끼기 문제를 보이지 않는 모델도, 때로는 문맥 정보를 무시하고 parametric knowledge로 답하는데, 특히 context 크기가 클 때 그렇다. 예컨대 Mistral(7b-instruct-v0.2)은 문맥 속 단어를 세지 않고 “the”, “an”, “a” 같은 고빈도 단어를 출력한다. 베끼기 문제가 덜한 FWE 과제에서는, Zeta 분포의 α를 낮출수록 Yi가 상위 빈출 단어를 제대로 내놓지 못했다(Figure 3 가운데-오른쪽). α를 낮추면 단어 간 빈도 차이가 줄어들어, 상위 빈출 단어를 구별하기가 더 어려워진다.
long-context QA에서 잦은 hallucination. QA 과제에서는, 방해 문단으로 문맥을 늘릴수록 Yi의 성능이 무맥락(no-context) 기준선에 가까워졌다(Figure 3 오른쪽). 이 하락은 주로 hallucination과 문맥 정보 의존도 저하에서 비롯된다. context 크기가 클 때 모델의 예측이 질문과 무관해지고, 무맥락 기준선의 답과 겹치는 경우가 있었다. QA 과제의 전반적으로 낮은 성능은, 긴 문맥에서 query와 관련 문단을 흐릿하게(fuzzy) 매칭하는 일이, key를 문맥에서 정확히 짚어 낼 수 있는 단순한 NIAH 테스트보다 더 어려운 설정임을 확인해 준다.
Figure 3
Figure 3
Figure 3
Figure 3. variable tracking(VT), frequent words extraction(FWE), QA 과제에서 서로 다른 난이도에 따른 Yi-34B의 성능. Yi는 이 비검색 과제들에서 context 크기가 커질 때 큰 폭의 하락과 서로 다른 추세를 보인다. 이는 문맥에서 검색하는 데 그치지 않고 그 너머의 행동까지 평가해야 함을 보여 준다.
📊 그림 해설 — 검색이 아닌 과제에서 드러나는 실패 네 패널은 각각 다른 난이도 축을 다룬다. - VT(왼쪽, hop 증가 / 가운데-왼쪽, chain 증가): hop이나 chain을 늘리면 특히 128K 이상에서 급격히 무너진다. 같은 개체를 긴 문맥에서 안정적으로 추적하지 못한다. - FWE(가운데-오른쪽): α를 낮출수록(단어 빈도 차가 줄수록) 상위 빈출 단어를 제대로 집계하지 못한다. - QA(오른쪽): 문맥을 늘릴수록 성능이 무맥락(no-context) 기준선(점선)에 가까워진다 — 즉 hallucination이 늘고 문맥 의존도가 떨어진다.
의미: multi-hop tracing과 aggregation은 검색만으로는 보이지 않던 실패 양상을 드러낸다. 검색 과제(Figure 2)보다 훨씬 가파르게 무너진다는 점이, “검색 이외의 행동을 평가해야 한다”는 이 논문의 핵심 주장을 뒷받침한다.

6. 모델 분석 (Model Analysis)

학습 context 길이의 영향. 더 큰 context 크기로 학습한 모델이 RULER에서 더 잘할까? 파라미터 크기가 같고 학습 context 길이만 다른 LargeWorldModel(Liu et al., 2024a, LWM) 계열을 평가했다. Figure 4(왼쪽·가운데-왼쪽)를 보면, 대체로 큰 context 크기가 더 나은 성능으로 이어지지만, 긴 시퀀스에서는 순위가 뒤바뀔 수 있다. 예컨대 1M context 크기로 학습한 모델(LWM-1M)은 256K 길이에서 512K로 학습한 모델보다 못한데, RoPE의 새로운 base frequency에 맞춰 조정할 만큼 충분히 학습되지 않은 탓으로 보인다. 또한 모델이 학습 때 보지 못한 길이로 외삽해야 할 때(예: LWM-128K에 256K 입력) 성능이 뚝 떨어졌고, 최대 학습 context 크기 안에서는 로그 스케일로 볼 때 입력 길이에 따라 거의 선형으로 성능이 떨어졌다.
모델 크기의 영향. 주요 결과에서 상위권 모델들은 다른 모델보다 훨씬 크다. 모델 크기의 영향만 떼어 보기 위해, 같은 데이터 배합으로 같은 context 길이까지 학습한 Yi-34B-200k, Yi-9B-200k, Yi-6B-200k를 평가했다. Figure 4(가운데-오른쪽)를 보면, 34B 모델이 6B 모델보다 RULER에서 4K 길이 성능과 상대적 성능 하락 모두에서 뚜렷하게 낫다. 이는 더 나은 long-context 모델링을 위해 모델 크기를 키우는 것이 이롭다는 점을 시사한다.
구조의 영향. non-Transformer 구조 두 가지, RWKV-v5(Peng et al., 2023)와 Mamba-2.8B-slimpj(Gu & Dao, 2023)의 실효 context 길이를 평가했다. 두 모델 모두 context 크기를 8K로 늘리면 성능이 크게 떨어졌고, 4K 길이까지는 Transformer 기준선 Llama2-7B에 큰 폭으로 뒤처졌다. 다만 4K를 넘어서면 Llama2도 길이 외삽 성능이 나빠진다(Figure 4 오른쪽).
Figure 4
Figure 4
Figure 4
Figure 4. (왼쪽·가운데-왼쪽) 파라미터 크기를 7B로 고정하고 다양한 context 크기까지 학습한 LargeWorldModel(LWM) 계열 비교. (가운데-오른쪽) 학습 context 길이를 200K로 통제하고 파라미터 크기만 달리한 Yi 계열 비교. (오른쪽) non-Transformer 구조는 Transformer 기준선 Llama2-7B에 큰 폭으로 뒤처진다. 길이 외삽(length extrapolation)은 점선으로 표시했다.
📊 그림 해설 — 학습 길이·모델 크기·구조의 영향을 분리한 ablation - 학습 context 길이(왼쪽 둘, LWM chat·base): 대체로 길게 학습할수록 낫지만, 극단에서는 순위가 뒤집힌다(예: 256K에서 LWM-1M < LWM-512K). 학습 때 못 본 길이로 외삽하면(점선) 성능이 뚝 떨어진다. - 모델 크기(가운데-오른쪽, Yi 6B/9B/34B): 크기가 클수록 4K 성능과 하락 폭 모두 낫다. - 구조(오른쪽, RWKV·Mamba): SSM/RNN 계열은 8K만 돼도 크게 무너지고, Transformer 기준선에 한참 못 미친다.
의미: long-context 성능을 좌우하는 세 변수를 통제 실험으로 각각 떼어 본 그림이다. “모델 크기 확장은 이롭다”, “학습 길이를 늘린다고 늘 좋아지지는 않는다”, “비-Transformer 구조는 아직 긴 문맥에서 뒤처진다”는 6장의 결론을 시각적으로 요약한다.

7. 결론 (Conclusion)

우리는 long-context 언어 모델을 평가하는 합성 벤치마크 RULER를 제안했다. RULER는 retrieval, multi-hop tracing, aggregation, question answering이라는 다양한 과제 범주를 담아, LLM의 long-context 능력을 유연하고 촘촘하게 평가한다. 우리는 4K부터 128K까지의 context 크기로 long-context LM 17종을 RULER로 벤치마킹했다. 널리 쓰이는 needle-in-a-haystack 테스트에서는 완벽한 결과를 내지만, 입력 길이를 늘리면 거의 모든 모델이 RULER의 다른 과제에서 성능을 지켜 내지 못했다. context 크기가 클 때 흔한 실패 양상도 관찰했다. 방해 요소를 무시하지 못하는 것, 그리고 긴 문맥을 제대로 활용하지 못하는 것(예: 문맥을 그대로 베끼거나 parametric knowledge에 기대는 것)이다. 과제 난이도를 높이면 RULER가 상위권 오픈소스 모델에게도 만만치 않은 도전임을 보였다. 나아가 우리 분석은 RULER에서 개선의 여지가 크다는 점, 그리고 더 나은 long-context 능력을 얻는 데 모델 크기 확장이 이롭다는 점을 드러냈다.

8. 한계 (Limitations)

검색 중심 벤치마크보다 더 많은 과제 범주를 다루긴 하지만, RULER에는 여러 한계가 있다. 아래에 자세히 적는다.
위치 제어의 부재. 현재 RULER는 입력 길이마다 단일 수치 지표만 보고할 뿐, 깊이(depth)별 성능은 제공하지 않는다. 깊이별 성능은 NIAH 테스트(Kamradt, 2023)나 LV-Eval(Yuan et al., 2024) 같은 최근 연구에서 평가됐으며, lost-in-the-middle(Liu et al., 2024d) 현상을 드러내는 데 효과적일 수 있다. 우리는 이 문제를 인지하고 있으며, 코드베이스에서 핵심 정보의 위치 제어를 지원할 계획이다.
현실형 long-context 과제와의 상관 부족. variable tracking이나 frequent words extraction은 실제 long-context 자연어 과제를 대신할 대리 과제로 제안됐지만, 평가하기 쉬운 현실형 long-context 과제가 마땅치 않아 이 대리 과제들의 타당성을 검증하지 못했다. 이 한계 때문에, RULER는 long-context 언어 모델의 행동을 간편하게 점검하는 용도로 쓰일 수 있음을 강조한다. 다만 추론이나 지시 따르기 같은 다른 능력까지 강조하는 NoCHA(Karpinska et al., 2024)처럼 더 현실적인 설정보다 RULER를 우선해서는 안 된다.
짧은 context 평가의 부재. 현재 RULER 과제 모음에는 대부분의 모델이 4k context 크기에서 제법 잘 해내는 과제를 넣어, context 크기가 커질 때의 성능 하락을 관찰하는 데 초점을 맞췄다. 이를 4k context 크기에서 LM 능력이 완벽하다는 뜻으로 오독해서는 안 된다. 실제로 FlenQA(Levy et al., 2024) 같은 최근 연구는 과제 입력 길이를 겨우 수천 토큰으로 늘려도 성능이 떨어짐을 보였다. RULER에서 과제 난이도를 높이면 짧은 context 크기에서도 성능이 훨씬 나빠지지만, 이 결과는 본 논문에 싣지 않았다.
프롬프트 강건성 검증의 부재. 언어 모델은 프롬프트 형식에 민감할 수 있으나, 연구 초기 단계의 예비 테스트를 넘어서는 종합적인 프롬프트 강건성 연구까지는 하지 않았다. 또한 기존 과제의 몇몇 고정 하이퍼파라미터—예컨대 variable tracking의 변수 이름 길이, common word extraction과 frequent word extraction의 합성 어휘 크기—를 두고 폭넓게 실험하지도 않았다.

부록 (Appendix)

A. 모델 (Models)

평가와 분석을 위해 총 37개 모델을 골랐다. 본문 결과에는 aligned 모델(GPT-4, Gemini-1.5, 그리고 오픈소스 모델 15종)만 실었다. aligned 모델 외에, 오픈소스 base 모델 7종도 RULER로 평가했다. effective context 크기를 판정하는 임계값으로는 Llama2-7b(base)와 Llama2-7b(chat)의 context 길이 4K 성능을 썼다. 분석 절에서는 Yi·LWM 계열과 Mamba·RWKV 같은 새로운 구조의 모델을 포함해 총 11개 모델을 평가했다.
Table 4. RULER에서 평가·분석한 모델 정보. (Aligned ✓ = 정렬/instruct 모델, ✗ = base 모델)
모델
Aligned
크기
Context Length
Huggingface(Wolf et al., 2019) / API
GPT-4
✓
—
128K
gpt-4-1106-preview
Gemini-1.5
✓
—
1M
gemini-1.5-pro
Llama3.1
✓
70B
128K
meta-llama/Meta-Llama-3.1-70B-Instruct
Llama3.1
✓
8B
128K
meta-llama/Meta-Llama-3.1-8B-Instruct
Command-R-plus
✓
104B
128K
CohereForAI/c4ai-command-r-plus
Qwen2
✓
72B
128K
Qwen/Qwen2-72B-Instruct
Yi
✓
34B
200K
01-ai/Yi-34B-200K
Mixtral-8x22B
✓
39B/141B
32K
mistralai/Mixtral-8x22B-Instruct-v0.1
Mistral-v0.2
✓
7B
32K
mistralai/Mistral-7B-Instruct-v0.2
GLM4
✓
9B
1M
THUDM/glm-4-9b-chat-1m
GradientAI/Llama3
✓
70B
1M
gradientai/Llama-3-70B-Instruct-Gradient-1048k
Phi3-medium
✓
14B
128K
microsoft/Phi-3-medium-128k-instruct
LWM
✓
7B
1M
LargeWorldModel/LWM-Text-Chat-1M
DBRX
✓
36B/132B
1M
databricks/dbrx-instruct
Together
✓
7B
32K
togethercomputer/Llama-2-7B-32K-Instruct
LongChat
✓
7B
32K
lmsys/longchat-7b-v1.5-32k
LongAlpaca
✓
13B
32K
Yukang/LongAlpaca-13B
Mixtral-base
✗
8x7B
32K
mistralai/Mixtral-8x7B-v0.1
Mistral-base
✗
7B
32K
alpindale/Mistral-7B-v0.2-hf
LWM-base
✗
7B
1M
LargeWorldModel/LWM-Text-1M
LongLoRA-base
✗
7B
100K
Yukang/Llama-2-7b-longlora-100k-ft
Yarn-base
✗
7B
128K
NousResearch/Yarn-Llama-2-7b-128k
Together-base
✗
7B
32K
togethercomputer/Llama-2-7B-32K
Jamba-base
✗
52B
256K
ai21labs/Jamba-v0.1
Llama2 (chat)
✓
7B
4K
meta-llama/Llama-2-7b-chat-hf
Llama2 (base)
✗
7B
4K
meta-llama/Llama-2-7b-hf
Yi series
✓
6B, 9B
200K
01-ai/Yi-(6B,9B)-200K
LWM series
✓
7B
128K, 256K, 512K
LargeWorldModel/LWM-Text-Chat-(128K,256K,512K)
LWM-base series
✗
7B
32K, 128K, 256K, 512K
LargeWorldModel/LWM-Text-(32K,128K,256K,512K)
Mamba
✗
2.8B
2K
state-spaces/mamba-2.8b-slimpj
RWKV
✗
7B
4K
RWKV/v5-Eagle-7B-HF

B. 과제 설정 (Task Configurations)

RULER는 다양한 시퀀스 길이와 과제 난이도를 아우르도록 설정 가능하게 설계됐다. 과제마다 조합적으로 방대한 설정을 쓸 수 있다. 본문에서는 RULER의 네 범주에 걸친 대표 과제 13개로 모델을 평가했다. 과제 선정 과정은 다음 부록 절에 서술한다.
  • Retrieval: S-NIAH에는 passkey retrieval(Mohtashami & Jaggi, 2023)과 기본 NIAH(Kamradt, 2023)를 넣었다. 둘 다 word-number를 key-value로 쓰며, 배경 haystack만 다르다. 추가로 value 종류를 UUID로 바꿔, 문맥에서 긴 문자열을 검색하는 모델의 강건성을 테스트했다. MK-NIAH에는 방해용 needle 세 개를 haystack에 넣었다. 기존 연구의 설정도 포함했는데, line retrieval(Li et al., 2023a)과 key-value retrieval(Liu et al., 2024d)은 haystack 전체를 방해용 needle로 채운다. MV-NIAH와 MQ-NIAH는 각각 value와 query를 4개씩 테스트했다.
  • Multi-hop tracing: VT에는 name-binding hop 4개짜리 chain 1개를 넣어, 총 5개 변수 이름을 되돌려 주게 했다.
  • Aggregation: CWE에서는 총 10개의 common word를 되돌려 줘야 하며, 각 common word는 30번, uncommon word는 3번씩 나타난다. FWE에서는 합성 단어 샘플링에 쓰는 Zeta 분포의 α를 2.0으로 뒀다.
  • QA: long-context 시나리오를 흉내 내기 위해 SQuAD(Rajpurkar et al., 2018)와 HotpotQA(Yang et al., 2018)를 확장했다. 각각 single-hop과 multi-hop 질의응답 과제를 대표한다.
Table 5. RULER의 대표 과제 13개 설정. (~는 기존 연구의 유사 설정을 뜻함)
과제
하위과제
설정
Single NIAH
Subtask-1
type_key=word, type_value=number, type_haystack=repeat (~passkey retrieval)
ㅤ
Subtask-2
type_key=word, type_value=number, type_haystack=essay (~vanilla NIAH)
ㅤ
Subtask-3
type_key=word, type_value=uuid, type_haystack=essay
MK-NIAH
Subtask-1
num_keys=4, type_key=word, type_value=number, type_haystack=essay
ㅤ
Subtask-2
num_keys=full haystack, type_key=word, type_value=number (~line retrieval)
ㅤ
Subtask-3
num_keys=full haystack, type_key=uuid, type_value=uuid (~KV retrieval)
MV-NIAH
—
num_values=4, type_key=word, type_value=number, type_haystack=essay
MQ-NIAH
—
num_queries=4, type_key=word, type_value=number, type_haystack=essay
VT
—
num_chains=1, num_hops=4
CWE
—
freq_cw=30, freq_ucw=3, num_cw=10
FWE
—
α=2.0
QA
—
dataset=SQuAD / dataset=HotpotQA

C. 과제 상관 분석 (Task Correlation Analysis)

RULER는 서로 다른 범주의 과제가 서로 다른 모델 행동을 드러낼 수 있다는 가정 아래 설계됐다. 과제 범주의 타당성을 확인하고 대표 과제 선정을 돕기 위해 예비 상관 분석을 수행했다. 오픈소스 모델 여덟 개를 여러 context 크기에서 18개 과제 설정으로 평가했다. 그러면 각 과제는 여러 context 크기에서의 모델 성능 벡터로 표현할 수 있다. 이 18개 과제 벡터를 상관계수를 거리 지표로 삼아 병합 군집화(agglomerative clustering) 알고리즘으로 군집화했다. Figure 5에서 보듯, 일부 과제는 다른 과제와 중간 정도의 상관을 보이지만, 네 범주(NIAH, VT, AG, QA)의 과제는 각각 중복 없이 응집된 군집을 이룬다. 여기서 같은 군집 안의 다른 과제와 상관이 높은 몇몇 과제를 더 걷어 내고, 이후 대규모 평가를 위한 13개 과제를 확정했다.
Figure 5
Figure 5
Figure 5
Figure 5. 다양한 설정을 가진 18개 과제 사이의 상관 히트맵. 중복되는 과제(빨간색)를 걷어 내고 RULER에는 대표 과제 13개만 남겼다. (W: words; N: numbers; U: UUIDs; Full: entire haystack)
📊 그림 해설 — 과제 선정의 방법론적 근거 여러 context 크기에서의 모델 성능 벡터로 18개 과제 사이의 상관을 구하고, 병합 군집화로 정렬한 18×18 히트맵이다. 밝을수록 상관이 높다. - 네 범주(NIAH, VT, AG, QA)가 각각 밝은 대각 블록으로 뭉치며, 서로 다른 모델 행동을 포착함을 보여 준다. - 빨간색으로 표시된 과제는 같은 군집 안에서 다른 과제와 상관이 지나치게 높아 중복으로 판단, 최종 13개에서 제외했다.
의미: RULER의 과제 범주가 서로 중복되지 않으며, 대표 과제 13개만으로도 충분히 다양한 행동을 덮을 수 있음을 정량적으로 뒷받침한다. 본문 과제 설정(Appendix B)이 왜 그렇게 선택됐는지에 대한 근거다.

D. 프롬프트 템플릿 (Prompt Templates)

입력 프롬프트 템플릿은 model template(Table 6)과 task template(Table 7·8·9)로 나뉜다. model template은 모델의 chat 형식이고, task template은 instruction·context·query를 합친 것이다. 모델이 질문에 답하기를 거부하지 못하도록, 입력 뒤에 answer prefix를 붙여 모델의 응답을 끌어냈다. VT와 CWE에는 과제 샘플 하나를 in-context 예시로 넣었다.
아래 템플릿은 실제로 모델에 입력되는 산출물(artifact)이므로, 번역하지 않고 영어 원문 그대로 코드 블록에 싣는다. 오독을 막기 위한 조치다.
Table 6 · Model chat templates — answer prefix를 모델 응답에 덧붙여 답변 거부를 막는다. answer prefix를 더해도 모델의 chat template은 깨지지 않는다.
GPT-4 {task template} Do not provide any explanation. Please directly give me the answer. {task answer prefix} Yi/Base {task template} {task answer prefix} Command-R <BOS_TOKEN><|START_OF_TURN_TOKEN|><|USER_TOKEN|>{task template} <|END_OF_TURN_TOKEN|><|START_OF_TURN_TOKEN|><|CHATBOT_TOKEN|>{task answer prefix} LWM/LongChat {system prompt} USER: {task template} ASSISTANT: {task answer prefix} GLM [gMASK]sop<|user|>{task template}<|assistant|>{task answer prefix} Phi3 <|user|>{task template}<|end|><|assistant|>{task answer prefix} Qwen/DBRX <|im_start|>system {system prompt}<|im_end|> <|im_start|>user {task template}<|im_end|> <|im_start|>assistant {task answer prefix} Llama3/3.1 <|begin_of_text|><|start_header_id|>user<|end_header_id|>{task template}<|eot_id|> <|start_header_id|>assistant<|end_header_id|>{task answer prefix} Llama2/Others [INST] {task template} [/INST] {task answer prefix}
Table 7 · S-NIAH & MK-NIAH task templates (원문 그대로)
[S-NIAH / Subtask-1] Some special magic numbers are hidden within the following text. Make sure to memorize it. I will quiz you about the numbers afterwards. The grass is green. The sky is blue. The sun is yellow. Here we go. There and back again. ...... One of the special magic numbers for {word} is: {number}. ...... What is the special magic number for {word} mentioned in the provided text? → Answer Prefix: The special magic number for {word} mentioned in the provided text is [S-NIAH / Subtask-2] (haystack = Paul Graham Essays 로만 교체) [S-NIAH / Subtask-3] (magic numbers → magic words, value = word) [MK-NIAH / Subtask-1] (word-1..4 중 word-4 를 질의; 나머지는 방해용 needle) [MK-NIAH / Subtask-2] (haystack 전체를 needle 로 채움; word-x 를 질의) [MK-NIAH / Subtask-3] (uuid 버전)
Table 8 · MV-NIAH, MQ-NIAH, VT, CWE, FWE task templates (원문 그대로)
[MV-NIAH] 같은 {word} 에 number-1..4 를 매핑 → "What are all the special magic numbers for {word} ...?" [MQ-NIAH] word-1..4 각각에 number-1..4 → "What are all the special magic numbers for {word-1}..{word-4} ...?" [VT] {one task example} Memorize and track the chain(s) of variable assignment hidden in the following text. The grass is green. The sky is blue. The sun is yellow. Here we go. There and back again. ...... VAR {X1} = {number} ...... VAR {X2} = {X1} ...... VAR {X5} = {X4} ...... Question: Find all variables that are assigned the value {number} in the text above. → Answer: According to the chain(s) of variable assignment ..., 5 variables are assigned the value {number}, they are: [CWE] {one task example} Below is a numbered list of words. ... Memorize the ones that appear most often. 1. word-a 2. word-b 3. word-c 4. word-a ...... Question: What are the 10 most common words in the above list? → Answer: The top 10 words that appear most often in the list are: [FWE] Read the following coded text and track the frequency of each coded word. Find the three most frequently appeared coded words. ... word-a ... word-b ... word-a ...... Question: ... What are the three most frequently appeared words in the above coded text? → Answer: According to the coded text above, the three most frequently appeared words are:
Table 9 · QA task templates (원문 그대로)
[Single-Hop QA / Multi-Hop QA] Answer the question based on the given documents. Only give me the answer and do not output any other words. The following are given documents. Document 1: {document-1} ...... Document n: {document-n} Answer the question based on the given documents. Only give me the answer and do not output any other words. Question: {question} → Answer:

E. Passkey Retrieval와 Vanilla NIAH 결과

표방 길이 안에서는 거의 모든 모델이 passkey retrieval과 vanilla NIAH에서 만점에 가까운 점수를 받는다. 이는 기본 검색 테스트만으로는 모델의 long-context 능력을 제대로 가늠할 수 없다는 논지를 뒷받침한다.

Table 10. passkey retrieval — 표방 길이에서 거의 모든 모델이 만점

(4K~128K, 13개 과제 정확도 평균 등 · 수치는 원문 그대로)
모델
Claimed
4K
8K
16K
32K
64K
128K
Avg.
Gemini-1.5
1M
100.0
100.0
100.0
100.0
100.0
100.0
100.0
GPT-4
128K
100.0
100.0
100.0
100.0
100.0
100.0
100.0
Llama3.1 (70B)
128K
100.0
100.0
100.0
100.0
100.0
97.8
99.6
Llama3.1 (8B)
128K
100.0
100.0
100.0
100.0
100.0
100.0
100.0
Qwen2 (72B)
128K
100.0
100.0
100.0
100.0
100.0
96.6
99.4
Command-R-plus (104B)
128K
100.0
100.0
99.8
99.8
100.0
97.2
99.5
GLM4 (9B)
1M
100.0
100.0
100.0
100.0
100.0
100.0
100.0
GradientAI/Llama3 (70B)
1M
100.0
100.0
100.0
100.0
100.0
93.6
98.9
Mixtral-8x22B (39B/141B)
64K
100.0
100.0
100.0
100.0
99.6
0.0
83.3
Yi (34B)
200K
100.0
100.0
100.0
100.0
100.0
100.0
100.0
Phi3-medium (14B)
128K
100.0
100.0
100.0
100.0
100.0
88.0
98.0
Mistral-v0.2 (7B)
32K
100.0
100.0
100.0
100.0
99.6
69.6
94.9
LWM (7B)
1M
100.0
100.0
100.0
100.0
100.0
100.0
100.0
DBRX (36B/132B)
32K
100.0
100.0
100.0
100.0
0.0
0.0
66.7
Together (7B)
32K
100.0
100.0
100.0
100.0
0.0
0.0
66.7
LongChat (7B)
32K
100.0
100.0
100.0
99.4
0.0
0.0
66.6
LongAlpaca (13B)
32K
88.2
88.6
86.4
82.4
0.0
0.0
57.6
Mixtral-base (8x7B)
32K
100.0
100.0
100.0
100.0
100.0
46.8
91.1
Mistral-base (7B)
32K
100.0
100.0
100.0
100.0
99.6
70.8
95.1
Jamba-base (52B)
256K
100.0
100.0
100.0
100.0
100.0
100.0
100.0
LWM-base (7B)
1M
99.8
100.0
99.6
99.6
98.2
96.0
98.9
LongLoRA-base (7B)
100K
99.6
99.4
99.0
99.4
99.4
0.0
82.8
Yarn-base (7B)
128K
100.0
100.0
99.0
100.0
99.2
39.6
89.6
Together-base (7B)
32K
100.0
100.0
99.8
100.0
0.0
0.0
66.6

Table 11. vanilla NIAH — 표방 길이에서 거의 모든 모델이 만점

(4K~128K, 13개 과제 정확도 평균 등 · 수치는 원문 그대로)
모델
Claimed
4K
8K
16K
32K
64K
128K
Avg.
Gemini-1.5
1M
100.0
100.0
100.0
98.0
100.0
100.0
99.7
GPT-4
128K
100.0
100.0
100.0
100.0
100.0
100.0
100.0
Llama3.1 (70B)
128K
100.0
100.0
100.0
100.0
100.0
99.6
99.9
Llama3.1 (8B)
128K
100.0
100.0
100.0
100.0
100.0
99.6
99.9
Qwen2 (72B)
128K
100.0
100.0
100.0
100.0
99.8
56.4
92.7
Command-R-plus (35B)
128K
100.0
100.0
100.0
100.0
99.8
86.0
97.6
GLM4 (9B)
128K
100.0
100.0
100.0
100.0
100.0
100.0
100.0
GradientAI/Llama3 (70B)
1M
100.0
100.0
100.0
99.6
99.2
97.8
99.4
Mixtral-8x22B (39B/141B)
64K
100.0
100.0
100.0
100.0
99.6
24.2
87.3
Yi (34B)
200K
100.0
100.0
100.0
100.0
100.0
100.0
100.0
Phi3-medium (14B)
128K
100.0
99.8
100.0
99.8
99.8
73.8
95.5
Mistral-v0.2 (7B)
32K
100.0
100.0
100.0
97.0
70.0
7.4
79.1
LWM (7B)
1M
100.0
100.0
100.0
100.0
100.0
100.0
100.0
DBRX (36B/132B)
32K
100.0
100.0
90.0
93.2
0.8
0.0
64.0
Together (7B)
32K
100.0
100.0
100.0
99.8
0.0
0.0
66.6
LongChat (7B)
32K
100.0
100.0
97.6
98.4
0.0
0.0
66.0
LongAlpaca (13B)
32K
90.2
90.2
88.4
83.4
0.0
0.0
58.7
Mixtral-base (8x7B)
32K
100.0
100.0
100.0
100.0
85.2
34.8
86.7
Mistral-base (7B)
32K
100.0
100.0
100.0
100.0
94.8
0.4
82.5
Jamba-base (52B)
256K
100.0
100.0
98.8
99.8
99.8
86.4
97.5
LWM-base (7B)
1M
100.0
99.4
97.8
98.6
98.2
98.6
98.8
LongLoRA-base (7B)
100K
99.8
100.0
100.0
99.8
100.0
0.0
83.3
Yarn-base (7B)
128K
97.4
97.8
91.4
85.4
86.6
20.0
79.8
Together-base (7B)
32K
100.0
100.0
100.0
99.8
0.0
0.0
66.6

F. 추가 결과 (Additional Results)

네 범주로 나눠 본 추가 성능 표다. Table 12는 base 모델의 13개 과제 평균, Table 13~16은 각각 Retrieval(NIAH)·Multi-hop tracing(VT)·Aggregation(CWE/FWE)·Question Answering 범주의 평균 성능이다. 각 표의 기준선은 해당 범주에서 Llama2-7B의 4K 점수다.

Table 12. base 모델 · 13개 과제 평균

(4K~128K, 13개 과제 정확도 평균 등 · 수치는 원문 그대로)
모델
Claimed
Effective
4K
8K
16K
32K
64K
128K
Avg.
wAvg(inc)
wAvg(dec)
Llama2-7B (base)
4K
—
—
—
—
—
—
—
79.4
—
—
Mixtral-base (8x7B)
32K
32K
91.8
91.0
89.5
85.8
66.9
29.0
75.7
66.4(1st)
85.0(1st)
Mistral-base (7B)
32K
16K
91.6
89.8
86.3
77.2
52.3
8.0
67.5
54.7(4th)
80.4(2nd)
Jamba-base (52B)
256K
4K
81.2
75.4
68.8
65.3
61.0
51.4
67.2
62.5(3rd)
71.8(4th)
LWM-base (7B)
1M
<4K
77.5
74.0
69.6
64.6
61.3
59.0
67.7
64.4(2nd)
70.9(5th)
LongLoRA-base (7B)
100K
8K
81.9
80.4
75.6
65.1
60.8
0.0
60.6
49.2(5th)
72.0(3rd)
Yarn-base (7B)
128K
<4K
77.3
67.5
59.0
47.3
38.6
13.9
50.6
40.7(6th)
60.5(7th)
Together-base (7B)
32K
4K
84.6
78.7
68.3
57.9
0.0
0.0
48.2
32.3(7th)
64.2(6th)

Table 13. Retrieval(NIAH) · 8개 과제 평균 (aligned+base)

(4K~128K, 13개 과제 정확도 평균 등 · 수치는 원문 그대로)
모델
Claimed
Effective
4K
8K
16K
32K
64K
128K
Avg.
wAvg(inc)
wAvg(dec)
Llama2-7B (chat)
4K
—
—
—
—
—
—
—
96.9
—
—
Gemini-1.5
1M
>128K
99.8
99.9
99.6
99.7
99.7
99.6
99.7
99.7(1st)
99.7(1st)
Llama3.1 (8B)
128K
64K
99.9
99.9
99.8
99.6
98.7
92.6
98.4
97.5(3rd)
99.4(2nd)
GLM4 (9B)
1M
64K
99.4
99.2
99.5
99.4
97.3
94.4
98.2
97.5(2nd)
98.9(3rd)
Llama3.1 (70B)
128K
64K
100.0
100.0
99.9
99.6
98.5
78.9
96.1
93.5(5th)
98.8(4th)
GPT-4
128K
32K
99.9
99.9
98.7
98.3
90.9
84.8
95.4
92.9(6th)
97.9(5th)
Command-R-plus (104B)
128K
32K
99.9
99.9
99.4
97.9
89.6
65.7
92.1
87.3(8th)
96.9(6th)
GradientAI/Llama3 (70B)
1M
16K
99.0
98.8
98.3
94.5
91.2
84.9
94.4
92.1(7th)
96.8(7th)
Yi (34B)
200K
16K
98.2
96.8
97.3
95.1
93.0
90.2
95.1
93.8(4th)
96.4(8th)
Qwen2 (72B)
128K
32K
100.0
99.9
99.9
99.4
84.5
48.0
88.6
81.3(11th)
95.9(9th)
Phi3-medium (14B)
128K
8K
98.7
98.5
96.6
95.4
91.9
51.3
88.7
82.6(10th)
94.9(10th)
Mixtral-8x22B (39B/141B)
64K
16K
99.3
99.1
97.7
96.7
89.9
23.8
84.4
74.8(12th)
94.1(11th)
LWM (7B)
1M
<4K
92.5
92.1
87.6
83.7
84.1
83.4
87.2
85.5(9th)
89.0(12th)
Mistral-v0.2 (7B)
32K
4K
98.1
96.2
94.3
85.5
51.1
10.7
72.6
58.8(13th)
86.5(13th)
DBRX (36B/132B)
32K
8K
99.4
99.0
93.5
73.4
0.5
0.0
61.0
41.6(14th)
80.3(14th)
Together (7B)
32K
<4K
96.2
89.9
82.3
80.2
0.0
0.0
58.1
40.2(15th)
76.0(15th)
LongChat (7B)
32K
<4K
93.3
92.2
81.1
67.3
0.0
0.0
55.7
37.6(16th)
73.7(16th)
LongAlpaca (13B)
32K
<4K
74.9
72.2
70.8
53.2
0.0
0.0
45.2
30.7(17th)
59.7(17th)
Llama2-7B (base)
4K
—
—
—
—
—
—
—
90.9
—
—
Mixtral-base (8x7B)
32K
32K
99.9
99.7
98.4
94.8
72.1
29.1
82.3
71.8(2nd)
92.8(1st)
Mistral-base (7B)
32K
16K
99.3
97.5
95.7
89.8
56.8
10.2
74.9
61.2(4th)
88.6(2nd)
Jamba-base (52B)
256K
<4K
86.4
80.5
73.7
72.3
68.1
56.9
73.0
68.5(3th)
77.4(5th)
LWM-base (7B)
1M
<4K
88.5
87.7
84.5
79.6
76.1
74.2
81.8
79.1(1st)
84.4(4th)
LongLoRA-base (7B)
100K
16K
95.3
95.6
92.7
81.5
76.2
0.0
73.5
60.6(5th)
86.5(3rd)
Yarn-base (7B)
128K
<4K
89.9
86.1
78.4
59.0
49.5
17.5
63.4
51.7(6th)
75.1(7th)
Together-base (7B)
32K
8K
95.4
91.5
86.1
75.1
0.0
0.0
58.0
39.9(7th)
76.2(6th)

Table 14. Multi-hop tracing(VT) (aligned+base)

(4K~128K, 13개 과제 정확도 평균 등 · 수치는 원문 그대로)
모델
Claimed
Effective
4K
8K
16K
32K
64K
128K
Avg.
wAvg(inc)
wAvg(dec)
Llama2-7B (chat)
4K
—
—
—
—
—
—
—
89.7
—
—
GPT-4
128K
128K
100.0
100.0
100.0
100.0
100.0
99.6
99.9
99.9(2nd)
100.0(1st)
Gemini-1.5
1M
>128K
100.0
100.0
100.0
100.0
99.6
100.0
99.9
99.9(1st)
100.0(2nd)
Command-R-plus (104B)
128K
128K
100.0
100.0
100.0
100.0
99.9
97.2
99.5
99.2(3rd)
99.8(3rd)
GLM4 (9B)
1M
>128K
99.9
99.6
99.8
99.8
99.6
97.7
99.4
99.1(4th)
99.7(4th)
Qwen2 (72B)
128K
64K
100.0
100.0
100.0
100.0
95.2
79.0
95.7
92.9(5th)
98.5(5th)
Llama3.1 (70B)
128K
64K
100.0
100.0
100.0
100.0
99.9
59.2
93.2
88.3(8th)
98.0(6th)
Llama3.1 (8B)
128K
64K
99.9
99.7
99.7
98.8
97.6
70.4
94.4
90.7(6th)
98.0(7th)
GradientAI/Llama3 (70B)
1M
64K
100.0
100.0
100.0
100.0
99.7
56.2
92.6
87.4(9th)
97.9(8th)
Yi (34B)
200K
64K
99.8
99.2
98.8
94.5
92.5
76.8
93.6
90.3(7th)
96.9(9th)
Mixtral-8x22B (39B/141B)
64K
64K
100.0
100.0
99.8
98.6
96.4
0.0
82.5
70.3(10th)
94.7(10th)
Phi3-medium (14B)
128K
16K
99.6
99.2
98.4
82.1
53.6
26.0
76.5
64.1(11th)
88.9(11th)
Mistral-v0.2 (7B)
32K
16K
98.9
96.0
92.2
85.0
74.5
0.0
74.4
60.9(12th)
87.9(12th)
LongChat (7B)
32K
8K
97.6
93.5
83.4
62.4
0.0
0.0
56.2
37.4(14th)
75.0(13th)
DBRX (36B/132B)
32K
8K
100.0
99.0
72.5
45.8
0.0
0.0
52.9
33.3(15th)
72.5(14th)
LWM (7B)
1M
<4K
84.4
80.1
67.2
52.2
45.9
15.2
57.5
46.5(13th)
68.6(15th)
Together (7B)
32K
<4K
89.2
88.8
48.3
16.6
0.0
0.0
40.5
22.8(16th)
58.2(16th)
LongAlpaca (13B)
32K
<4K
8.5
2.1
18.2
17.0
0.0
0.0
7.6
6.5(17th)
8.8(17th)
Llama2-7B (base)
4K
—
—
—
—
—
—
—
58.8
—
—
Mixtral-base (8x7B)
32K
64K
100.0
99.9
100.0
98.4
87.3
43.3
88.1
80.5(2nd)
95.8(1st)
Mistral-base (7B)
32K
64K
99.0
98.4
96.5
89.1
86.1
0.0
78.2
65.4(4th)
91.0(2nd)
Jamba-base (52B)
256K
128K
87.5
87.6
86.2
88.1
86.0
77.8
85.5
84.3(1st)
86.7(3rd)
LWM-base (7B)
1M
128K
80.2
82.7
79.3
76.4
70.7
66.1
75.9
73.3(3th)
78.5(4th)
LongLoRA-base (7B)
100K
64K
92.5
87.4
73.1
56.0
69.2
0.0
63.0
50.3(5th)
75.8(5th)
Yarn-base (7B)
128K
4K
84.6
43.6
24.8
43.0
20.9
0.0
36.1
24.9(7th)
47.4(7th)
Together-base (7B)
32K
16K
95.0
90.6
69.6
43.2
0.0
0.0
49.7
31.3(6th)
68.1(6th)

Table 15. Aggregation(CWE/FWE) · 2개 과제 평균 (aligned+base)

(4K~128K, 13개 과제 정확도 평균 등 · 수치는 원문 그대로)
모델
Claimed
Effective
4K
8K
16K
32K
64K
128K
Avg.
wAvg(inc)
wAvg(dec)
Llama2-7B-chat
4K
—
—
—
—
—
—
—
84.8
—
—
Gemini-1.5
1M
>128K
97.7
97.7
97.6
98.6
97.3
90.9
96.6
95.8(1st)
97.4(1st)
GPT-4
128K
64K
99.0
98.3
98.0
95.0
90.1
79.7
93.4
90.4(2nd)
96.3(2nd)
Qwen2 (72B)
128K
32K
99.3
98.0
93.1
97.4
78.5
70.3
89.4
84.7(3rd)
94.2(3rd)
Mixtral-8x22B (39B/141B)
64K
32K
97.8
96.9
94.8
88.2
83.3
69.7
88.5
84.0(4th)
92.9(4th)
Command-R-plus (104B)
128K
32K
98.2
96.9
95.2
90.3
82.5
59.5
87.1
81.3(5th)
92.8(5th)
Llama3.1 (70B)
128K
32K
99.9
98.3
98.4
97.1
66.3
39.8
83.3
73.8(6th)
92.8(6th)
Phi3-medium (14B)
128K
16K
90.8
95.1
90.3
82.4
62.1
43.8
77.4
69.3(7th)
85.6(7th)
Yi (34B)
200K
16K
91.4
90.9
86.2
75.3
58.5
43.4
74.3
66.0(8th)
82.6(8th)
GLM4 (9B)
1M
8K
93.5
85.2
78.5
68.1
58.3
49.7
72.2
64.8(9th)
79.6(9th)
GradientAI/Llama3 (70B)
1M
8K
96.4
94.7
74.9
57.0
45.1
41.4
68.3
57.7(10th)
78.8(10th)
Llama3.1 (8B)
128K
8K
97.0
90.1
79.2
54.1
43.5
36.2
66.7
55.5(11th)
77.8(11th)
Mistral-v0.2 (7B)
32K
8K
94.3
90.4
77.4
48.5
42.4
33.7
64.4
53.1(12th)
75.8(12th)
DBRX (36B/132B)
32K
8K
94.5
94.7
73.7
48.7
4.1
0.0
52.6
34.3(13th)
70.9(13th)
Together (7B)
32K
<4K
82.3
64.5
43.3
34.8
0.0
0.0
37.5
22.9(16th)
52.1(14th)
LongChat (7B)
32K
<4K
74.3
50.7
46.7
51.1
0.0
0.0
37.1
24.8(15th)
49.5(15th)
LWM (7B)
1M
<4K
61.3
43.6
38.3
32.8
29.1
29.1
39.0
34.0(14th)
44.0(16th)
LongAlpaca (13B)
32K
<4K
33.0
27.0
26.0
23.2
0.0
0.0
18.2
12.3(17th)
24.1(17th)
Llama2-7B (base)
4K
—
—
—
—
—
—
—
73.1
—
—
Mixtral-base (8x7B)
32K
32K
96.5
94.8
93.1
87.8
68.6
24.3
77.5
66.9(1st)
88.1(1st)
Mistral-base (7B)
32K
16K
94.8
93.1
81.6
53.3
36.7
9.2
61.4
46.5(2nd)
76.3(2nd)
Jamba-base (52B)
256K
4K
75.9
63.5
51.7
38.5
33.3
28.0
48.5
40.3(3rd)
56.6(3rd)
LWM-base (7B)
1M
<4K
67.1
48.4
36.0
26.3
21.5
18.7
36.3
28.4(5th)
44.2(5th)
LongLoRA-base (7B)
100K
<4K
70.3
64.4
50.7
39.9
29.4
0.0
42.4
31.3(4th)
53.6(4th)
Yarn-base (7B)
128K
<4K
70.6
49.2
28.9
20.5
17.0
2.1
31.4
20.7(6th)
42.0(6th)
Together-base (7B)
32K
<4K
69.1
53.0
19.9
20.6
0.0
0.0
27.1
15.1(7th)
39.1(7th)

Table 16. Question Answering · 2개 과제 평균 (aligned+base)

(4K~128K, 13개 과제 정확도 평균 등 · 수치는 원문 그대로)
모델
Claimed
Effective
4K
8K
16K
32K
64K
128K
Avg.
wAvg(inc)
wAvg(dec)
Llama2-7B (chat)
4K
—
—
—
—
—
—
—
49.7
—
—
Gemini-1.5
1M
>128K
81.9
75.9
77.8
75.9
77.6
74.1
77.2
76.3(1st)
78.0(1st)
GPT-4
128K
128K
79.0
78.0
76.0
68.0
61.6
59.0
70.3
66.5(4th)
74.0(2nd)
Qwen2 (72B)
128K
64K
80.8
76.9
74.1
66.9
54.5
47.2
66.7
61.0(8th)
72.5(3rd)
GradientAI/Llama3 (70B)
1M
>128K
75.6
73.9
72.4
69.9
66.0
59.8
69.6
67.1(3rd)
72.1(4th)
Llama3.1 (70B)
128K
64K
77.2
74.8
72.3
70.4
64.2
47.6
67.8
63.4(7th)
72.1(5th)
GLM4 (9B)
1M
>128K
74.7
71.3
71.9
68.5
66.3
63.6
69.4
67.6(2nd)
71.1(6th)
Mixtral-8x22B (39B/141B)
64K
64K
76.6
73.5
71.8
66.5
59.7
40.8
64.8
59.4(9th)
70.2(7th)
Yi (34B)
200K
>128K
72.7
71.5
68.4
66.2
64.1
59.9
67.1
65.0(5th)
69.2(8th)
Llama3.1 (8B)
128K
128K
74.1
70.1
67.3
65.8
63.7
58.8
66.6
64.3(6th)
68.9(9th)
Command-R-plus (104B)
128K
64K
73.4
72.3
69.4
65.9
57.0
39.2
62.9
57.6(10th)
68.1(10th)
Phi3-medium (14B)
128K
64K
70.9
67.2
66.1
59.3
54.2
38.0
59.3
54.3(12th)
64.3(11th)
Mistral-v0.2 (7B)
32K
32K
72.4
70.0
65.7
57.6
34.4
13.3
52.2
42.5(13th)
62.0(12th)
LWM (7B)
1M
>128K
61.2
57.8
56.7
55.4
54.7
52.6
56.4
55.1(11th)
57.7(13th)
DBRX (36B/132B)
32K
16K
76.0
69.4
59.4
45.0
9.6
0.0
43.2
29.6(14th)
56.9(14th)
Together (7B)
32K
16K
61.1
58.3
54.2
45.6
0.0
0.0
36.5
24.9(15th)
48.2(15th)
LongAlpaca (13B)
32K
16K
57.2
53.5
49.7
39.0
0.0
0.0
33.2
22.3(16th)
44.1(16th)
LongChat (7B)
32K
8K
54.5
53.6
47.6
34.0
0.0
0.0
31.6
21.0(17th)
42.3(17th)
Llama2-7B (base)
4K
—
—
—
—
—
—
—
48.6
—
—
Mixtral-base (8x7B)
32K
4K
50.8
47.7
45.3
41.3
34.4
26.4
41.0
37.0(3rd)
44.9(3rd)
Mistral-base (7B)
32K
8K
53.5
51.0
48.4
44.7
32.8
2.2
38.8
31.3(4th)
46.3(2nd)
Jamba-base (52B)
256K
32K
62.7
60.6
57.9
52.6
47.5
39.6
53.5
49.7(1st)
57.3(1st)
LWM-base (7B)
1M
<4K
42.7
40.2
38.7
37.1
37.3
34.6
38.4
37.2(2nd)
39.6(4th)
LongLoRA-base (7B)
100K
<4K
34.5
32.1
33.6
29.4
26.1
0.0
26.0
21.3(6th)
30.6(6th)
Yarn-base (7B)
128K
<4K
29.7
23.5
28.6
29.7
25.5
18.1
25.9
24.6(5th)
27.1(7th)
Together-base (7B)
32K
4K
52.0
47.5
44.6
33.6
0.0
0.0
29.6
19.8(7th)
39.5(5th)

  1. one-shot 예시를 아예 없애는 실험도 해 봤다. 그러면 모델은 그저 입력 첫머리의 문자열을 베끼는데, 이는 attention sink(Xiao et al., 2024b) 때문일 가능성이 크다.↩︎