컨티뉴엄 AI(CONTINUUM AI)가 개발한 OpenAI 호환 LLM 게이트웨이인 OrcaRouter가 다중 홉 검색증강생성(RAG)의 문서 간 추론을 질의 시점에서 색인 시점으로 옮기는 연구 IndexRAG를 공개했다. 논문은 AACL-IJCNLP 2026 Findings에 채택됐다. 코드는 Apache-2.0 라이선스로 공개돼 있다.

그래프 기반·반복형 RAG 시스템은 질문에 답할 때 추가 작업을 한다. 엔티티를 뽑고, 그래프를 순회하고, 검색과 생성을 여러 번 돌린다. IndexRAG는 그 작업을 색인을 만드는 동안 한 번 하고, 결과를 브리징 팩트로 저장한다.

브리징 팩트는 문서 간 연결을 이미 담고 있는, 독립적으로 검색 가능한 단위다. 질문이 들어오면 특별한 일이 일어나지 않는다. 납작한 벡터 색인 위에서 검색 한 번, LLM 호출 한 번이면 끝난다.

오프라인 단계는 둘이다. 먼저 원자적 지식 단위(AKU)를 뽑고, 그다음 문서 간 브리징 팩트를 만든다. 임베딩 모델과 LLM 어느 쪽도 미세조정하지 않는 학습 없는(training-free) 방식이다.

세 벤치마크에서 벤치마크당 1000문항을 표본으로 F1을 쟀다. 아래 모든 방법은 질의 시점에 검색 한 번과 LLM 호출 한 번만 쓴다.

· BM25 — HotpotQA 60.3 / 2WikiMultiHopQA 35.9 / MuSiQue 19.2 / 평균 38.5

· Naive RAG — 63.6 / 47.7 / 29.9 / 47.1

· RAPTOR — 63.6 / 47.8 / 29.7 / 47.0

· FastGraphRAG — 63.5 / 57.4 / 27.2 / 49.4

· IndexRAG — 68.9 / 51.7 / 34.4 / 51.7

IndexRAG는 질의 시점에 LLM 호출을 늘리지 않고 평균 F1에서 Naive RAG보다 4.6 높다. HotpotQA와 MuSiQue에서는 이 표의 방법 가운데 가장 높다.

앞선 곳과 뒤진 곳

표를 그대로 읽어야 한다. 2WikiMultiHopQA에서는 FastGraphRAG의 57.4가 IndexRAG의 51.7보다 높다. 논문은 이 벤치마크에서 앞선 방법이 있다는 사실을 숨기지 않는다.

질의 시점에 더 많이 쓰는 방법은 별개 부류다. HippoRAG2는 LLM 호출 두 번과 그래프 순회로 평균 F1 54.1을 낸다. 이는 IndexRAG의 51.7보다 높은 수치다. 브리징 팩트는 이런 방법과 경쟁하는 것이 아니라 결합되는 것으로 제시된다. 브리징 팩트를 IRCoT에 더하면 평균 F1 55.0이 된다.

절약은 온라인 쪽에서 일어난다

IndexRAG가 줄이는 것은 질의 시점 비용이다. HippoRAG2와 비교해 검색은 6.6~10.4배 빠르고, 색인은 17~20배 작으며, 색인 구축 비용은 30~50% 낮다.

모든 단계의 LLM은 `gpt-4o-mini`, 임베딩은 `text-embedding-3-small`을 썼다. 벡터 저장소는 FAISS 평탄 색인, 검색은 코사인 유사도 상위 20개 가운데 10개를 LLM에 넘긴다. 브리징 대상 엔티티의 문서 빈도는 2~10, 엔티티당 원본 문서는 최대 5개, 원본 문서당 팩트는 최대 8개다. 기준선의 문단 분할은 약 100단어에 80자 중첩이다.

저장소는 오프라인 두 단계와 함께 세 개의 다중 홉 QA 벤치마크(HotpotQA, 2WikiMultiHopQA, MuSiQue), 네 가지 색인 변형, 세 가지 검색 백엔드(밀집 검색, 상호순위융합을 쓴 BM25, 그래프 순회)를 담고 있다.

코드는 Apache-2.0이다. 함께 쓰는 벤치마크 데이터셋의 라이선스는 각각 다르다. HotpotQA와 MuSiQue는 CC BY-SA 4.0, 2WikiMultiHopQA는 Apache-2.0, FAISS는 MIT다.

이 결과가 말하지 않는 것

점수는 세 벤치마크에서 벤치마크당 1,000문항을 표본으로 잰 값이다. 평균 열은 산술 평균이지 공식 순위가 아니다. 표에 실린 모든 방법은 질의 시점에 검색 한 번과 LLM 호출 한 번만 쓰는 조건에서 비교됐고, HippoRAG2처럼 질의 시점에 더 쓰는 방법은 그 조건 밖에 있어 나란히 놓을 수 없다.

논문이 밝히는 절약은 질의 시점의 절약이며, 그 절약의 대가로 색인 시점에 두 단계를 미리 돌린다.

OrcaRouter는 단일 API 키와 엔드포인트로 다음을 포함한 200개 이상의 모델을 제공한다.

· OpenAI GPT-6.1 Sol

· Anthropic Claude Sonnet 5.5

· Anthropic Claude Opus 5.5

· OpenAI GPT-6 Astra

· DeepSeek V4.1 Flash

· Z.ai GLM-5.3 Flash

· Qwen 3.8 Max

· IndexRAG 저장소

· IndexRAG 논문 (arXiv 2603.16415)

· OrcaRouter 모델 목록

· OrcaRouter 웹사이트

OrcaRouter 소개

OrcaRouter는 OpenAI 호환 LLM 게이트웨이로, 200개가 넘는 모델에 걸쳐 라우팅하며 약 40%의 비용 절감, 1밀리초 미만의 라우팅 오버헤드, 0%의 토큰 마크업을 제공한다. 자체 호스팅 에디션인 OrcaRouter-Lite는 MIT 라이선스로 제공된다.

CONTINUUM AI PTE. LTD. 소개

Continuum AI Pte. Ltd.는 최첨단 AI를 개발자와 팀이 접근 가능하고 합리적인 비용으로 사용할 수 있도록 하기 위해 설립된 싱가포르 기반 기업이다. 단일 API 키와 엔드포인트를 통해 200개 이상의 선도적인 AI 모델에 대한 액세스를 제공하는 OpenAI 호환 AI Gateway인 OrcaRouter를 개발한 회사다. OrcaRouter는 약 40%의 비용 절감, 1ms 미만의 라우팅 오버헤드, 토큰 마크업 없음을 제공하며, MIT 라이선스로 출시된 자체 호스팅 버전(OrcaRouter-Lite)도 함께 제공한다.

◆ 한눈에 보기

· 발행 기관 : CONTINUUM AI PTE. LTD.

· 분류 : 인공지능, 인터넷, CONTINUUM AI PTE. LTD.

· 배포 : 2026년 10월 11일 오후 12시 36분

출처 : CONTINUUM AI PTE. LTD. 보도자료(뉴스와이어)

· · · · · · · · · ·

관련기사

▶ OrcaRouter, 제공자 25곳 자체 API 키 연결 셀프 설정, 현재 수수료 0%

▶ OrcaRouter, AI 에이전트 판단 데이터 358건 공개…거부는 5%뿐

▶ OrcaRouter, 개인정보를 가짜 값으로 바꿔 보내는 Data Cloak 무료 공개

· · · · · · · · · ·

스페셜타임스는 AI 기술의 도움을 받아 더 빠르고 다양한 뉴스를 독자에게 전달하기 위해 노력하고 있습니다.

스토리하나 — 오늘 밤 읽을 소설, 스토리하나에서

저작권자 © 스페셜타임스 무단전재 및 재배포 금지