Hugging Face의 Orca Incident Alignment(OIAS v1.1) 데이터 카드 첫 화면. 제목 아래에 실제 AI 에이전트 실패에서 재구성한 의사결정 지점 데이터셋이라는 설명이 놓이고, 라이선스와 버전 표기가 함께 보인다 (사진= CONTINUUM AI PTE. LTD. 제공)

컨티뉴엄 AI(CONTINUUM AI)가 개발한 OpenAI 호환 LLM 게이트웨이인 OrcaRouter가 실제 AI 에이전트 실패 사례를 의사결정 지점으로 재구성한 공개 데이터셋 OIAS(Orca Incident Alignment)를 공개했다. 목표는 에이전트를 더 겁 많게 만드는 것이 아니라 언제 실행해도 되는지와 언제 절대 안 되는지를 구분하게 만드는 것이다.

다섯 판정, 하나의 질문

OIAS가 각 후보 행동에 붙이는 판정은 다섯 가지다. ALLOW(그대로 실행), CONFIRM(사용자 확인 먼저), VERIFY(먼저 검증), ESCALATE(상위 판단으로 넘김), BLOCK(실행 금지)가 그것이다. 문서는 이 다섯을 ‘위험해 보이는 것은 전부 거부’의 반대편에 놓는다.

각 행동에는 판정과 함께 열 가지 행동 클래스 가운데 하나가 붙는다. CONTINUE_SAFELY, EXECUTE, REQUEST_CONFIRMATION, VERIFY, ESCALATE, REFUSE, REPORT 등이며, 모든 후보 행동은 클래스와 안전 플래그, 위반 항목, 설명, 교정안을 함께 들고 온다.

모델에게 필요한 것은 공포가 아니라 판단이다

전체 358개 레코드에 대해 기대되는 행동 클래스 분포는 CONTINUE_SAFELY 171, REQUEST_CONFIRMATION 68, EXECUTE 55, REFUSE 17, VERIFY 17, REPORT 17, ESCALATE 8, ROLLBACK 5다. REFUSE를 기대하는 항목의 비중은 5%다.

숫자가 말하는 바는 분명하다. 에이전트가 멈춰야 하는 순간은 소수이고, 대부분의 순간은 계속하되 조건을 붙이는 쪽이다. 위험한 요청을 승인된 작업과 구분하지 못하면 에이전트는 쓸모없어지고, 구분하지 않고 다 실행하면 위험해진다.

설정 표 기준으로 critic 1000건, decision 195건, preference 361건, reward 1000건, sft 195건, trajectory 58건, records 195건이 들어 있다. 표준 레코드는 55건이며, 각 레코드의 판단 지점을 뒤집거나 조건을 바꾼 반사실 변형 303건이 함께 실린다.

반사실 변형은 거부가 정답인 항목만 모은 것이 아니다. 거부 선택지가 틀린 레코드마다 ‘안전하게 끝내기 대 과잉 거부’ 쌍이 하나씩 생기며, 그런 쌍이 189건이다. 과잉 거부 자체를 학습 신호로 삼는 구조다.

거부만 하는 정책은 0점 아래로 간다

OIAS는 별도의 홀드아웃 벤치마크 IncidentBench와 함께 쓰도록 설계됐다. 저장소에는 참조 정책 네 가지의 점수가 공개돼 있다. 정답지 정책은 다섯 지표에서 0.00·0.00·1.00·+1.00·1.00을 기록한다.

같은 표에서 항상 거부하는 정책은 0.00·1.00·0.00·−0.20·0.23이다. 안전 지표 하나만 만점이고 나머지는 무너지며, 종합 점수는 0점 아래다. 문서는 항상 거부하는 정책이 위험한 행동을 하나도 저지르지 않지만 모든 정당한 작업을 막고 0점 아래로 간다고 적는다.

항상 첫 번째 선택지를 고르는 정책은 0.33·0.31·0.24·−0.12·0.67, 균일 무작위(시드 0)는 0.28·0.32·0.29·−0.02·0.22다. 아무렇게나 골라도, 무조건 거부해도 정답과 멀다.

모든 레코드는 인용된 출처에서 모델이 재구성했다. 생성 모델은 deepseek-v4.1-flash가 54건, claude-opus-4-8이 1건이며, 문서는 이를 ‘사람이 아니라 모델’이라고 명시한다. 다른 모델이 만든 레코드는 학습 분할이 아니라 홀드아웃 벤치마크로 간다. 학습 타깃은 100% deepseek-v4.1-flash로 재구성됐다.

검증은 어디까지 됐나

독립 모델 리뷰가 여러 차례 돌았다. v1.5에서 추가된 5개 레코드의 표준 항목과 라벨 반전 변형 11건은 블라인드 평가에서 11건 모두 평가자의 최선 선택이 허용 가능한 답으로 표시됐고, 모든 라벨 반전 변형이 의도한 방향으로 뒤집힌 것으로 평가됐다. 웹 팩트체크는 인용된 출처와 문장을 대조해 위치 표기와 출처 표기를 일부 교정했다.

데이터 소유자가 55건 전체를 승인했지만, 카드의 ‘human_verified’ 값은 false로 남아 있다. 출처를 사람이 다시 확인한 것이 아니라 모델 리뷰어가 확인했기 때문이다. 반사실 계획 303건 가운데 84건은 아직 ‘human_review_required’로 열려 있다. 권한이나 허가를 뒤집는 모든 변형, 그리고 위험한 행동을 정당한 것으로 만드는 모든 변형이 여기에 속한다.

모든 시나리오·맥락·상태 값에는 출처 표기가 붙는다. 그 내역은 ‘documented’ 5건, 인용 출처에서 바꿔 쓴 것 580건, 출처가 말하지 않은 것을 재구성한 것 1305건이다. 마지막 항목이 가장 많은 비중을 차지한다는 사실을 카드가 스스로 밝힌다.

짝을 이루는 IncidentBench는 공개 게이트 뒤에 있다. 게이트를 통과하지 않은 접근은 거부되며, 이 배치를 준비하며 확인한 시점(2026년 10월 7일)에 게이트된 경로는 HTTP 401을 돌려줬다. 학습 데이터는 공개돼 있고 벤치마크는 게이트돼 있다.

이 데이터가 하지 않는 주장

카드는 한계를 먼저 적는다. 55건은 설계상 작고, 영어 전용이며, 사례가 2025~2026년에 몰려 있고, 영어 보안 공개 문헌에 치우쳐 있다. 모델 기준선은 아직 돌리지 않았으며, 위에 적힌 점수는 사람이 정의한 참조 정책의 것이지 모델의 성능이 아니다. 라벨은 사람이 검증한 것이 아니라 모델 리뷰와 소유자 승인을 거친 것이므로 하나의 신중한 판단으로 다루되 위험이 몰려 있는 84건은 열린 문제로 보라는 것이 카드의 요청이다.

OrcaRouter는 단일 API 키와 엔드포인트로 다음을 포함한 200개 이상의 모델을 제공한다.

· OpenAI GPT-6.1 Sol

· Anthropic Claude Sonnet 5.5

· Anthropic Claude Opus 5.5

· OpenAI GPT-6 Astra

· DeepSeek V4.1 Flash

· Z.ai GLM-5.3 Flash

· Qwen 3.8 Max

· OIAS 데이터셋 (Orca Incident Alignment)

· 데이터 보호 개요

· OrcaRouter 모델 목록

· OrcaRouter 웹사이트

OrcaRouter 소개

OrcaRouter는 OpenAI 호환 LLM 게이트웨이로, 200개가 넘는 모델에 걸쳐 라우팅하며 약 40%의 비용 절감, 1밀리초 미만의 라우팅 오버헤드, 0%의 토큰 마크업을 제공한다. 자체 호스팅 에디션인 OrcaRouter-Lite는 MIT 라이선스로 제공된다.

CONTINUUM AI PTE. LTD. 소개

컨티뉴엄 AI(Continuum AI Pte. Ltd.)는 최첨단 AI를 개발자와 팀이 접근 가능하고 합리적인 비용으로 사용할 수 있도록 하기 위해 설립된 싱가포르 기반 기업이다. 단일 API 키와 엔드포인트를 통해 200개 이상의 선도적인 AI 모델에 대한 액세스를 제공하는 OpenAI 호환 AI Gateway인 ‘OrcaRouter’를 개발한 회사다. OrcaRouter는 약 40%의 비용 절감, 1ms 미만의 라우팅 오버헤드, 토큰 마크업 없음을 제공하며, MIT 라이선스로 출시된 자체 호스팅 버전(OrcaRouter-Lite)도 함께 제공한다.

◆ 한눈에 보기

· 발행 기관 : CONTINUUM AI PTE. LTD.

· 분류 : 보안, 인터넷, CONTINUUM AI PTE. LTD.

· 배포 : 2026년 10월 8일 오후 1시 41분

출처 : CONTINUUM AI PTE. LTD. 보도자료(뉴스와이어)

· · · · · · · · · ·

관련기사

▶ OrcaRouter, 개인정보를 가짜 값으로 바꿔 보내는 Data Cloak 무료 공개

▶ OrcaRouter, 입출력 같은 값 두 모델 비교…긴 문서는 청구서 갈려

▶ 북한 화성-11 미사일 부품 51.9% 위조·의심 판정

· · · · · · · · · ·

스페셜타임스는 AI 기술의 도움을 받아 더 빠르고 다양한 뉴스를 독자에게 전달하기 위해 노력하고 있습니다.

스토리하나 — 오늘 밤 읽을 소설, 스토리하나에서

저작권자 © 스페셜타임스 무단전재 및 재배포 금지