AI AGENT GUILD
길드 소개길드 모임북극성 프로젝트 · BETA
AI 트렌드훈련 도크 · 세미나기업·기관 맞춤 교육포럼 & 어워드
AI 에이전트 항구자료실기업 컨설팅바운티 보드
로그인
트렌드로 돌아가기

LOGBOOK · WEEKLY BRIEFING

항해일지 · 위클리 브리핑

화제의 Ox Alpha, 정말 Fable 5보다 앞서는지 자세히 살펴봅니다

2026년 8월 23일
공유

초기 DeepSWE 10개 과제에서 Ox Alpha는 80%, Fable 5는 65%를 기록했습니다. 이 숫자만 보면 Ox Alpha가 앞섭니다. 그러나 더 큰 재시험에서는 Ox Alpha 약 63%, Fable 5 65%로 순서가 바뀌었습니다. 별도의 업무형 시험 평균도 Ox Alpha 65점, Fable 5 86점이었습니다. 이번 호는 서로 다른 숫자를 한 화면에서 비교하고, 어떤 조건에서 결과가 달라졌는지 설명합니다.

한눈에 보기

80 대 65, 이 숫자 하나로 결론 내리면 안 됩니다

Ox Alpha와 Fable 5의 초기 10개 과제, 부분 재시험과 별도 업무형 시험 점수를 공통 0–100 축으로 비교한 막대그래프

초기 10개 과제, 더 큰 재시험과 별도 업무형 시험을 나란히 놓으면 Ox Alpha와 Fable 5의 강점이 과제에 따라 달라집니다.

핵심 분석

Ox Alpha는 일부 코딩 과제에서 앞섰지만 전반적 우위는 확인되지 않았습니다

첫 비교는 DeepSWE 113개 중 10개 과제만 사용했습니다. Ox Alpha는 8개를 해결해 80%, Fable 5 Max는 과제마다 4번 실행한 평균이 65%였습니다. Ox Alpha가 15%p 앞섰지만 표본과 반복 횟수가 달라 방향을 보는 초기 결과에 가깝습니다.

이후 더 큰 DeepSWE 부분 재시험에서 Ox Alpha는 약 63%를 기록했습니다. 비교값인 Fable 5 Medium은 65%였습니다. 별도의 네 가지 업무형 시험 평균에서는 Ox Alpha 65점, Fable 5 86점이었습니다. 시험이 달라지자 순위도 바뀌었습니다.

숫자가 틀렸다는 뜻은 아닙니다. Ox Alpha는 첫 코딩 과제와 일부 지식 업무에서 강한 결과를 보였습니다. 다만 ‘Fable 5보다 좋다’고 일반화하려면 같은 설정, 같은 반복 횟수와 더 많은 과제가 필요합니다.

Ox Alpha는 어떤 AI인가

04 ITEMS
공식OpenCode

OpenCode가 한시적으로 제공한 스텔스 코딩 모델

OpenCode는 AI가 터미널에서 코드를 읽고 수정하도록 돕는 도구입니다. 현재 Ox Alpha를 무료로 시험할 수 있지만, 제작사와 자세한 모델 정보는 공개되지 않았습니다.

원문 보기 이 글 공유
공식OpenRouter

100만 토큰대 컨텍스트와 무료 프리뷰

OpenRouter는 Ox Alpha가 매우 긴 문서와 코드도 한 번에 읽을 수 있다고 안내합니다. 현재는 무료지만 시험 제공이 끝나면 가격과 이용 조건이 달라질 수 있습니다.

원문 보기 이 글 공유
데이터OpenCode Data

공개 직후 빠르게 늘어난 OpenCode 사용

2026년 8월 23일 OpenCode 통계에서 Ox Alpha는 최근 사용량 3위였습니다. 많은 사람이 써봤다는 뜻이지, 다른 AI보다 일을 더 잘한다는 뜻은 아닙니다.

원문 보기 이 글 공유
커뮤니티r/opencode

완성 경험과 중단 경험이 동시에 쌓인 현장

여러 파일을 고쳐 기능을 완성했다는 사용자도 있었지만, 작업 중 자주 멈추거나 같은 실수를 반복했다는 사용자도 있었습니다. 어떤 프로그램과 서버로 사용했는지에 따라 결과가 달라질 수 있습니다.

원문 보기 이 글 공유

숫자를 끝까지 비교하면

04 ITEMS
초기 시험독립 커뮤니티 시험

10개 과제: Ox Alpha 80%, Fable 5 65%

Ox Alpha는 10개 중 8개를 해결했습니다. Fable 5 Max는 같은 과제에서 65%를 기록했습니다. 다만 Ox Alpha는 과제당 1회, Fable 5는 과제당 4회 결과를 사용해 반복 조건이 다릅니다.

원문 보기 이 글 공유
재시험AI Primer

더 큰 부분 재시험: Ox Alpha 약 63%, Fable 5 65%

더 많은 DeepSWE 과제를 사용한 후속 시험에서는 Ox Alpha가 약 63%로 내려갔습니다. Fable 5 Medium 비교값보다 2%p 낮았으며, 이 결과도 113개 전체가 아닌 부분 시험입니다.

원문 보기 이 글 공유
업무형 시험Nate's AI Benchmark Suite

별도 4종 평균: Ox Alpha 65점, Fable 5 86점

지식 업무에서는 Ox Alpha가 92점으로 Fable 5의 81점을 앞섰습니다. 반면 데이터 정리, 조립 안내와 사실 기반 시각화에서는 Fable 5가 크게 앞서 업무 종류에 따른 편차가 확인됐습니다.

원문 보기 이 글 공유
방법DeepSWE 논문

DeepSWE 전체는 113개 과제로 구성됩니다

초기 10개 시험은 전체의 약 9%입니다. DeepSWE는 91개 저장소와 5개 언어의 113개 과제로 구성되므로 일반적인 우위를 말하려면 전체 또는 충분히 큰 동일 표본의 반복 시험이 필요합니다.

원문 보기 이 글 공유

SUBSCRIBE

새 항해일지를 받아보세요

뉴스레터를 구독하시면 항해일지를 이메일로 받아보실 수 있습니다.

뉴스레터 구독하기
AI 에이전트 길드

AI 에이전트를 배우고 실험하며, 실제 업무와 프로젝트로 연결하는 길드입니다.

항로 / Routes

  • 홈
  • AI 트렌드
  • 길드 커뮤니티

기항지 / Ports

  • 기업 컨설팅
  • AI 에이전트 항구
  • 북극성 프로젝트
  • 길드 소개

© 2026 AI 에이전트 길드 · Catalogue Raisonné

바운티 운영약관

All Dimensions Approximate