SITE SEARCH

검색

사이트 전체 글을 빠르게 찾을 수 있습니다.

RSS FEED

RSS 구독

RSS 리더에서 Project Research의 새 글을 바로 받아볼 수 있습니다.

EMAIL SUBSCRIBE

이메일 구독

새 글을 이메일로 받아봅니다. RSS는 별도 RSS 아이콘을 눌러 동일한 크기의 패널에서 열 수 있습니다.

이메일로 블로그 구독하기

이 블로그를 구독하고 이메일로 새글의 알림을 받으려면 이메일 주소를 입력하세요







좋은 엔진은 없다, 맞는 엔진이 있다 — Codex/Sol vs Claude/Fable 5대 실전 비교

시리즈

Field Whitepaper · Engine Comparison

RAG 검색, 10년 전략보고, 고객·조직·제품·리스크, 재무, PO·PM·PL 온톨로지까지. 결론은 뜻밖이었습니다. 총점 차이는 0.4점, 사실상 동률이었습니다.

Executive Summary · 바쁜 분을 위한 3줄 요약
  1. Sol은 증거 엔진에 가까웠습니다. 대량 수집, 정규화, 대사, 수식, 테스트, 스냅샷에서 우세했습니다.
  2. Fable은 의미 엔진에 가까웠습니다. 온톨로지, 경영 맥락, 설명, 교육, 의사결정 프레임에서 우세했습니다.
  3. 최종 딜리버리는 합성이 답이었습니다. 데이터 정본은 Sol, 의미·서사는 Fable, 기준일·Actual·보안은 사람이 승인해야 했습니다.
공개본 데이터 처리
이 글은 실제 제조기업 프로젝트를 기반으로 하지만 고객사 내부 원문, 인명, 거래처, 금액, 상세 리스크는 비식별화했습니다. 공개 승인 전까지 고객사명과 내부 절대수치는 싣지 않습니다.

이하 RAG는 검색 증강 생성(RAG), KPI는 핵심성과지표(KPI), HITL은 인간 검토(HITL)를 뜻합니다.

특집 · 3부작 · 실측 비교
모델·엔진 고르기 — 3편 중 3번째 글입니다
① 모델 교체
Fable 5와 보낸 첫 하루 — 모델 × 하네스 × RAG, PM 컨설턴트의 모델 교체 실측 회고
Fable 5 첫날 — 모델 × 하네스 × RAG 중 무엇이 성과를 바꿨나
② 같은 모델, 다른 설정
같은 Opus인데 결과가 갈렸다 — Claude Code 'xhigh vs ultracode' 실측 벤치마크와 업무별 사용 판단표
xhigh vs ultracode — 같은 Opus인데 결과가 갈린 지점
③ 엔진 대 엔진 · 지금 읽고 계신 글
좋은 엔진은 없다, 맞는 엔진이 있다 — Codex/Sol vs Claude/Fable 5대 실전 비교
Codex/Sol vs Claude/Fable — 5대 실전 비교
"어느 모델이 제일 좋은가"에 답하지 않는 연작 — 같은 일을 여러 엔진·설정으로 돌려보고 어디서 갈리는지를 기록했습니다. 결론은 매번 "업무에 따라 다르다"였고, 그 '다름'의 축을 셋 다 다르게 잡았습니다. 특집 안내 보기 →

01 · Method“어느 모델이 더 똑똑한가” 대신 결과물을 감사했습니다

일반적인 모델 비교는 정답률이나 코딩 벤치마크로 끝납니다. 기업 업무에서는 그것만으로 부족합니다. 검색 갱신, 온톨로지 경계, 원장 대사, 다음 의사결정까지 함께 봐야 합니다.

107
주말 커밋
17
closeout 전수 검토
4
재무 워크북 독립 검사
5
업무 주제 비교

주말 작업 중 다섯 개 핵심 업무를 결과물 단위로 비교했습니다.

평가는 근거 커버리지 20점, 정확성·검증 20점, 온톨로지·설명력 15점, 의사결정 유용성 20점, 운영·재현성 15점, 보안·거버넌스 10점으로 구성했습니다. 점수는 관측 사실을 명시적 루브릭에 매핑한 분석값이며 개별 점수의 불확실성은 ±3점입니다.

인과 우열을 주장하지 않는 이유
이번 작업은 동일 프롬프트·동일 시간·동일 도구를 통제한 무작위 블라인드 A/B가 아닙니다. 두 엔진이 서로의 산출물을 이어받은 구간도 있습니다. 따라서 “이번 용도에 더 적합”은 말할 수 있지만 “모델 자체가 항상 더 우수하다”고 일반화할 수는 없습니다.

관측·검증·해석·미확인을 분리했습니다

라벨이번 비교에서의 적용
O · 관측원문·세션·산출물에서 직접 확인커밋, closeout, 앱·워크북 구조.
V · 재검증현재 환경에서 독립적으로 다시 검사워크북 4개 수식, 앱 구문, 링크·렌더.
I · 해석관측값을 루브릭에 매핑한 판단주제별 점수와 엔진 배치 권고.
U · 미확인원천 또는 실측이 아직 부족검색 골든 질문, 운영 Actual, 삭제된 세션.

세션·토큰·시간은 별도 감사했습니다

감사 시간창은 2026년 7월 11일 00:00부터 13일 00:00까지, 한국시간 48시간입니다. 토큰은 로컬 사용량 원장에서 중복을 제거해 합산했고, 시간은 첫 이벤트부터 마지막 이벤트까지의 로그 span입니다.

감사 항목Codex 계열Claude 계열
범위 내 신규 세션33개
루트 9 + 자식 24
326개
주 세션 74 + 자동 harness 252
입력 토큰11억 8,444만
cache hit 11억 5,132만 포함
5억 1,391만
uncached 111만 + cache write 2,536만 + cache read 4억 8,743만
출력 토큰391.99만318.20만
세션 span 합27시간 54분 45초93시간 53분 19초
겹침 제거 로그 커버리지15시간 12분 33초30시간 22분 20초
토큰과 시간을 승패로 읽지 않은 이유
Codex의 cache hit는 입력 토큰의 부분집합이고 Claude는 cache write·read를 별도 필드로 기록합니다. 세션 span 합은 병렬 작업을 중복 계산해 48시간을 넘을 수 있고, 겹침 제거 값도 idle을 포함할 수 있습니다. 더구나 Codex에는 Terra 라벨 1개 세션이, Claude에는 Fable 5 외 Opus 4.8·Haiku 4.5 응답이 섞였습니다. 이 표는 실제 하네스 사용량 감사이지 순수 모델 속도·가격·품질 벤치마크가 아닙니다.

초기 Claude 로그 78개 집계는 주 원장의 파일 단면이었습니다. 이번 토큰 감사는 시간창 안에 시작된 자동 harness 252개까지 포함해 326개 신규 세션으로 범위를 재정의했습니다.

02 · Scoreboard종합 점수 86.8 대 87.2 — 0.4점 차이는 동률입니다

1. RAG·온톨로지 검색Sol 88 · Fable 84
Sol
88
Fable
84
2. 10년 주간·전략보고Sol 85 · Fable 87
Sol
85
Fable
87
3. 고객·조직·제품·리스크Sol 82 · Fable 90
Sol
82
Fable
90
4. 재무 데이터 분석Sol 92 · Fable 85
Sol
92
Fable
85
5. PO·PM·PL 온톨로지Sol 87 · Fable 90
Sol
87
Fable
90

동등가중 평균: Sol 86.8 · Fable 87.2. 차이 0.4점은 판단 오차 ±3점보다 작습니다.

Evidence Engine
Sol
대량 수집 · 정규화 · 수식 · 대사 · 테스트 · 스냅샷 · 롤백
+
Meaning Engine
Fable
온톨로지 · 도메인 맥락 · 경영 서사 · 교육 · 질문 · 의사결정
공통 Evidence Layer → 사람의 실적(Actual)·기준일·보안 승인 → 운영.

2×2로 보면 두 엔진의 작업 성향이 선명합니다

원천 처리기계 검증을 우선서사·방법론을 우선
원천 격리·전수Codex/Sol
대량 파싱·대사·수식·테스트·해시·스냅샷.
이번 관측에서는 뚜렷하지 않음.
도메인 맥락 통합이번 관측에서는 뚜렷하지 않음.Claude/Fable
온톨로지·표준 연결·경영 서사·교육·질문 체계.

5개 주제를 다시 가로지르는 7축 판정

비교 축맥락 한정 판정이유
그라운딩상호보완원천 격리와 도메인 통합이 서로 다른 오류를 잡음.
검증 강제Sol대사·테스트·수식·스냅샷이 기계적으로 남음.
원천 데이터 깊이Sol전수 처리와 추적 가능한 정본 구축이 강함.
프레임·방법론Fable온톨로지·표준·경영 질문으로 의미를 구조화함.
산출 엔진용도별운영 도구는 Sol, 설명·교육 자산은 Fable.
청자 전달력Fable임원 서사·읽는 법·변화관리까지 연결함.
정직성 표기둘 다상태·한계·불확실성을 서로 다른 방식으로 드러냄.

7축 중 Sol 2축, Fable 2축, 상호보완·용도별·공동 우위 3축입니다. 총점 동률과 같은 결론을 다른 관점에서도 확인했습니다.

03 · Topic 1RAG·온톨로지 검색 — Sol은 운영, Fable은 활용 설계

SOL

검색 가능한 문서보다 “검증 가능한 스냅샷”을 만들었습니다

깊은 수집, 접근 상태, 문서·청크 계약, 비식별화, 증감 기록, 실패 시 미승격을 운영 체계로 묶었습니다. 검색 앱도 단순 검색창을 넘어 조직·성과·핵심성과지표(KPI)·리스크·보고서 뷰를 갖춘 cockpit으로 확장됐습니다.

강점: 수집량·재현성·접근제어(ACL)·운영성. 한계: 확대 인덱스의 골든 질문 A/B가 남아 있어 문서량 증가를 품질 증가로 단정할 수 없습니다.
FABLE

검색 기능을 조직별 활용 시나리오로 번역했습니다

하이브리드 검색, 파셋, 3층 온톨로지와 조직별 질문·결정·확산 게이트를 함께 설명했습니다. 설치·운영자·사용자 가이드도 제공해 변화관리의 빈칸을 줄였습니다.

강점: 온톨로지·로드맵·조직 활용. 한계: 상대적으로 작은 초기 코퍼스와 일부 목표치의 미실측.

RAG는 원본 규모와 수집계약을 함께 봐야 합니다

80,514
심화 RAG 문서
98,932
심화 RAG 청크
468
보존 원본 첨부
809.1MB
첨부 원본 용량
원천 규모7월 12일 화면·원본 보존7월 13일 페이지네이션 심화
맵·목록48맵·241 화면42맵·5,103 목록 페이지
문서·청크원 상세 5,814건·clean chunk 5,818건문서 80,514건·청크 98,932건
첨부원본 468개·809.1MB·SHA-256 463종참조 23,408개·원본 다운로드 0MB
저장·검증약 4.0GB·검토 파일 24,720개·PDF 6,059개8/8 검증·접근 성공률 99.887%
계측 실행시간약 39분 18초50분 46초
5,814 → 80,514를 ‘13.8배 품질 향상’이라 부르지 않았습니다
전자는 화면·첨부 원본 보존 중심, 후자는 페이지네이션 심화·첨부 참조 중심입니다. 수집 깊이와 계약이 달라 절대량을 직접 전후 비교할 수 없습니다. 확인된 것은 커버리지 확대이며, 검색 유용성은 골든 질문 A/B로 별도 검증해야 합니다.

출처: 비식별화 수집 원장(2026-07-12)과 주간 RAG 심화수집 원장(2026-07-13).

Microsoft의 공식 GraphRAG 문서도 단순 벡터 검색은 분산된 사실을 연결하거나 전체 주제를 이해하는 데 약할 수 있다고 설명합니다. 그래프와 커뮤니티 요약이 필요한 이유입니다. 다만 그래프가 존재한다는 사실과 질문 성능이 좋아졌다는 사실은 분리해 검증해야 합니다. Microsoft GraphRAG 공식 문서.

04 · Topic 210년 주간·전략보고 — Sol은 시간을 복원하고, Fable은 의미를 복원했습니다

장기 데이터의 가치는 오래된 문서를 많이 찾는 데 있지 않습니다. 반복 문제의 주기, 전략의 변경 이유, 중단과 재기준선, 다음 결재 전에 소환할 유사 사례가 보여야 합니다.

공개 가능한 자사 10년 기록 자산화 보조 실험
별도 자사 코퍼스에서는 원본 792개를 해시로 대조해 중복 498개를 제거하고, 294개 고유 파일에서 320개 재사용 후보를 선별했습니다. 모든 후보는 원본 경로·locator·SHA-256을 보유했고 11개 검사를 통과했습니다. 다만 아직 사람 검수 전 후보이므로 실제 재사용 성과로 계산하지 않았습니다.
가치Sol 기여Fable 기여남은 검증
종단 커버리지snapshot·delta·manifest연대기·전략 계보수정 이력 API.
반복 패턴활동·이슈 회수원인·교훈 해석독립 원장 대조.
경영 활용검색·보고 뷰CEO 질문·결정 문법Actual·owner·threshold.
유용성 판정
Sol이 “무엇이 있었는가”를 재현 가능하게 만들고, Fable이 “그래서 무엇을 결정할 것인가”를 만들었습니다. 한쪽만으로는 장기 데이터가 검색창 또는 이야기책에 머뭅니다.

05 · Topic 3고객·조직·제품·경영리스크 — Fable의 의미모델이 앞섰습니다

이 영역에서는 Fable이 우세했습니다. 회사→부서→직무, 고객→제품→이슈, 위험→조기경보→경영 질문이 하나의 좌표계로 이어졌기 때문입니다. Sol의 cockpit은 조직별 보고와 다중 관점 탐색을 제공했지만, 관계의 의미와 사용 규칙은 Fable이 더 깊었습니다.

관점SolFable주의
고객대량 기록 회수계정 맥락·질문최신 상태·승인.
조직조직별 보고 뷰역할·운영 리듬현행 인사 원장.
제품개발 이력 연결공법·품질·IP 관계품목 변경이력.
리스크변화·이슈 탐지반복 패턴·조기경보임계치 실측 보정.

온톨로지는 멋진 그래프가 아니라 도메인의 용어와 관계를 명시하는 계약입니다. W3C OWL 2도 온톨로지를 특정 도메인의 용어와 관계를 형식화한 어휘로 설명합니다. W3C OWL 2 Overview.

06 · Topic 4재무 데이터 — Sol은 감사 엔진, Fable은 관리 체계

재무 워크북 네 개를 독립적으로 다시 열어 시트와 수식을 검사했습니다. 실제 수식 오류는 양쪽 모두 0건이었습니다.

16
Sol 총 시트
15
Fable 총 시트
2,712
Sol 총 수식
2,198
Fable 총 수식

워크북 구조와 반응형 수식의 범위를 비교한 보조 지표입니다.

수식 수가 많다고 더 좋은 모델은 아닙니다. 그것은 사용자가 값을 바꿨을 때 자동으로 반응하는 표면이 얼마나 넓은지 보여주는 보조 지표입니다. 실제 차이는 설계에서 나타났습니다.

항목SolFable
원천 처리원장 전수 파싱·대사TB·공시·회의·도메인 통합.
워크북Checks·Sources·살아있는 수식예측·정밀도·계정 온톨로지.
사용자 가치부족·이상징후·조치읽는 법·교육·방법론.
최적 역할데이터 정본해석·전달 레이어.
교차 비교가 발견한 가장 값진 것
양쪽이 서로 다른 재무제표 기준을 사용한 차이가 드러났습니다. 각각 내부적으로 맞더라도 기준이 다르면 합치면서 오류가 됩니다. 이중 생성의 진짜 가치는 “두 답 중 하나를 고르는 것”보다 기준 불일치를 표면화하는 데 있었습니다.

07 · Topic 56년 PO·PM·PL 온톨로지 — 분류는 완성됐지만 Actual은 부족했습니다

Sol은 corpus를 전수 재구성하고 탐색용 Atlas를 만들었습니다. Fable은 포트폴리오·프로그램·유형·역할·게이트·성숙도·증거 축을 정본화했습니다. 결과적으로 합성 예시 중심 자산이 실제 occurrence 중심 레퍼런스 라이브러리로 바뀌었습니다.

666
실제 occurrence
6·14·12
Portfolio·Program·Archetype
666/666
분류 합계 검사
1
측정 Actual

666건 뒤에 있는 원본 장부 규모

원천 계층규모해석
전체 lineage5개 고객군·48 source set·50 source-file 선언차수·워크숍·원장 묶음. 전체 저장소 물리 파일 수와 같지 않음.
관측 단위666 occurrence고유 프로젝트 수가 아니라 차수별 관측 건수.
심층 원본 subset35파일2022년 24파일 + 2024년 11파일.
구조 증거 subset1,104 worksheet·69 PDF page·58 DOCX page이질 단위이므로 하나의 총레코드로 합산하지 않음.
내용 증거 subset761 evidence unit·1,730 포함 응답셀template 후보와 비식별 규칙 포함.
운영 실측Actual 1/666분류 완성도와 성과 검증 사이의 핵심 간극.

출처: PO·PM·PL source-set ledger와 외부 원본 coverage audit(2026-07-12).

가장 중요한 한계
분류 합계가 모두 맞는 것과 실제 프로젝트 성과가 검증됐다는 것은 다른 이야기입니다. 운영 Actual이 연결된 사례는 극소수였습니다. 현재 최대 부채는 더 정교한 온톨로지가 아니라 ALM·BI·시험·재무 원장과의 Actual connector입니다.

관련 실무 템플릿은 PM 온톨로지맵과 개인 RAG에서 볼 수 있습니다.

08 · Limitations정직한 한계 — 이 글은 성향 관찰이지 영구 순위가 아닙니다

표만 인용하면 오독할 수 있습니다
동일 입력·시간·도구를 통제한 눈가림 시험이 아니며, 일부 작업은 순차 협업이었습니다. 로컬에 남은 세션·커밋·closeout·산출물을 감사했으므로 삭제되거나 비가시적인 세션까지 완전 복원했다고 주장하지 않습니다. Sol/Fable 또한 공개 표준 모델명이 아니라 관측된 로컬 라벨이며, 실제 로그에는 보조 모델이 섞였습니다.

토큰은 API·하네스가 기록한 workload이고, 세션 span은 병렬 실행과 idle을 포함할 수 있습니다. 따라서 토큰·세션 수·로그 커버리지로 생산성·가격·속도를 순위화하지 않았습니다. RAG의 두 스냅샷도 수집계약이 다르고, PO·PM·PL의 666건은 고유 프로젝트가 아닌 occurrence입니다.

따라서 점수는 모델의 보편적 능력치가 아니라 이번 결과물의 업무 적합도입니다. 0.4점 차이가 판단 오차 ±3점보다 작다는 사실도 같은 이유로 중요합니다. 고객사 원문과 금액·인명·거래처·상세 리스크는 공개본에서 제거했습니다.

09 · Operating Model결론 — Sol을 증거 레이어에, Fable을 의미 레이어에 배치합니다

업무1차 엔진2차 리뷰완료 정의
대량 수집·정규화·원장 대사SolFable 맥락 검토누락·대사·ACL·검증 PASS.
온톨로지·표준·경영 프레임FableSol 근거 추적경계·출처·불확실성 명시.
재무·운영 워크북SolFable 설명·교육Checks PASS + 읽는 법.
임원 보고·백서·교육FableSol 수치 감사결론·한계·원천 일치.
최종 고객 딜리버리합성사람 승인Actual·기준일·보안·인간 검토(HITL).

이 결론은 특정 벤더의 영구적 우열이 아닙니다. OpenAI는 Codex용 모델을 자율형 코딩에 맞춘 모델로 설명합니다. Anthropic은 Claude Code에서 별칭이나 전체 모델명으로 모델을 선택할 수 있다고 안내합니다. 이번 Sol/Fable 명칭은 공개 표준 모델명이 아니라 로컬 세션에서 관측된 라벨입니다. 따라서 결과를 전체 제품군으로 일반화하지 않습니다. OpenAI Codex model docs · Anthropic Claude Code CLI.

10 · Quick Start이번 주 바로 적용할 다섯 가지

실행 순서는 다음과 같습니다.

골든 질문 20개로 RAG A/B를 다시 돌립니다. 문서량과 검색 품질을 분리합니다.
재무제표 기준을 하나로 고정합니다. 개별·연결·기간·단위를 워크북 첫 화면에 표시합니다.
Actual connector 10건을 먼저 만듭니다. 온톨로지 확장보다 실측 원장 연결이 우선입니다.
작업 발주 시 1차 엔진과 2차 리뷰를 지정합니다. 같은 일을 두 번 시키는 비용을 줄입니다.
공개 전 비식별·법무·고객 승인 게이트를 둡니다. 내부 지식을 좋은 콘텐츠로 바꾸되 신뢰를 소모하지 않습니다.
🏢 현장 검증·사례 (Lv1–4)

Project Research에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기