
Field Whitepaper · Engine Comparison
RAG 검색, 10년 전략보고, 고객·조직·제품·리스크, 재무, PO·PM·PL 온톨로지까지. 결론은 뜻밖이었습니다. 총점 차이는 0.4점, 사실상 동률이었습니다.
- Sol은 증거 엔진에 가까웠습니다. 대량 수집, 정규화, 대사, 수식, 테스트, 스냅샷에서 우세했습니다.
- Fable은 의미 엔진에 가까웠습니다. 온톨로지, 경영 맥락, 설명, 교육, 의사결정 프레임에서 우세했습니다.
- 최종 딜리버리는 합성이 답이었습니다. 데이터 정본은 Sol, 의미·서사는 Fable, 기준일·Actual·보안은 사람이 승인해야 했습니다.
이하 RAG는 검색 증강 생성(RAG), KPI는 핵심성과지표(KPI), HITL은 인간 검토(HITL)를 뜻합니다.
01 · Method“어느 모델이 더 똑똑한가” 대신 결과물을 감사했습니다
일반적인 모델 비교는 정답률이나 코딩 벤치마크로 끝납니다. 기업 업무에서는 그것만으로 부족합니다. 검색 갱신, 온톨로지 경계, 원장 대사, 다음 의사결정까지 함께 봐야 합니다.
주말 작업 중 다섯 개 핵심 업무를 결과물 단위로 비교했습니다.
평가는 근거 커버리지 20점, 정확성·검증 20점, 온톨로지·설명력 15점, 의사결정 유용성 20점, 운영·재현성 15점, 보안·거버넌스 10점으로 구성했습니다. 점수는 관측 사실을 명시적 루브릭에 매핑한 분석값이며 개별 점수의 불확실성은 ±3점입니다.
관측·검증·해석·미확인을 분리했습니다
| 라벨 | 뜻 | 이번 비교에서의 적용 |
|---|---|---|
| O · 관측 | 원문·세션·산출물에서 직접 확인 | 커밋, closeout, 앱·워크북 구조. |
| V · 재검증 | 현재 환경에서 독립적으로 다시 검사 | 워크북 4개 수식, 앱 구문, 링크·렌더. |
| I · 해석 | 관측값을 루브릭에 매핑한 판단 | 주제별 점수와 엔진 배치 권고. |
| U · 미확인 | 원천 또는 실측이 아직 부족 | 검색 골든 질문, 운영 Actual, 삭제된 세션. |
세션·토큰·시간은 별도 감사했습니다
감사 시간창은 2026년 7월 11일 00:00부터 13일 00:00까지, 한국시간 48시간입니다. 토큰은 로컬 사용량 원장에서 중복을 제거해 합산했고, 시간은 첫 이벤트부터 마지막 이벤트까지의 로그 span입니다.
| 감사 항목 | Codex 계열 | Claude 계열 |
|---|---|---|
| 범위 내 신규 세션 | 33개 루트 9 + 자식 24 | 326개 주 세션 74 + 자동 harness 252 |
| 입력 토큰 | 11억 8,444만 cache hit 11억 5,132만 포함 | 5억 1,391만 uncached 111만 + cache write 2,536만 + cache read 4억 8,743만 |
| 출력 토큰 | 391.99만 | 318.20만 |
| 세션 span 합 | 27시간 54분 45초 | 93시간 53분 19초 |
| 겹침 제거 로그 커버리지 | 15시간 12분 33초 | 30시간 22분 20초 |
초기 Claude 로그 78개 집계는 주 원장의 파일 단면이었습니다. 이번 토큰 감사는 시간창 안에 시작된 자동 harness 252개까지 포함해 326개 신규 세션으로 범위를 재정의했습니다.
02 · Scoreboard종합 점수 86.8 대 87.2 — 0.4점 차이는 동률입니다
동등가중 평균: Sol 86.8 · Fable 87.2. 차이 0.4점은 판단 오차 ±3점보다 작습니다.
2×2로 보면 두 엔진의 작업 성향이 선명합니다
| 원천 처리 | 기계 검증을 우선 | 서사·방법론을 우선 |
|---|---|---|
| 원천 격리·전수 | Codex/Sol 대량 파싱·대사·수식·테스트·해시·스냅샷. | 이번 관측에서는 뚜렷하지 않음. |
| 도메인 맥락 통합 | 이번 관측에서는 뚜렷하지 않음. | Claude/Fable 온톨로지·표준 연결·경영 서사·교육·질문 체계. |
5개 주제를 다시 가로지르는 7축 판정
| 비교 축 | 맥락 한정 판정 | 이유 |
|---|---|---|
| 그라운딩 | 상호보완 | 원천 격리와 도메인 통합이 서로 다른 오류를 잡음. |
| 검증 강제 | Sol | 대사·테스트·수식·스냅샷이 기계적으로 남음. |
| 원천 데이터 깊이 | Sol | 전수 처리와 추적 가능한 정본 구축이 강함. |
| 프레임·방법론 | Fable | 온톨로지·표준·경영 질문으로 의미를 구조화함. |
| 산출 엔진 | 용도별 | 운영 도구는 Sol, 설명·교육 자산은 Fable. |
| 청자 전달력 | Fable | 임원 서사·읽는 법·변화관리까지 연결함. |
| 정직성 표기 | 둘 다 | 상태·한계·불확실성을 서로 다른 방식으로 드러냄. |
7축 중 Sol 2축, Fable 2축, 상호보완·용도별·공동 우위 3축입니다. 총점 동률과 같은 결론을 다른 관점에서도 확인했습니다.
03 · Topic 1RAG·온톨로지 검색 — Sol은 운영, Fable은 활용 설계
검색 가능한 문서보다 “검증 가능한 스냅샷”을 만들었습니다
깊은 수집, 접근 상태, 문서·청크 계약, 비식별화, 증감 기록, 실패 시 미승격을 운영 체계로 묶었습니다. 검색 앱도 단순 검색창을 넘어 조직·성과·핵심성과지표(KPI)·리스크·보고서 뷰를 갖춘 cockpit으로 확장됐습니다.
검색 기능을 조직별 활용 시나리오로 번역했습니다
하이브리드 검색, 파셋, 3층 온톨로지와 조직별 질문·결정·확산 게이트를 함께 설명했습니다. 설치·운영자·사용자 가이드도 제공해 변화관리의 빈칸을 줄였습니다.
RAG는 원본 규모와 수집계약을 함께 봐야 합니다
| 원천 규모 | 7월 12일 화면·원본 보존 | 7월 13일 페이지네이션 심화 |
|---|---|---|
| 맵·목록 | 48맵·241 화면 | 42맵·5,103 목록 페이지 |
| 문서·청크 | 원 상세 5,814건·clean chunk 5,818건 | 문서 80,514건·청크 98,932건 |
| 첨부 | 원본 468개·809.1MB·SHA-256 463종 | 참조 23,408개·원본 다운로드 0MB |
| 저장·검증 | 약 4.0GB·검토 파일 24,720개·PDF 6,059개 | 8/8 검증·접근 성공률 99.887% |
| 계측 실행시간 | 약 39분 18초 | 50분 46초 |
출처: 비식별화 수집 원장(2026-07-12)과 주간 RAG 심화수집 원장(2026-07-13).
Microsoft의 공식 GraphRAG 문서도 단순 벡터 검색은 분산된 사실을 연결하거나 전체 주제를 이해하는 데 약할 수 있다고 설명합니다. 그래프와 커뮤니티 요약이 필요한 이유입니다. 다만 그래프가 존재한다는 사실과 질문 성능이 좋아졌다는 사실은 분리해 검증해야 합니다. Microsoft GraphRAG 공식 문서.
04 · Topic 210년 주간·전략보고 — Sol은 시간을 복원하고, Fable은 의미를 복원했습니다
장기 데이터의 가치는 오래된 문서를 많이 찾는 데 있지 않습니다. 반복 문제의 주기, 전략의 변경 이유, 중단과 재기준선, 다음 결재 전에 소환할 유사 사례가 보여야 합니다.
| 가치 | Sol 기여 | Fable 기여 | 남은 검증 |
|---|---|---|---|
| 종단 커버리지 | snapshot·delta·manifest | 연대기·전략 계보 | 수정 이력 API. |
| 반복 패턴 | 활동·이슈 회수 | 원인·교훈 해석 | 독립 원장 대조. |
| 경영 활용 | 검색·보고 뷰 | CEO 질문·결정 문법 | Actual·owner·threshold. |
05 · Topic 3고객·조직·제품·경영리스크 — Fable의 의미모델이 앞섰습니다
이 영역에서는 Fable이 우세했습니다. 회사→부서→직무, 고객→제품→이슈, 위험→조기경보→경영 질문이 하나의 좌표계로 이어졌기 때문입니다. Sol의 cockpit은 조직별 보고와 다중 관점 탐색을 제공했지만, 관계의 의미와 사용 규칙은 Fable이 더 깊었습니다.
| 관점 | Sol | Fable | 주의 |
|---|---|---|---|
| 고객 | 대량 기록 회수 | 계정 맥락·질문 | 최신 상태·승인. |
| 조직 | 조직별 보고 뷰 | 역할·운영 리듬 | 현행 인사 원장. |
| 제품 | 개발 이력 연결 | 공법·품질·IP 관계 | 품목 변경이력. |
| 리스크 | 변화·이슈 탐지 | 반복 패턴·조기경보 | 임계치 실측 보정. |
온톨로지는 멋진 그래프가 아니라 도메인의 용어와 관계를 명시하는 계약입니다. W3C OWL 2도 온톨로지를 특정 도메인의 용어와 관계를 형식화한 어휘로 설명합니다. W3C OWL 2 Overview.
06 · Topic 4재무 데이터 — Sol은 감사 엔진, Fable은 관리 체계
재무 워크북 네 개를 독립적으로 다시 열어 시트와 수식을 검사했습니다. 실제 수식 오류는 양쪽 모두 0건이었습니다.
워크북 구조와 반응형 수식의 범위를 비교한 보조 지표입니다.
수식 수가 많다고 더 좋은 모델은 아닙니다. 그것은 사용자가 값을 바꿨을 때 자동으로 반응하는 표면이 얼마나 넓은지 보여주는 보조 지표입니다. 실제 차이는 설계에서 나타났습니다.
| 항목 | Sol | Fable |
|---|---|---|
| 원천 처리 | 원장 전수 파싱·대사 | TB·공시·회의·도메인 통합. |
| 워크북 | Checks·Sources·살아있는 수식 | 예측·정밀도·계정 온톨로지. |
| 사용자 가치 | 부족·이상징후·조치 | 읽는 법·교육·방법론. |
| 최적 역할 | 데이터 정본 | 해석·전달 레이어. |
07 · Topic 56년 PO·PM·PL 온톨로지 — 분류는 완성됐지만 Actual은 부족했습니다
Sol은 corpus를 전수 재구성하고 탐색용 Atlas를 만들었습니다. Fable은 포트폴리오·프로그램·유형·역할·게이트·성숙도·증거 축을 정본화했습니다. 결과적으로 합성 예시 중심 자산이 실제 occurrence 중심 레퍼런스 라이브러리로 바뀌었습니다.
666건 뒤에 있는 원본 장부 규모
| 원천 계층 | 규모 | 해석 |
|---|---|---|
| 전체 lineage | 5개 고객군·48 source set·50 source-file 선언 | 차수·워크숍·원장 묶음. 전체 저장소 물리 파일 수와 같지 않음. |
| 관측 단위 | 666 occurrence | 고유 프로젝트 수가 아니라 차수별 관측 건수. |
| 심층 원본 subset | 35파일 | 2022년 24파일 + 2024년 11파일. |
| 구조 증거 subset | 1,104 worksheet·69 PDF page·58 DOCX page | 이질 단위이므로 하나의 총레코드로 합산하지 않음. |
| 내용 증거 subset | 761 evidence unit·1,730 포함 응답셀 | template 후보와 비식별 규칙 포함. |
| 운영 실측 | Actual 1/666 | 분류 완성도와 성과 검증 사이의 핵심 간극. |
출처: PO·PM·PL source-set ledger와 외부 원본 coverage audit(2026-07-12).
관련 실무 템플릿은 PM 온톨로지맵과 개인 RAG에서 볼 수 있습니다.
08 · Limitations정직한 한계 — 이 글은 성향 관찰이지 영구 순위가 아닙니다
토큰은 API·하네스가 기록한 workload이고, 세션 span은 병렬 실행과 idle을 포함할 수 있습니다. 따라서 토큰·세션 수·로그 커버리지로 생산성·가격·속도를 순위화하지 않았습니다. RAG의 두 스냅샷도 수집계약이 다르고, PO·PM·PL의 666건은 고유 프로젝트가 아닌 occurrence입니다.
따라서 점수는 모델의 보편적 능력치가 아니라 이번 결과물의 업무 적합도입니다. 0.4점 차이가 판단 오차 ±3점보다 작다는 사실도 같은 이유로 중요합니다. 고객사 원문과 금액·인명·거래처·상세 리스크는 공개본에서 제거했습니다.
09 · Operating Model결론 — Sol을 증거 레이어에, Fable을 의미 레이어에 배치합니다
| 업무 | 1차 엔진 | 2차 리뷰 | 완료 정의 |
|---|---|---|---|
| 대량 수집·정규화·원장 대사 | Sol | Fable 맥락 검토 | 누락·대사·ACL·검증 PASS. |
| 온톨로지·표준·경영 프레임 | Fable | Sol 근거 추적 | 경계·출처·불확실성 명시. |
| 재무·운영 워크북 | Sol | Fable 설명·교육 | Checks PASS + 읽는 법. |
| 임원 보고·백서·교육 | Fable | Sol 수치 감사 | 결론·한계·원천 일치. |
| 최종 고객 딜리버리 | 합성 | 사람 승인 | Actual·기준일·보안·인간 검토(HITL). |
이 결론은 특정 벤더의 영구적 우열이 아닙니다. OpenAI는 Codex용 모델을 자율형 코딩에 맞춘 모델로 설명합니다. Anthropic은 Claude Code에서 별칭이나 전체 모델명으로 모델을 선택할 수 있다고 안내합니다. 이번 Sol/Fable 명칭은 공개 표준 모델명이 아니라 로컬 세션에서 관측된 라벨입니다. 따라서 결과를 전체 제품군으로 일반화하지 않습니다. OpenAI Codex model docs · Anthropic Claude Code CLI.
10 · Quick Start이번 주 바로 적용할 다섯 가지
실행 순서는 다음과 같습니다.
- M-1 Agentic PM 시리즈 진입 가이드 — 전체를 한 장으로
- Z-1 실록(Sillok) — 5세기 Audit-Grade 거버넌스를 LLM 운영에 빌려온 한국형 LLMOS 하네스
- Z-2 실록(Sillok) 2026 상반기 결산 — RAG·고객사·지능화 루프·오픈소스
- Z-3 하네스×RAG 기업 컨설팅 — 네 현장·환각 방지·TOP10 자가진단·진화 루프
- Z-4 하네스 엔지니어링 백서 — Weng 하네스론×실록 구조 매핑·자기개선 루프·정직한 결산
- Z-5 에이전트 스킬 수명주기 백서 — Dynamic Agent Skills 8단×실록 매핑(7 온전+1 갭)·분기 12문항 레퍼런스·PO/PM/PL 컨설팅 직역
- K-1 Agentic 시대, PM의 온톨로지맵 — Obsidian을 통해 나만의 RAG를 만드는 법
- K-2 Karpathy의 LLM과 Obsidian 지식 결합
- K-3 Karpathy의 autoresearch: PM에서의 적용 사례
- K-5 Karpathy LLM OS 시각으로 본 AX PM/PL 역량 — Claude Code 소스 교차 분석
- K-6 30시간 RAG 실측 — Karpathy llm-wiki vs obsidian-vault 양강 비교
- K-7 구글 OKF·Obsidian Vault·llm-wiki — 무엇을 어떻게 시작할까
- K-8 Obsidian × LLM 4만 노트 — 개인 RAG 최종 아키텍처 5층
- K-9 PM 온톨로지맵 템플릿 배포판 — 30분에 채우는 5칸
- P-0 7인의 사고 체계 종합 프레임워크
- P-1 Karpathy: 제약 설계 + 닫힌 루프
- P-2 Sutskever: 압축이 곧 지능이다
- P-3 Hassabis: 제1원리 분해
- P-4 LeCun: 세계 모델 + 예측
- P-5 Hinton: 거버넌스 + 자기부정
- P-6 Ng: AI 전환 플레이북
- P-7 Fei-Fei Li: 인간중심 설계
- P-8 Builders 종합: Boris·Cat·Truell·Masad·Murati·Brockman
- P-9 Operators 종합: Altman·Amodei·Nadella·Pichai·Zuckerberg·Suleyman
- P-10 Hardware 양강: Jensen Huang · Lisa Su
- P-11 DeepSeek 량원펑 — 연속 학습의 공백과 하네스
- X-1 AI/AX 2030 전략: McKinsey, BCG, Accenture, Deloitte, Gartner 교차 분석
- X-2 빅테크 리더십 격변과 AX 전략
- X-3 2026년 GitHub에서 주목할 프로젝트와 AI 전환 신호
- X-4 AI 에이전트 2026 상반기 대해부 — 지금 무슨 일이, 리더는 무엇을
- W-1 Agentic 월간 관전포인트 2026-05 — 가우스+빅테크 듀얼 모델 시대
- W-2 Agentic 2026 상반기 총결산 — 다섯 축 6개월
- E-1 AI 네이티브 기업 전환 — CHO·PMO 재정의
- E-2 한국 기업 AX 2030 (Capstone)
- E-3 NH농협은행 SAFe 애자일 3년 — 페이스메이킹의 기록
- E-4 하나은행 × BCG 애자일 전환 — 두 개의 리듬으로
- E-5 네이버랩스 AKI — 하이브리드 애자일 PMO로 7개 제품을 한 박자로
- S-1 Agentic PM의 시대가 열리다 — LG전자 SW PM 워크숍을 마치며
- S-2 삼성전자 PMC: AI와 함께하는 PM 교육 혁신
- S-3 SKT Agent 도출을 위한 AI 퍼실리테이션 기법
- S-4 리스크는 그릇이었다 — LG전자 SW공학연구소 GenAI RISK 워크숍
- S-5 코드 한 줄 없이 손익관리팀이 만든 에이전트 — 신한EZ손해보험
- S-6 “어디까지 입력해도 되나요?” — 삼성 구매 현장의 Agentic 각성
- S-7 지금 Agentic으로 전환해야 하는 이유 — 삼성·LG·KT·Clean&Science 300여 분의 증명
- S-8 ‘바이브 프로젝트 매니징’을 스스로 이름 붙였습니다 — 현대모비스 편
- S-9 “대충 시키면 다 해줄 줄 알았는데” — SK쉴더스 보안 PM들의 이틀
- S-10 휴맥스 전사 ALM 정착 — 표준 4개를 codeBeamer 하나에
- S-11 AI로 신약 프로젝트 관리 — KDRA 바이오 PM 3일 워크숍
- S-12 AI 바이오·제약 회사는 무엇부터 자동화해야 하는가 — 26주 실측
- S-13 에이전트를 어디까지 붙일 것인가 — 되돌릴 수 없는 일 먼저 NEW
- S-14 같은 기준, 다른 답 — 22개 업무 유형의 사람 확정 지점 NEW
- S-15 가장 무거운 일은 전문 업무가 아니었다 — 에이전트 10종 NEW
- G-1 삼성전자 GAUSS PM Agent: 효과적 설계로 주니어 PM 지원하기
- G-2 주니어 PM 위한 AI 하네스 구축 가이드
- G-4 삼성 DX 엔지니어를 위한 Codex 온보딩 — 하네스 & 개인 RAG
- G-5 나의 Agent 비서, 블록 12개로 조립한다 — 재사용 블록과 77%의 법칙
- G-6 내 업무를 맡길 AI 에이전트 — 6블록 설계와 PROFILE BIND
- CC-6 사내 지식을 RAG로 — 망분리·토큰0 6단계
- CC-4 내 노트 4만 개 검색 — LLM 직접 읽기 vs 전용 CLI, 하이브리드 5.5배
- CC-5 Obsidian 노트를 앱 없이 검색 — 오픈소스 byeori(벼리)
- A-5 Fable 5와 보낸 첫 하루 — 모델 × 하네스 × RAG 실측 회고
- A-8 좋은 엔진은 없다, 맞는 엔진이 있다 — Codex/Sol vs Claude/Fable 5대 실전 비교
- CC-3 Opus xhigh 솔로 vs ultracode 멀티에이전트 — 작업유형별 A/B 실측
- A-6 맥은 이미 AI 워크스테이션 — 사진·노트·인박스 0원 정리
- A-7 Mac@Work 2026 — 맥 20년차의 도구 모음과 Agentic 카테고리
- G-3 대기업 직장인을 위한 AI Agent & Skill 추천 가이드 2026
- G-7 녹취 엔진 두 레인 — SpeechAnalyzer와 Alt, 코칭·컨설팅 6장면 판단표