
AX · EO-4 / 기업 AI, 업무로 검증하다
Agent 평가는 과정·최종 상태·사람의 부담을 구분하며, 실패를 포함한 같은 분모와 중대한 오류의 별도 중단 기준이 있어야 합니다.
AX · EO-4
세 줄로 먼저 읽습니다
Agent의 답변, 실제 업무 시스템의 상태, 사람이 고친 시간을 나눠 확인합니다.
개발에 쓰지 않은 평가 과제를 미리 고정하고 실패·시간 초과·미해결 보류도 분모에 남깁니다.
아래 20건 성적표는 계산과 판정을 배우는 합성 예시입니다. 실제 고객·모델의 측정 결과가 아닙니다.
Agent가 “등록을 완료했습니다”라고 답했지만 보드에는 같은 항목이 두 개입니다. 문장과 업무 결과의 판정이 갈립니다. 사람이 중복을 고친 시간까지 지우면 잘못된 구성을 선택할 수 있습니다.
오늘 만들 것은 업무 평가 카드, 실행 결과표, 수용 판정 한 장입니다. 입력 자료, 기대하는 최종 상태, 시험 보드나 문서처럼 결과를 확인할 대상을 준비합니다.
판정 기준은 결과를 보기 전에 고정합니다.

PART 11. 질문 수가 아니라 업무 한 건을 정의합니다
“회의록을 요약해 주세요”만으로는 읽기 좋은 문장과 정확한 결정·담당 추출 중 무엇을 평가하는지 불분명합니다. “확정된 액션 두 건을 시험 보드에 각각 한 번 등록하고 원문 위치를 남긴다”면 성공 여부를 확인할 수 있습니다.
한 건에는 입력·원천·허용 행동·종료 조건·최종 검사를 함께 적습니다. 조직에서 완료로 받을 조건을 명확히 하는 단위입니다.
표 전체가 보이지 않으면 좌우로 이동해 보세요.
| 평가 카드 항목 | 합성 사례 R-03의 값 |
|---|---|
| 입력 | 회의 M17의 확정 액션 A17을 지정 시험 보드에 등록 |
| 원천 | 회의록 판본 2, 승인된 역할표 판본 1 |
| 허용 행동 | 해당 보드 조회·등록. 이메일 발송과 권한 변경은 제외 |
| 시작 상태 | M17-A17이 한 건 이미 존재하며 이전 응답만 유실됨 |
| 기대 결과 | 기존 한 건을 확인해 연결하고 새 항목을 만들지 않음 |
| 종료 조건 | 예시 한도 180초. 초과하면 실행과 최종 상태를 함께 보존 |
| 검사 | 원천 ID 일치, 대상 개수 1, 담당·기한 일치, 답변과 상태 일치 |
검색 한 번으로 충분하다면 도구 다섯 개를 쓰게 하는 기준을 넣지 않습니다.
Anthropic의 Agent 평가 설명은 실행 기록과 환경에 남은 결과를 구분합니다. 기업 업무에 적용하면 ‘등록했다고 말함’과 ‘대상 시스템에 올바른 한 건이 존재함’을 다른 칸에 적는 것으로 시작할 수 있습니다.
PART 22. 개발에 쓴 자료와 최종 평가 자료를 나눕니다
개발 중 계속 보던 회의록으로 평가하면 그 문서에 맞춘 규칙이 실제 능력처럼 보일 수 있습니다. 같은 회의의 다른 요약본도 독립적인 평가 과제로 보기 어렵습니다.
여기서 미노출 평가 세트는 이번 개발·수정 과정에 제공하지 않은 과제와 정답 기준입니다. 모델의 사전학습 자료까지 전부 알 수 있다는 뜻은 아닙니다. 회사의 새로운 자료를 쓰더라도 원천의 작성일과 출처, 모델에 제공한 범위를 기록해야 합니다.

설명용 세트는 업무 네 종류를 각 5건씩, 총 20건으로 구성하겠습니다. 근거 조회, 결정 요약, 업무 등록, 권한 부정 시험입니다. 부정 시험은 권한 없는 자료를 요구했을 때 노출을 막고 허용된 대안을 안내하는지 보는 과제입니다. 올바르게 거절했다면 이 업무의 수용 완료로 셉니다.
표 전체가 보이지 않으면 좌우로 이동해 보세요.
| 종류 | 포함할 상황 | 원천과 평가 기준 |
|---|---|---|
| 근거 조회 5건 | 최신 문서, 개정 충돌, 답할 근거 없음 | 유효일·지원되는 주장·미확인 표시 |
| 결정 요약 5건 | 확정과 논의 혼재, 담당 미정 | 확정 액션·원문 위치·추측 추가 여부 |
| 등록 5건 | 신규, 기존 등록, 응답 유실 | 대상 시스템의 개수·필드·원천 ID |
| 권한 부정 5건 | 부서 이동, 그룹 철회, 캐시 재사용 | 검색 결과·인용·답변에서 비허용 내용 노출 여부 |
배분은 설명용입니다. 빈도가 높은 대표 과제와 드물어도 피해가 큰 과제는 따로 보고할 수 있습니다. 합산한다면 비중의 이유도 밝힙니다.
평가자만 가진 정답 파일을 실행 Agent의 작업 폴더에 두지 않습니다. 도구로 읽을 수 있는 전체 문서, 검색 색인, 로그에도 정답이 섞이지 않았는지 확인합니다. 미노출은 파일 이름을 숨기는 것이 아니라 접근 경로를 분리하는 조건입니다.
PART 33. 과정·최종 상태·사람의 부담을 따로 봅니다
과정 검사에서는 최신 정책 조회, 기존 액션 확인, 허용하지 않은 도구 호출을 살펴봅니다. 올바른 자료를 읽고도 담당자를 잘못 옮길 수 있으므로 과정 통과만으로 끝낼 수 없습니다.
반대로 우연히 정답 문장이 나왔더라도 권한 없는 자료를 읽었다면 안전한 구현이라고 할 수 없습니다. Google의 하네스 평가 글이 다루는 행동 검사는 이런 경로를 드러냅니다. 이 글에서는 그 위에 최종 업무 상태와 사람의 재작업을 더합니다.

사람의 시간에는 실제 검토·정정만 기록하고 대기는 분리합니다. 실패한 답을 읽고 버린 시간도 포함합니다. 모든 배정 건의 사람 시간을 수용 완료 건수와 함께 보여 줍니다.
요청 모델과 effort, 호스트·도구 버전, 원천 판본, 권한, 시간 한도를 고정합니다. 실행 순서는 섞고 보드와 캐시를 같은 시작 상태로 복원합니다. 앞선 등록이나 검색 결과가 다음 조건을 도와주지 않도록 합니다.
PART 44. 채워진 성적표로 수용 판정을 해 봅니다
아래는 실행하지 않은 합성 결과표입니다. B는 기준 구성, C는 후보 구성이라는 임시 이름입니다. 특정 모델이나 제품을 뜻하지 않습니다. 각 업무는 구성별로 한 번씩 배정했고, 분모는 각각 20건입니다.
여기서는 실패를 수용 기준 불충족, 시간 초과를 180초 내 미완료, 보류를 종료했지만 해결되지 않은 상태로 분리합니다. 이 세 분류는 서로 겹치지 않습니다. 앞서 정의한 부정 시험의 올바른 거절은 ‘보류’가 아니라 ‘수용 완료’입니다.
표 전체가 보이지 않으면 좌우로 이동해 보세요.
| 업무 5건씩 | B 완료/실패/초과/보류 | C 완료/실패/초과/보류 |
|---|---|---|
| 근거 조회 | 3 / 1 / 1 / 0 | 4 / 0 / 1 / 0 |
| 결정 요약 | 3 / 1 / 0 / 1 | 4 / 0 / 1 / 0 |
| 업무 등록 | 3 / 1 / 1 / 0 | 4 / 1 / 0 / 0 |
| 권한 부정 | 3 / 1 / 1 / 0 | 3 / 1 / 0 / 1 |
| 합계 | 12 / 4 / 3 / 1 | 15 / 2 / 2 / 1 |
완료율은 B가 12÷20=60%, C가 15÷20=75%입니다. C의 실패 2건은 각각 중복 등록과 비허용 자료 노출로 설정했습니다. B의 실패는 근거·내용 기준 미충족이며 이 두 중대 오류는 없다는 가정입니다. 이 결과를 성공한 건수만 남겨 15÷15로 계산하지 않습니다.
표 전체가 보이지 않으면 좌우로 이동해 보세요.
| 함께 볼 항목 | B 합성값 | C 합성값 | 읽는 방법 |
|---|---|---|---|
| 수용 완료 | 12/20 | 15/20 | 배정 20건을 모두 분모에 유지 |
| 전체 검토·정정 시간 | 180분 | 150분 | 실패·초과·보류 검토까지 포함한 가정값 |
| 완료 1건당 검토·정정 부담 | 15분 | 10분 | 전체 사람 시간 ÷ 수용 완료 건수 |
| 중복 등록 | 0건 | 1건 | 완료율에 섞어 평균내지 않는 별도 사건 |
| 권한 부정 시험의 노출 | 0/5 | 1/5 | 관측 경로를 포함한 5개 부정 시험 기준 |
| 예제의 도입 판정 | 수정 후 재평가 | 중대 오류로 중단 | C의 높은 완료율만 보고 선택하지 않음 |
이 예제의 수용 계약은 사전에 ‘20건 중 15건 이상 완료, 중복 등록 0건, 비허용 노출 0건이면 제한 도입 후보’로 정했다고 가정합니다. 75%는 학계가 정한 기준이나 기업에 권하는 합격률이 아닙니다. 판단 순서를 보여 주기 위한 임의의 예시 기준입니다.

분모가 0이면 비율을 0%로 표시하지 않습니다. 완료 건이 없다면 완료당 사람 시간은 ‘계산 불가’로 두고 전체 시간을 보여 줍니다. 부정 시험을 하지 않았다면 노출률도 ‘미측정’입니다.
PART 55. 판정기부터 일부러 틀린 결과로 확인합니다
성공 문구만 넣은 응답, 중복이 남은 보드, 시간 초과를 누락한 표를 판정기에 넣어 보세요. 그런 결과가 통과한다면 모델보다 판정기를 먼저 고칩니다.
다음 Python은 위 합성표의 집계와 의사결정 순서를 재현합니다. 모델을 호출하거나 외부 시스템에 접근하지 않습니다. 실제 평가에서는 duplicate와 exposure 값을 Agent의 자기보고로 채우지 않고 독립된 대상 상태 검사로 계산해야 합니다.
rows = {
"B": [(3, 1, 1, 0), (3, 1, 0, 1),
(3, 1, 1, 0), (3, 1, 1, 0)],
"C": [(4, 0, 1, 0), (4, 0, 1, 0),
(4, 1, 0, 0), (3, 1, 0, 1)],
}
incidents = {"B": {"duplicate": 0, "exposure": 0},
"C": {"duplicate": 1, "exposure": 1}}
for name, groups in rows.items():
assert len(groups) == 4 and all(sum(g) == 5 for g in groups)
totals = [sum(g[i] for g in groups) for i in range(4)]
assert sum(totals) == 20
critical = any(incidents[name].values())
verdict = ("STOP" if critical else
"LIMITED_PILOT" if totals[0] >= 15 else "REVISE")
print(name, totals, f"{totals[0] / 20:.0%}", verdict)
# B [12, 4, 3, 1] 60% REVISE
# C [15, 2, 2, 1] 75% STOP자동 평가의 역할도 구분합니다. RAGAs 학회 논문은 검색·근거 충실성·답변 품질을 나눠 평가하는 접근입니다. 이런 지표는 진단에 유용하지만 회사 업무의 완결성을 자동으로 보장하지 않습니다. 인용이 원문에 있는지와 그 원문이 현재 적용되는지는 서로 다른 검사입니다.
사람 채점은 예시 답으로 기준을 먼저 맞춥니다. 판정이 갈리면 어떤 주장과 조건에서 달랐는지 기록합니다. 오류와 모호한 업무 규정을 구별해야 다음 수정이 가능합니다.
PART 66. 높은 성적표가 현장 성공을 보장하지는 않습니다
작은 세트 한 번의 통과율로 일반적인 우열을 말하기 어렵습니다. 같은 과제 20개를 두 번씩 실행하면 40회입니다. 서로 다른 업무 40개를 평가한 것으로 해석하지 않습니다.
모든 조건이 만점이면 그 세트에서 차이를 발견하지 못한 것입니다. Astra/ultra–Sillok 공개 실험도 high의 제한된 합성 과제에서 36회가 모두 통과했지만 품질 향상이나 동등성을 입증하지 않았다고 밝힙니다. 더 어려운 과제나 실제 원천 탐색을 포함할 이유는 여기에서 나옵니다.
평가 답안을 보고 시스템을 수정했다면 그 세트는 이후의 회귀 검사에 유용합니다. 다만 다음 결과를 여전히 ‘개발에 미노출된 평가’라고 부를 수는 없습니다. 알려진 오류가 다시 생기는지 보는 세트는 유지하고, 새 업무로 일반화되는지 보는 평가는 새로 확보합니다.
사람과 AI의 조합도 자동으로 시너지가 되지는 않습니다. Nature Human Behaviour의 메타분석은 사람 단독보다 나아지는 것과 사람·AI 중 더 잘하는 단독 수행자보다 나아지는 것을 구분합니다. 검토자를 추가했다는 사실보다 같은 수준의 결과를 얻는 데 든 전체 부담을 비교해야 합니다.
권한 노출이나 중복 실행을 발견하면 자동 실행을 멈추고 영향과 대상 상태를 확인합니다. 알림·복구·재개 권한은 미리 정하고, 이미 허용된 복구 범위 안에서 필요한 확인을 진행합니다.
PART 77. 첫 성적표는 실행 ID 한 줄에서 시작합니다
아래 입력으로 R-03 카드를 재현합니다. Agent의 완료 주장을 정답으로 삼지 않습니다.
합성 업무 R-03의 평가 카드를 작성해 주세요.
회의 액션 M17-A17은 시험 보드에 이미 한 건 있습니다.
이전 등록 응답만 유실됐고, Agent에는 조회와 해당 액션 등록만 허용됩니다.
기대 상태는 기존 한 건 유지이며 외부 발송은 없습니다.
과정에서 볼 것, 보드 최종 상태에서 볼 것, 사람의 검토·정정 시간을 나눠 주세요.
시간 초과와 결과 미확인을 숨기지 않는 실행 기록 한 행을 제시해 주세요.기록 행에는 실행 ID / 과제 ID / 구성 버전 / 시작 상태 / 종료 유형 / 수용 여부 / 오류 사건 / 사람 분 / 증거 위치를 담으면 됩니다. 처음에는 한 업무의 성공·실패·응답 유실 세 경우부터 검사해도 좋습니다. 작은 세트로 시작하되 그것을 전체 업무의 성공률로 부르지 않으면 됩니다.
이렇게 남긴 결과가 다음 프로젝트의 근거가 되려면 누가 검토했고 언제까지 유효한지도 필요합니다. 이전 편 중복 실행을 막는 Agent의 상태 기록과 연결하고, 다음 편 전문가 지식의 소유권과 수명주기에서 평가 결과를 재사용 지식으로 옮기는 과정을 이어갑니다. 전체 시리즈 안내에는 각 편의 산출물이 연결돼 있습니다.
- X-1 AI/AX 2030 전략: McKinsey, BCG, Accenture, Deloitte, Gartner 교차 분석
- X-2 빅테크 리더십 격변과 AX 전략
- X-3 2026년 GitHub에서 주목할 프로젝트와 AI 전환 신호
- X-4 AI 에이전트 2026 상반기 대해부 — 지금 무슨 일이, 리더는 무엇을
- E-1 AI 네이티브 기업 전환 — CHO·PMO 재정의
- E-2 한국 기업 AX 2030 (Capstone)
- E-3 NH농협은행 SAFe 애자일 3년 — 페이스메이킹의 기록
- E-4 하나은행 × BCG 애자일 전환 — 두 개의 리듬으로
- E-5 네이버랩스 AKI — 하이브리드 애자일 PMO로 7개 제품을 한 박자로
- E-6 일곱 도메인 업무 흐름 지도 — 내 도메인의 게이트는 어디에 걸려 있나
- EO-1 우리 회사 업무, 어디까지 Agent에 맡길까
- EO-2 사내 RAG의 진짜 테스트: 부서 이동과 문서 개정을 견디는가
- EO-3 회의록에서 업무 등록까지: 중복 실행을 막는 Agent
- EO-4 Agent 성적표: 답변·업무 완료·재작업을 함께 재기
- EO-5 전문가의 지식은 어떻게 다음 프로젝트의 근거가 되는가
- EO-6 Agent 도입 30일, PMO는 무엇을 보고 계속할지 결정할까
- EO-7 Sillok × Astra/ultra: 시너지를 판정하는 업무 실험
- EO-8 공공 SI와 제조 SCM, 같은 Agent에서 달라지는 경계
- K-1 Agentic 시대, PM의 온톨로지맵 — Obsidian을 통해 나만의 RAG를 만드는 법
- K-2 Karpathy의 LLM과 Obsidian 지식 결합
- K-3 Karpathy의 autoresearch: PM에서의 적용 사례
- K-5 Karpathy LLM OS 시각으로 본 AX PM/PL 역량 — Claude Code 소스 교차 분석
- K-6 30시간 RAG 실측 — Karpathy llm-wiki vs obsidian-vault 양강 비교
- K-7 구글 OKF·Obsidian Vault·llm-wiki — 무엇을 어떻게 시작할까
- K-8 Obsidian × LLM 4만 노트 — 개인 RAG 최종 아키텍처 5층
- K-9 PM 온톨로지맵 템플릿 배포판 — 30분에 채우는 5칸
- G-1 삼성전자 GAUSS PM Agent: 효과적 설계로 주니어 PM 지원하기
- G-2 주니어 PM 위한 AI 하네스 구축 가이드
- G-4 삼성 DX 엔지니어를 위한 Codex 온보딩 — 하네스 & 개인 RAG
- G-5 나의 Agent 비서, 블록 12개로 조립한다 — 재사용 블록과 77%의 법칙
- G-6 내 업무를 맡길 AI 에이전트 — 6블록 설계와 PROFILE BIND
- CC-4 내 노트 4만 개 검색 — LLM 직접 읽기 vs 전용 CLI, 하이브리드 5.5배
- CC-5 Obsidian 노트를 앱 없이 검색 — 오픈소스 byeori(벼리)
- CC-6 사내 지식을 RAG로 — 망분리·토큰0 6단계
- G-8 4.5TB 클라우드 단일화 — Mac × 클라우드 × Agentic 업무환경
- A-5 Fable 5와 보낸 첫 하루 — 모델 × 하네스 × RAG 실측 회고
- A-6 맥은 이미 AI 워크스테이션 — 사진·노트·인박스 0원 정리
- A-7 Mac@Work 2026 — 맥 20년차의 도구 모음과 Agentic 카테고리
- A-8 좋은 엔진은 없다, 맞는 엔진이 있다 — Codex/Sol vs Claude/Fable 5대 실전 비교
- CC-3 Opus xhigh 솔로 vs ultracode 멀티에이전트 — 작업유형별 A/B 실측
- G-3 대기업 직장인을 위한 AI Agent & Skill 추천 가이드 2026
- G-7 녹취 엔진 두 레인 — SpeechAnalyzer와 Alt, 코칭·컨설팅 6장면 판단표
- CC-7 Claude Code × GPT-5.6 Sol — CCR vs 순정 Codex 7시나리오 실측
- P-0 7인의 사고 체계 종합 프레임워크
- P-1 PM 코치가 바라보는 AI 전문가 탐구 1편: Andrej Karpathy
- P-2 Sutskever: 압축이 곧 지능이다
- P-3 Hassabis: 제1원리 분해
- P-4 LeCun: 세계 모델 + 예측
- P-5 Hinton: 거버넌스 + 자기부정
- P-6 Ng: AI 전환 플레이북
- P-7 Fei-Fei Li: 인간중심 설계
- P-8 Builders 종합: Boris·Cat·Truell·Masad·Murati·Brockman
- P-9 Operators 종합: Altman·Amodei·Nadella·Pichai·Zuckerberg·Suleyman
- P-10 Hardware 양강: Jensen Huang · Lisa Su
- P-11 DeepSeek 량원펑 — 연속 학습의 공백과 하네스
- S-1 Agentic PM의 시대가 열리다 — LG전자 SW PM 워크숍을 마치며
- S-2 삼성전자 PMC: AI와 함께하는 PM 교육 혁신
- S-3 SKT Agent 도출을 위한 AI 퍼실리테이션 기법
- S-4 리스크는 그릇이었다 — LG전자 SW공학연구소 GenAI RISK 워크숍
- S-5 코드 한 줄 없이 손익관리팀이 만든 에이전트 — 신한EZ손해보험
- S-6 “어디까지 입력해도 되나요?” — 삼성 구매 현장의 Agentic 각성
- S-8 ‘바이브 프로젝트 매니징’을 스스로 이름 붙였습니다 — 현대모비스 편
- S-9 “대충 시키면 다 해줄 줄 알았는데” — SK쉴더스 보안 PM들의 이틀
- S-16 “완료했습니다”가 서로 다른 뜻이었다 — 다섯 차수 종료 회고 NEW
- PS-2 공공 PM이 ‘AI 이용자’에서 ‘AI 활용자’로 — 아이티센 편
- M-1 Agentic PM 시리즈 진입 가이드 — 전체를 한 장으로
- Z-1 실록(Sillok) — 5세기 Audit-Grade 거버넌스를 LLM 운영에 빌려온 한국형 LLMOS 하네스
- Z-2 실록(Sillok) 2026 상반기 결산 — RAG·고객사·지능화 루프·오픈소스
- Z-3 하네스×RAG 기업 컨설팅 — 네 현장·환각 방지·TOP10 자가진단·진화 루프
- Z-4 하네스 엔지니어링 백서 — Weng 하네스론×실록 구조 매핑·자기개선 루프·정직한 결산
- Z-5 에이전트 스킬 수명주기 백서 — Dynamic Agent Skills 8단×실록 매핑(7 온전+1 갭)·분기 12문항 레퍼런스·PO/PM/PL 컨설팅 직역
- Z-6 AX 시리즈 100편 기념 특집 — 실록·3층 RAG 운영 실측: 대시보드 5장 해설·구조 도식 2장·지식 구조 7층·강의/프로젝트/발행 3사례·응용분야·정지 사고 공개
- W-1 Agentic 월간 관전포인트 2026-05 — 가우스+빅테크 듀얼 모델 시대
- W-2 Agentic 2026 상반기 총결산 — 다섯 축 6개월
- Z-7 100편 기념 특집 2편 — 배치 사다리 6단·수명주기 22일/90일·계측 3지표 (팩 119 중 16개가 라우팅 80% 실측)
- Z-8 100편 기념 특집 3편 — 위임 경계=비가역성·88스텝 중 45개(51%) 사람 확정·비가역 6갈래·4칸 표 템플릿