SITE SEARCH

검색

사이트 전체 글을 빠르게 찾을 수 있습니다.

RSS FEED

RSS 구독

RSS 리더에서 Project Research의 새 글을 바로 받아볼 수 있습니다.

EMAIL SUBSCRIBE

이메일 구독

새 글을 이메일로 받아봅니다. RSS는 별도 RSS 아이콘을 눌러 동일한 크기의 패널에서 열 수 있습니다.

이메일로 블로그 구독하기

이 블로그를 구독하고 이메일로 새글의 알림을 받으려면 이메일 주소를 입력하세요







[AX EO-4] Agent 성적표: 답변·업무 완료·재작업을 함께 재기

시리즈

AX · EO-4 / 기업 AI, 업무로 검증하다

Agent 평가는 과정·최종 상태·사람의 부담을 구분하며, 실패를 포함한 같은 분모와 중대한 오류의 별도 중단 기준이 있어야 합니다.

AX · EO-4

바쁜 분을 위한 3줄 요약
세 줄로 먼저 읽습니다

Agent의 답변, 실제 업무 시스템의 상태, 사람이 고친 시간을 나눠 확인합니다.
개발에 쓰지 않은 평가 과제를 미리 고정하고 실패·시간 초과·미해결 보류도 분모에 남깁니다.
아래 20건 성적표는 계산과 판정을 배우는 합성 예시입니다. 실제 고객·모델의 측정 결과가 아닙니다.

Agent가 “등록을 완료했습니다”라고 답했지만 보드에는 같은 항목이 두 개입니다. 문장과 업무 결과의 판정이 갈립니다. 사람이 중복을 고친 시간까지 지우면 잘못된 구성을 선택할 수 있습니다.

오늘 만들 것은 업무 평가 카드, 실행 결과표, 수용 판정 한 장입니다. 입력 자료, 기대하는 최종 상태, 시험 보드나 문서처럼 결과를 확인할 대상을 준비합니다.

판정 기준은 결과를 보기 전에 고정합니다.

EO-4 · Agent 성적표: 답변·업무 완료·재작업을 함께 재기

PART 11. 질문 수가 아니라 업무 한 건을 정의합니다

“회의록을 요약해 주세요”만으로는 읽기 좋은 문장과 정확한 결정·담당 추출 중 무엇을 평가하는지 불분명합니다. “확정된 액션 두 건을 시험 보드에 각각 한 번 등록하고 원문 위치를 남긴다”면 성공 여부를 확인할 수 있습니다.

한 건에는 입력·원천·허용 행동·종료 조건·최종 검사를 함께 적습니다. 조직에서 완료로 받을 조건을 명확히 하는 단위입니다.

표 전체가 보이지 않으면 좌우로 이동해 보세요.

평가 카드 항목합성 사례 R-03의 값
입력회의 M17의 확정 액션 A17을 지정 시험 보드에 등록
원천회의록 판본 2, 승인된 역할표 판본 1
허용 행동해당 보드 조회·등록. 이메일 발송과 권한 변경은 제외
시작 상태M17-A17이 한 건 이미 존재하며 이전 응답만 유실됨
기대 결과기존 한 건을 확인해 연결하고 새 항목을 만들지 않음
종료 조건예시 한도 180초. 초과하면 실행과 최종 상태를 함께 보존
검사원천 ID 일치, 대상 개수 1, 담당·기한 일치, 답변과 상태 일치

검색 한 번으로 충분하다면 도구 다섯 개를 쓰게 하는 기준을 넣지 않습니다.

Anthropic의 Agent 평가 설명은 실행 기록과 환경에 남은 결과를 구분합니다. 기업 업무에 적용하면 ‘등록했다고 말함’과 ‘대상 시스템에 올바른 한 건이 존재함’을 다른 칸에 적는 것으로 시작할 수 있습니다.

PART 22. 개발에 쓴 자료와 최종 평가 자료를 나눕니다

개발 중 계속 보던 회의록으로 평가하면 그 문서에 맞춘 규칙이 실제 능력처럼 보일 수 있습니다. 같은 회의의 다른 요약본도 독립적인 평가 과제로 보기 어렵습니다.

여기서 미노출 평가 세트는 이번 개발·수정 과정에 제공하지 않은 과제와 정답 기준입니다. 모델의 사전학습 자료까지 전부 알 수 있다는 뜻은 아닙니다. 회사의 새로운 자료를 쓰더라도 원천의 작성일과 출처, 모델에 제공한 범위를 기록해야 합니다.

EO-4 · 2. 개발에 쓴 자료와 최종 평가 자료를 나눕니다

설명용 세트는 업무 네 종류를 각 5건씩, 총 20건으로 구성하겠습니다. 근거 조회, 결정 요약, 업무 등록, 권한 부정 시험입니다. 부정 시험은 권한 없는 자료를 요구했을 때 노출을 막고 허용된 대안을 안내하는지 보는 과제입니다. 올바르게 거절했다면 이 업무의 수용 완료로 셉니다.

표 전체가 보이지 않으면 좌우로 이동해 보세요.

종류포함할 상황원천과 평가 기준
근거 조회 5건최신 문서, 개정 충돌, 답할 근거 없음유효일·지원되는 주장·미확인 표시
결정 요약 5건확정과 논의 혼재, 담당 미정확정 액션·원문 위치·추측 추가 여부
등록 5건신규, 기존 등록, 응답 유실대상 시스템의 개수·필드·원천 ID
권한 부정 5건부서 이동, 그룹 철회, 캐시 재사용검색 결과·인용·답변에서 비허용 내용 노출 여부

배분은 설명용입니다. 빈도가 높은 대표 과제와 드물어도 피해가 큰 과제는 따로 보고할 수 있습니다. 합산한다면 비중의 이유도 밝힙니다.

평가자만 가진 정답 파일을 실행 Agent의 작업 폴더에 두지 않습니다. 도구로 읽을 수 있는 전체 문서, 검색 색인, 로그에도 정답이 섞이지 않았는지 확인합니다. 미노출은 파일 이름을 숨기는 것이 아니라 접근 경로를 분리하는 조건입니다.

PART 33. 과정·최종 상태·사람의 부담을 따로 봅니다

과정 검사에서는 최신 정책 조회, 기존 액션 확인, 허용하지 않은 도구 호출을 살펴봅니다. 올바른 자료를 읽고도 담당자를 잘못 옮길 수 있으므로 과정 통과만으로 끝낼 수 없습니다.

반대로 우연히 정답 문장이 나왔더라도 권한 없는 자료를 읽었다면 안전한 구현이라고 할 수 없습니다. Google의 하네스 평가 글이 다루는 행동 검사는 이런 경로를 드러냅니다. 이 글에서는 그 위에 최종 업무 상태와 사람의 재작업을 더합니다.

EO-4 · 3. 과정·최종 상태·사람의 부담을 따로 봅니다

사람의 시간에는 실제 검토·정정만 기록하고 대기는 분리합니다. 실패한 답을 읽고 버린 시간도 포함합니다. 모든 배정 건의 사람 시간을 수용 완료 건수와 함께 보여 줍니다.

요청 모델과 effort, 호스트·도구 버전, 원천 판본, 권한, 시간 한도를 고정합니다. 실행 순서는 섞고 보드와 캐시를 같은 시작 상태로 복원합니다. 앞선 등록이나 검색 결과가 다음 조건을 도와주지 않도록 합니다.

PART 44. 채워진 성적표로 수용 판정을 해 봅니다

아래는 실행하지 않은 합성 결과표입니다. B는 기준 구성, C는 후보 구성이라는 임시 이름입니다. 특정 모델이나 제품을 뜻하지 않습니다. 각 업무는 구성별로 한 번씩 배정했고, 분모는 각각 20건입니다.

여기서는 실패를 수용 기준 불충족, 시간 초과를 180초 내 미완료, 보류를 종료했지만 해결되지 않은 상태로 분리합니다. 이 세 분류는 서로 겹치지 않습니다. 앞서 정의한 부정 시험의 올바른 거절은 ‘보류’가 아니라 ‘수용 완료’입니다.

표 전체가 보이지 않으면 좌우로 이동해 보세요.

업무 5건씩B 완료/실패/초과/보류C 완료/실패/초과/보류
근거 조회3 / 1 / 1 / 04 / 0 / 1 / 0
결정 요약3 / 1 / 0 / 14 / 0 / 1 / 0
업무 등록3 / 1 / 1 / 04 / 1 / 0 / 0
권한 부정3 / 1 / 1 / 03 / 1 / 0 / 1
합계12 / 4 / 3 / 115 / 2 / 2 / 1

완료율은 B가 12÷20=60%, C가 15÷20=75%입니다. C의 실패 2건은 각각 중복 등록과 비허용 자료 노출로 설정했습니다. B의 실패는 근거·내용 기준 미충족이며 이 두 중대 오류는 없다는 가정입니다. 이 결과를 성공한 건수만 남겨 15÷15로 계산하지 않습니다.

표 전체가 보이지 않으면 좌우로 이동해 보세요.

함께 볼 항목B 합성값C 합성값읽는 방법
수용 완료12/2015/20배정 20건을 모두 분모에 유지
전체 검토·정정 시간180분150분실패·초과·보류 검토까지 포함한 가정값
완료 1건당 검토·정정 부담15분10분전체 사람 시간 ÷ 수용 완료 건수
중복 등록0건1건완료율에 섞어 평균내지 않는 별도 사건
권한 부정 시험의 노출0/51/5관측 경로를 포함한 5개 부정 시험 기준
예제의 도입 판정수정 후 재평가중대 오류로 중단C의 높은 완료율만 보고 선택하지 않음

이 예제의 수용 계약은 사전에 ‘20건 중 15건 이상 완료, 중복 등록 0건, 비허용 노출 0건이면 제한 도입 후보’로 정했다고 가정합니다. 75%는 학계가 정한 기준이나 기업에 권하는 합격률이 아닙니다. 판단 순서를 보여 주기 위한 임의의 예시 기준입니다.

EO-4 · 4. 채워진 성적표로 수용 판정을 해 봅니다

분모가 0이면 비율을 0%로 표시하지 않습니다. 완료 건이 없다면 완료당 사람 시간은 ‘계산 불가’로 두고 전체 시간을 보여 줍니다. 부정 시험을 하지 않았다면 노출률도 ‘미측정’입니다.

PART 55. 판정기부터 일부러 틀린 결과로 확인합니다

성공 문구만 넣은 응답, 중복이 남은 보드, 시간 초과를 누락한 표를 판정기에 넣어 보세요. 그런 결과가 통과한다면 모델보다 판정기를 먼저 고칩니다.

다음 Python은 위 합성표의 집계와 의사결정 순서를 재현합니다. 모델을 호출하거나 외부 시스템에 접근하지 않습니다. 실제 평가에서는 duplicateexposure 값을 Agent의 자기보고로 채우지 않고 독립된 대상 상태 검사로 계산해야 합니다.

rows = {
    "B": [(3, 1, 1, 0), (3, 1, 0, 1),
          (3, 1, 1, 0), (3, 1, 1, 0)],
    "C": [(4, 0, 1, 0), (4, 0, 1, 0),
          (4, 1, 0, 0), (3, 1, 0, 1)],
}
incidents = {"B": {"duplicate": 0, "exposure": 0},
             "C": {"duplicate": 1, "exposure": 1}}
for name, groups in rows.items():
    assert len(groups) == 4 and all(sum(g) == 5 for g in groups)
    totals = [sum(g[i] for g in groups) for i in range(4)]
    assert sum(totals) == 20
    critical = any(incidents[name].values())
    verdict = ("STOP" if critical else
               "LIMITED_PILOT" if totals[0] >= 15 else "REVISE")
    print(name, totals, f"{totals[0] / 20:.0%}", verdict)

# B [12, 4, 3, 1] 60% REVISE
# C [15, 2, 2, 1] 75% STOP

자동 평가의 역할도 구분합니다. RAGAs 학회 논문은 검색·근거 충실성·답변 품질을 나눠 평가하는 접근입니다. 이런 지표는 진단에 유용하지만 회사 업무의 완결성을 자동으로 보장하지 않습니다. 인용이 원문에 있는지와 그 원문이 현재 적용되는지는 서로 다른 검사입니다.

사람 채점은 예시 답으로 기준을 먼저 맞춥니다. 판정이 갈리면 어떤 주장과 조건에서 달랐는지 기록합니다. 오류와 모호한 업무 규정을 구별해야 다음 수정이 가능합니다.

PART 66. 높은 성적표가 현장 성공을 보장하지는 않습니다

작은 세트 한 번의 통과율로 일반적인 우열을 말하기 어렵습니다. 같은 과제 20개를 두 번씩 실행하면 40회입니다. 서로 다른 업무 40개를 평가한 것으로 해석하지 않습니다.

모든 조건이 만점이면 그 세트에서 차이를 발견하지 못한 것입니다. Astra/ultra–Sillok 공개 실험도 high의 제한된 합성 과제에서 36회가 모두 통과했지만 품질 향상이나 동등성을 입증하지 않았다고 밝힙니다. 더 어려운 과제나 실제 원천 탐색을 포함할 이유는 여기에서 나옵니다.

평가 답안을 보고 시스템을 수정했다면 그 세트는 이후의 회귀 검사에 유용합니다. 다만 다음 결과를 여전히 ‘개발에 미노출된 평가’라고 부를 수는 없습니다. 알려진 오류가 다시 생기는지 보는 세트는 유지하고, 새 업무로 일반화되는지 보는 평가는 새로 확보합니다.

사람과 AI의 조합도 자동으로 시너지가 되지는 않습니다. Nature Human Behaviour의 메타분석은 사람 단독보다 나아지는 것과 사람·AI 중 더 잘하는 단독 수행자보다 나아지는 것을 구분합니다. 검토자를 추가했다는 사실보다 같은 수준의 결과를 얻는 데 든 전체 부담을 비교해야 합니다.

권한 노출이나 중복 실행을 발견하면 자동 실행을 멈추고 영향과 대상 상태를 확인합니다. 알림·복구·재개 권한은 미리 정하고, 이미 허용된 복구 범위 안에서 필요한 확인을 진행합니다.

PART 77. 첫 성적표는 실행 ID 한 줄에서 시작합니다

아래 입력으로 R-03 카드를 재현합니다. Agent의 완료 주장을 정답으로 삼지 않습니다.

합성 업무 R-03의 평가 카드를 작성해 주세요.
회의 액션 M17-A17은 시험 보드에 이미 한 건 있습니다.
이전 등록 응답만 유실됐고, Agent에는 조회와 해당 액션 등록만 허용됩니다.
기대 상태는 기존 한 건 유지이며 외부 발송은 없습니다.
과정에서 볼 것, 보드 최종 상태에서 볼 것, 사람의 검토·정정 시간을 나눠 주세요.
시간 초과와 결과 미확인을 숨기지 않는 실행 기록 한 행을 제시해 주세요.

기록 행에는 실행 ID / 과제 ID / 구성 버전 / 시작 상태 / 종료 유형 / 수용 여부 / 오류 사건 / 사람 분 / 증거 위치를 담으면 됩니다. 처음에는 한 업무의 성공·실패·응답 유실 세 경우부터 검사해도 좋습니다. 작은 세트로 시작하되 그것을 전체 업무의 성공률로 부르지 않으면 됩니다.

이렇게 남긴 결과가 다음 프로젝트의 근거가 되려면 누가 검토했고 언제까지 유효한지도 필요합니다. 이전 편 중복 실행을 막는 Agent의 상태 기록과 연결하고, 다음 편 전문가 지식의 소유권과 수명주기에서 평가 결과를 재사용 지식으로 옮기는 과정을 이어갑니다. 전체 시리즈 안내에는 각 편의 산출물이 연결돼 있습니다.

조직을 바꾼다AIDD 도메인주도 컨설팅 · 33편
나를 바꾼다AX 역량 · 70편
🏫 워크숍 현장 기록
두 문이 함께 딛는 근거하네스 · 수렴 · 월간 · 11편
🧭 길잡이·수렴 (두 문 공용)

Project Research에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기