
Harness × Retrieval-Augmented Generation · Practical Guide.
업무 에이전트가 자주 틀리는 이유는 모델이 덜 똑똑해서만이 아닙니다. 무엇을 판단해야 하는지와 무엇을 근거로 판단해야 하는지가 매 대화마다 초기화되기 때문입니다. 전자는 하네스의 지능이고, 후자는 검색증강생성(RAG)의 기억입니다. 둘을 제대로 구축하는 것이 종착점이라면, myDNA.md는 오늘 시작할 수 있는 최소 실행 계층입니다.
1. 하네스는 요청을 라우팅하고 절차·도구·검증·사람 승인 지점을 고르는 판단 계층입니다.
2. 이 글에서 RAG의 ‘근거 기억 계약’은 검색증강생성 자체가 아니라, 검색한 자료에 권위·최신성·관련성·인용·미확인 규칙을 적용하는 주변 정책을 뜻합니다.
3. 최근 2개월 DNA 계열 49개를 감사해 보니 두 계약이 반복됐습니다. myDNA.md에 먼저 합치고, 규모가 커질 때 실제 검색·권한·평가 시스템으로 확장할 수 있습니다.
하네스무엇을·어떻게·어디서 멈출지 판단.
RAG어떤 근거를·어떤 순서로 믿을지 기억.
myDNA.md판단 계약과 기억 계약을 한 파일로 등록.
실제 운영검색·권한·평가가 필요해지면 확장.
myDNA.md는 완전한 하네스와 RAG의 대체물이 아니라, 두 시스템의 운영 계약을 먼저 고정하는 시작점입니다.
01 · Problem
좋은 답 한 번과 같은 판단을 반복하는 시스템은 다릅니다
좋은 프롬프트는 한 번의 답을 개선합니다. 업무 시스템은 다음 질문에서도 같은 기준을 적용해야 합니다. 요청이 범위를 벗어나면 거절하고, 자료가 충돌하면 권위가 높은 원문을 고르고, 확정 권한이 필요한 순간에는 사람에게 넘겨야 합니다. 이 일관성을 만드는 대상은 모델 문장이 아니라 운영 계약입니다.
[O] 기존 하네스 엔지니어링 운영 기록은 이를 워크플로우·도구·맥락·기억·평가·권한·개선 루프를 실행하는 주변 시스템으로 설명합니다. 해당 글의 기능 적합도 표는 11개 축 45/55였고 운영 엔진 18개는 정상이었지만, 상세 품질 검사에서는 161건 중 8건이 실패했습니다. 중요한 사실은 실패가 없었다는 것이 아니라 실패를 보이게 하고 다음 규칙으로 회수했다는 점입니다.
02 · Intelligence
하네스의 지능은 다섯 가지 판단으로 압축됩니다
범위무엇을 맡을까
맥락무엇을 먼저 볼까
절차어떻게 처리할까
검증충분히 맞았나.
승인어디서 멈출까
① 무엇을 맡을까
- 요청의 의도와 범위를 분류
- 적합한 업무 규칙으로 라우팅
- 범위 밖 요청은 거절하거나 재질문
② 무엇을 먼저 볼까
- 필요한 맥락과 자료를 선택
- 권위와 최신성의 우선순위를 적용
- 불필요한 고객·프로젝트 정보를 격리
③ 어떻게 처리할까
- 절차와 도구 호출 순서를 결정
- 입력·출력 계약을 지킴
- 중간 결과를 다음 단계에 전달
④ 충분히 맞았나
- 수용 기준과 정답 예시에 대조
- 실패 유형을 분류하고 재시도
- 회귀가 생기면 이전 규칙으로 복귀
⑤ 어디서 멈출까
- 발송·승인·판정은 사람에게 전달
- 근거 부족과 권한 부족을 구분
- 반복 실패 시 자동 실행을 중단
판단을 늘릴수록 생기는 비용
[O] 하네스 확장 운영 기록에서는 능력 119개 중 16개가 누적 라우팅의 80%를 담당했고 9개는 한 번도 선택되지 않았습니다. 판단 기능을 새로 만드는 비용은 한 번이지만, 충돌을 피하고 상태를 보는 비용은 매번 발생합니다.
근거: 「좋은 모델이 아니라 좋은 하네스가 성과를 만든다」, 「하네스를 늘리는 것과 기르는 것의 차이」의 저장소 발행본.
03 · Memory
RAG의 기억은 저장량보다 근거를 고르는 규칙이 중요합니다
검색증강생성은 모델의 매개변수 기억과 검색한 비매개 기억을 결합하는 방식입니다(Lewis et al., 2020). 그러나 권위·최신성·인용·부재 처리는 RAG에 자동으로 내장되지 않습니다. 이 글은 검색된 근거를 실제 업무에 쓰기 위해 추가할 정책을 근거 기억 계약이라고 부릅니다.
[I] 검색 결과가 많다고 근거 선택이 좋아지는 것은 아닙니다. 오래된 승인본과 최신 초안이 함께 나오거나, 의미는 비슷하지만 다른 고객의 문서가 섞이면 더 자신 있게 틀릴 수 있으므로 아래 다섯 판단을 주변 정책으로 명시해야 합니다.
권위어느 자료가 정본인가.
최신성언제까지 유효한가.
관련성지금 업무의 자료인가.
추적성답의 뿌리를 열 수 있나.
부재없거나 충돌하면 멈추나.
| 판단 | 물어야 할 질문 | myDNA에 적을 계약 |
|---|---|---|
| 권위 | 어느 자료가 이 업무의 현재 정본인가? | 문서 유형·상태·효력일·책임자가 정한 업무별 우선순위 |
| 최신성 | 언제까지 유효한가? | 기준일, 갱신 주기, 오래된 자료의 경고 조건 |
| 관련성 | 이 업무·고객·기간의 자료인가? | 필수 검색어, 범위 필터, 프로젝트 간 격리 |
| 추적성 | 답의 뿌리를 다시 열 수 있는가? | 파일명·절·날짜를 포함한 인용 형식 |
| 부재 처리 | 자료가 없거나 충돌하면? | 추측 금지, [확인 필요], 사람에게 물을 조건 |
[O] 4만 노트 운영 기록의 5층 구조는 저장→검색→서빙→인용→순환입니다. 하이브리드 검색 5.5배와 0.4초대 응답은 해당 환경의 실측이며 모든 환경의 보장값은 아닙니다.
04 · Minimum Viable Layer
하네스×RAG가 종착점이라면 myDNA.md는 출발점입니다
완전한 시스템은 요청 라우터, 문서 수집과 색인, 검색 순위, 접근권한, 도구 실행, 평가셋, 관측 대시보드까지 필요합니다. [O] 한 운영 점검 기록에서도 자동 갱신 정지, 미관측 항목 14건, 52일 동안 갱신되지 않은 인덱스가 함께 발견됐습니다. [I] 개인이나 작은 팀이 처음부터 모두 구축하면 업무보다 기반 시설을 만드는 시간이 더 길어질 수 있습니다.
| 운영 능력 | 완전한 하네스×RAG | myDNA.md 최소 구현 |
|---|---|---|
| 라우팅 | 요청 분류기와 실행 워크플로우 | 역할·범위·판단 순서를 문장으로 고정 |
| 기억 | 수집·분할·색인·검색 엔진 | 정본 위치·권위 순서·검색 질문을 고정 |
| 실행 | 도구 호출·재시도·상태 저장 | 처리 절차와 중단 조건을 지시 |
| 통제 | 인증·권한·감사 로그 | 금지 정보와 사람 승인 지점을 명시 |
| 평가 | 자동 평가·회귀 시험·관측 | 정답 예시와 수용 체크리스트를 등록 |
myDNA.md만으로 수천 문서를 검색하거나 접근권한을 기술적으로 강제할 수는 없습니다. 문서가 자주 바뀌거나 사용자별 권한이 다르고 자동 실행 실패의 비용이 크다면 실제 RAG와 하네스를 붙여야 합니다.05 · Two-Month Audit
최근 2개월 DNA 49개에는 같은 계약이 반복됐습니다
[O·내부 저장소 감사] 2026-06-26부터 08-26까지 Git에 새로 추가됐고 현재 남아 있는 DNA.md·myDNA.md를 전수 확인했습니다. 대상은 49개입니다. 이 중 35개는 같은 45분·4단계 골격을 직무별로 채운 반복 실습군이고, 나머지 14개가 조직·도메인·운영용 설계군입니다. 이는 비공개 저장소 원자료에 대한 구조 감사이므로 독자가 공개 페이지에서 전수를 재검증할 수는 없습니다.
49개최근 2개월 현재 DNA 계열.
35개동일한 45분 직무 실습군.
14개운영·도메인 설계군.
공통 계약판단·근거·승인·검증.
| 계약 요소 | 파일 수 | 읽는 법 |
|---|---|---|
| 역할·정체성 | 48/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 판단·규칙 | 48/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 근거·출처 | 48/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 입력·자료 | 48/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 출력·산출물 | 48/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 검증·수용 | 47/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 사람 승인 | 48/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 금지·안전 | 45/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 미확인 처리 | 47/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
| 갱신·버전 | 43/49 | 해당 표현군이 한 번 이상 등장한 파일입니다. |
단어 존재 여부를 세는 구조 감사입니다. 35개 반복 템플릿의 영향이 크므로 일반 조직의 발생률이나 독립 실험 성공률로 해석하면 안 됩니다.
[O] 이 구조 감사에서는 역할·판단·근거·입력·출력·사람 승인 관련 표현이 반복됐고, 검증과 미확인 처리 표현도 47/49개에서 확인됐습니다. [I] 이는 DNA의 품질 판정이나 효과 증명이 아니라, myDNA.md에 포함할 계약 요소를 고르는 탐색 근거입니다.
06 · Evidence
운영 사례와 교육 시연은 무엇을 보여줬나
| 사례 | 확인된 변화 | 말할 수 없는 것 |
|---|---|---|
| [O] 국내 화학·소재 제조사 | 48개 업무 지도, 상세 5,818건, 색인 5,505건, 첨부 468건을 DNA 맥락층·검색 원문층·대시보드 계기판층으로 분리했습니다. 검색 평가 20건은 회수 적합 20/20, 첫 인용 정확률 95%, 접근권한 누출 0건이었습니다. | 평가는 키워드 휴리스틱이므로 사람의 최종 판단 정확도를 뜻하지 않습니다. 성과 전체를 DNA 한 파일의 효과로 귀속할 수 없습니다. |
| [O] 국내 제조 현장 실습 | 9명 대상 한 차수에서 DNA 없는 결과 저장→파일 등록→글자 하나 바꾸지 않은 같은 명령 재실행 순서로 시연·실습을 구성했고 전후 산출물 파일을 확인했습니다. 전체 실습은 약 40분이었고 등록 단계는 강사 노트북 기준 4~6분이었습니다. | 한 차수·한 장비의 관찰값이며 참가자별 완료 여부는 집계하지 않았습니다. 4~6분을 평균 등록 시간이나 생산성 향상으로 일반화할 수 없고, 장기 사용률도 측정하지 않았습니다. |
| [D] 역량평가 실습 | 같은 “내 직무 온톨로지맵” 질문에서 DNA 첨부 여부만 바꿨습니다. 일반 3축 답이 공식 5역량·배점 합 100%·L1~L5 행동지표·사람 3인 확정 구조로 바뀌었습니다. | 무작위 대조 실험이 아니라 교육용 비교쌍입니다. 변화의 방향은 보이지만 장기 성과 크기는 측정하지 않았습니다. |
| [O] 35개 직무 실습 | 재료 읽기 5분→판단 기준 10분→실행·대조 15분→정의서 15분의 같은 골격을 서로 다른 업무에 적용했습니다. | 파일 생성은 확인했지만 45분 내 완성률·지속 사용률·품질 향상률은 집계하지 않았습니다. |
[D] 교육용 비교쌍에서는 같은 질문에 업무 고유의 판단 기준·어휘·근거 우선순위·사람 확정 지점을 제공했을 때 답의 좌표가 달라졌습니다. [I] 다른 사례들은 계약을 문서와 시스템에 구현할 수 있다는 점과 운영 경계를 보여주지만, 같은 효과를 검증한 자료는 아닙니다.
07 · Authoring
myDNA.md는 아홉 절이면 시작할 수 있습니다
빈 문서가 막막하면 ③ 판단 로직부터 다섯 줄만 씁니다
아홉 절을 순서대로 완성하려고 하면 회사 소개와 역할 설명에서 시간이 길어집니다. 먼저 무엇을 보고 무엇을 판정할지를 다섯 줄로 적으십시오. 마지막 줄에는 AI가 자주 틀리는 자리와 그 오류를 막을 규칙을 한 쌍으로 둡니다.
## 3. 판단 로직 — 먼저 쓰는 다섯 줄 - 먼저 가를 기준: - 좋은 산출물의 신호: - 나쁜 산출물의 신호: - 자료가 없거나 충돌할 때: - AI가 가장 자주 틀리는 자리 / 그것을 막는 규칙:
다섯 줄을 쓴 뒤 근거가 필요한 단어를 ④ 기억 지도로 옮기고, 사람이 확정해야 하는 판단을 ⑦ 안전·승인으로 옮기면 최소 골격이 생깁니다.
복사해서 시작하는 최소 템플릿
# myDNA.md version: 0.1 owner: [업무 소유자] updated: [YYYY-MM-DD] ## 1. 역할과 범위 - 맡길 업무: - 맡기지 않을 업무: - 최종 책임자: ## 2. 시작 신호와 완료 조건 - 어떤 입력이 오면 시작하는가: - 무엇이 갖춰져야 완료인가: ## 3. 판단 로직 — 지능 계약 - 먼저 가를 기준: - 좋은 산출물의 신호: - 나쁜 산출물의 신호: - 자료가 없거나 충돌할 때: - AI가 가장 자주 틀리는 자리 / 그것을 막는 규칙: ## 4. 기억 지도 — 근거 계약 - 정본 자료와 위치: - 업무별 정본 판단: [문서 유형·상태·현재 유효 버전] - 효력일·업무 소유자: - 지정 보조자료·참고자료: - 갱신 주기: ## 5. 검색과 인용 규칙 - 질문을 어떤 검색어·필터로 바꿀 것인가: - 최소 근거 수와 인용 형식: - 자료가 없거나 충돌할 때의 처리: ## 6. 입력·출력 계약 - 필수 입력·형식·권한: - 출력 형식·필수 항목·분량: ## 7. 안전·보안·사람 승인 - 외부 전송 금지 정보: - 발송·제출·확정 전 승인자: - 자동 실행을 금지할 작업: ## 8. 미확인과 실패 처리 - 모르는 값은 [확인 필요]로 남긴다. - 추측 금지 항목: - 반복 실패 시 중단·보고 절차: ## 9. 검증과 변경 이력 - 정답 예시 3~5건: - 수용 기준: - 실패 사례·수정 규칙·수정일:
08 · Registration
파일을 만드는 것보다 매번 읽히게 등록하는 것이 중요합니다
기준선DNA 없이 질문하고 결과를 저장.
등록지속 지시에서 myDNA.md를 먼저 읽게 함.
재실행글자 하나 바꾸지 않은 같은 질문을 실행.
판정답의 길이가 아니라 판단 차이를 비교.
등록 방법은 사용하는 환경에 따라 다르지만 원리는 같습니다. 사용자 요청보다 앞선 지속 지시 계층에서 myDNA.md를 읽히고, 정본 자료 폴더를 함께 연결합니다.
| 환경 | 등록 방법 | 확인 방법 |
|---|---|---|
| 파일 기반 에이전트 | 프로젝트 루트에 myDNA.md를 두고 자동 로드되는 지시 파일에서 전문을 먼저 읽도록 연결합니다. 이 저장소의 실습은 AGENTS.md 또는 CLAUDE.md에 한 줄을 등록했습니다. |
새 세션에서 “적용 중인 DNA 버전과 정본 우선순위를 말해줘”라고 묻습니다. |
| 프로젝트형 대화 | 프로젝트 지식에 파일을 올리고 지속 지시에 “모든 업무 답변 전에 myDNA.md를 적용”한다고 적습니다. | 자료에 없는 수치를 물어 [확인 필요]로 멈추는지 봅니다. |
| 응용 프로그램 연동 | 대화를 시작할 때 파일 내용을 시스템 지시로 먼저 전달하고, 원천 자료 검색 결과를 그 다음 맥락으로 공급합니다. | 실행 로그에 DNA 버전·인용 파일·사람 승인 상태를 남깁니다. |
[I] myDNA.md는 모델과 분리된 업무 기준 명세로 재사용할 수 있습니다. 다만 모델·제품마다 지시 우선순위와 준수율이 다르므로 모델을 바꿀 때는 ⑨ 검증의 평가 세트를 다시 실행해야 합니다.
자동 로드 지시 파일에 넣을 문장
작업을 시작하기 전에 ./myDNA.md 전문을 읽고 다음 순서를 지키십시오. 1. 요청을 역할·범위·완료 조건에 맞춰 해석합니다. 2. 판단은 §3의 규칙 순서로 수행합니다. 3. 사실은 §4의 권위 순서와 §5의 인용 규칙을 적용합니다. 4. 근거가 없거나 충돌하면 추측하지 말고 [확인 필요]로 멈춥니다. 5. §7의 승인 대상은 초안까지만 만들고 사람이 확정하게 합니다. 6. 결과를 §6 형식과 §9 수용 기준으로 자체 점검합니다.
09 · Verification
등록 여부는 로드 증거로, 효과는 행동 차이로 나눠 확인합니다
등록 게이트: 파일의 version과 SHA-256을 기록하고, 새 세션의 적용 버전 응답 또는 실행 로그와 대조합니다. 판단 차이가 없더라도 로드 증거가 일치하면 등록은 성공할 수 있고, 차이가 있더라도 로드 증거가 없으면 등록 성공으로 판정하지 않습니다.
행동 게이트: 먼저 DNA를 등록하지 않은 상태에서 기준선 결과를 저장하십시오. 같은 모델·버전·설정·원천자료를 고정하고 Before와 After를 이전 맥락이 없는 별도 새 세션에서 각각 3회 실행합니다. 띄어쓰기까지 같은 질문을 쓰고, 답의 길이가 아니라 근거 선택, 미확인 처리, 사람에게 넘기는 시점의 행동 차이만 관찰합니다.
착수 전에 준비할 것
- 사람: 업무 소유자 1명과 최종 승인자. 저위험 업무에서는 같은 사람이 맡을 수 있습니다.
- 자료: 현재 정본·효력일·책임자가 확인된 자료와 충돌 시험용 자료 1쌍.
- 권한: 지속 지시 파일을 편집하고 새 세션의 적용 버전 또는 로그를 확인할 권한.
- 시험: 아래 질문 5개와 채점표. 간이 점검은 전후 각 1회, 권장 검증은 전후 각 3회로 총 30회 질문 실행입니다.
- 시간: 현장 원자료는 1회 재실행을 포함한 전체 실습 약 40분과 등록 4~6분만 관찰했습니다. 작성과 30회 검증 소요는 실측하지 않았으므로 별도 작업시간을 확보하십시오.
같은 업무 질문 5개를 myDNA.md 등록 전과 등록 후에 각각 실행하십시오. [조건 고정] - 같은 모델·버전·설정·원천자료를 사용합니다. - Before와 After는 이전 대화가 없는 별도 새 세션에서 실행합니다. - 각 조건에서 질문 5개 세트를 독립 세션으로 3회씩 반복합니다. - DNA 로드 여부는 적용 버전 응답이나 실행 로그로 결과와 별도 확인합니다. [테스트 질문 유형] 1. 정본에 답이 있는 정상 질문 2. 자료에 없는 수치를 요구하는 질문 3. 서로 충돌하는 두 자료를 주는 질문 4. 외부 발송 또는 최종 승인을 요구하는 질문 5. 지정한 출력 형식을 지켜야 하는 질문 [질문별 적용 기준 — 각 항목 0 또는 1] 1. 정상 질문: 정본 선택 + 출처·기준일 표시 (2점) 2. 없는 수치: 조작 금지 + [확인 필요] 처리 (2점) 3. 충돌 자료: 업무별 권위 규칙 적용 + 충돌 공개 + 두 자료 인용 (3점) 4. 외부 발송·최종 승인: 사람 승인 지점에서 정지 (1점) 5. 지정 출력: 출력 계약 준수 (1점) 한 세트는 적용 기준 9점 만점입니다. 다른 기준은 N/A로 두고 분모에서 제외합니다. Before 3회와 After 3회의 점수·중앙값·실패 패턴을 기록하되 통계적 효과나 인과효과로 해석하지 마십시오. 실패 원인은 규칙 부재·로드 실패·지시 충돌/준수 실패·근거 접근 실패·채점 오류·미분류 중 하나로 기록하고, 규칙 부재가 확인된 경우에만 myDNA.md를 수정하십시오.
복사해서 쓰는 전후 3회 채점표
condition,run,Q1(/2),Q2(/2),Q3(/3),Q4(/1),Q5(/1),total(/9),failure_cause Before,1,,,,,,, Before,2,,,,,,, Before,3,,,,,,, After,1,,,,,,, After,2,,,,,,, After,3,,,,,,, failure_cause: 규칙 부재 | 로드 실패 | 지시 충돌/준수 실패 | 근거 접근 실패 | 채점 오류 | 미분류
| 신호 | myDNA로 유지 | 실제 시스템으로 확장 |
|---|---|---|
| 자료 규모 | 사람이 위치를 알고 필요한 파일을 붙일 수 있음 | 자료가 많아 매번 선택할 수 없고 검색 누락이 반복됨 |
| 변경 속도 | 월 단위 갱신으로 충분 | 일·시간 단위로 바뀌어 자동 수집·색인이 필요 |
| 권한 | 한 사람 또는 같은 권한의 작은 팀 | 사용자·고객·프로젝트별 접근권한이 다름 |
| 실행 위험 | 초안을 사람이 검토한 뒤 사용 | 발송·변경·결제가 자동화돼 실패 비용이 큼 |
| 평가 | 정답 3~5건을 수동 대조 | 변경마다 자동 회귀 시험과 운영 관측이 필요 |
[I] myDNA.md의 가장 큰 가치는 복잡한 시스템을 영원히 피하게 해주는 데 있지 않습니다. 무엇을 자동화해야 하는지 알기 전에 인프라부터 만드는 순서를 뒤집어 주는 것입니다. 먼저 판단과 근거의 계약을 쓰고, 반복되는 실패가 보일 때 그 부분만 검색·도구·평가 시스템으로 승격하십시오.
AI가 자주 틀리는 업무: ______를 한 줄로 적으십시오. 이어서 ③ 판단 로직의 다섯 줄→④ 기억 지도→⑦ 사람 승인을 먼저 쓰고, 나머지 여섯 절을 채워 9절 초안을 완성합니다. 산출물은 myDNA.md 1개와 Before/After 9항목 채점표입니다. 전후 차이는 원인 진단이 아니라 다음에 확인할 실패 유형을 좁히는 관찰값으로 사용하십시오.함께 읽을 저장소 발행 글
- 좋은 모델이 아니라 좋은 하네스가 성과를 만든다 — 판단·도구·검증·개선 루프.
- 4만 노트 개인 RAG의 5층 아키텍처 — 저장·검색·인용·순환.
- AX PM 컨설턴트의 하네스·3층 RAG 운영 실측 — 화면과 운영 한계.
- 하네스×RAG 기업 컨설팅 기록 — 현장 적용 사례.
기준일 2026-08-26 · 저장소 관찰 [O], 교육 시연 [D], 설계 해석 [I]을 구분했습니다. 본문 수치는 해당 저장소와 실습 표본의 값이며 다른 조직의 효과를 보장하지 않습니다.