원문 소식, 쉽게 읽기

Microsoft는 2026년 10월 9일 Agent Experience(AX) Practitioner Playbook을 공개했다. 여기서 AX는 AI 코딩 에이전트가 특정 SDK·API·서비스를 발견하고 선택해 올바르게 사용하는 경험을 뜻한다. 코딩 에이전트가 그럴듯하고 컴파일도 되는 코드를 만들더라도 오래된 SDK 버전이나 폐기된 인증 방식을 고를 수 있다는 문제에서 출발한 실무 평가법이다. 출처

이 플레이북은 모델 자체를 다시 학습시키는 방법보다 에이전트가 참고하고 호출하는 접점을 점검한다. 개발 문서, MCP 서버, 스킬, 플러그인, 지침, 명령줄 도구와 API가 그 대상이다. MCP는 AI가 외부 데이터와 도구에 연결되는 방식을 표준화한 인터페이스다. SDK·API·서비스를 만드는 팀뿐 아니라 이런 자료를 작성하거나 개발자에게 설명하는 사람도 사용할 수 있으며, 특정 평가 시스템에 종속되지 않는다. 출처

실행 순서는 현실적인 작업 시나리오를 정하고, 성공을 판정할 기준과 실제 실행 관문을 함께 만드는 데서 시작한다. 의미를 판단하는 기준은 올바른 SDK와 권장 패턴을 사용했는지 살피고, 실행 관문은 코드가 빌드되고 동작하는지를 확인한다. Microsoft는 실행되지 않은 코드가 완벽한 점수를 받거나, 특정 플랫폼을 썼는지 확인하는 검사가 실제 사용 여부와 무관하게 통과한 사례를 들어 두 검사가 모두 필요하다고 설명했다. 기준은 먼저 보정하고 제품이 바뀔 때 버전을 관리해야 하며, 평가할 모델에 기준 작성까지 전부 맡기는 방식도 경계한다. 출처

다음 단계에서는 최종 답만 보지 않고 에이전트가 도구와 자료를 선택한 실행 기록을 따라간다. 같은 실패처럼 보여도 확장 기능이 로드되지 않은 경우, 로드됐지만 호출되지 않은 경우, 호출됐지만 잘못 적용된 경우는 고칠 곳이 다르다. 플레이북은 반복해서 나타난 아홉 가지 실패 유형을 바탕으로 원인을 좁히고, 문서나 에이전트 확장 기능의 수정안을 가설로 세워 다시 시험한 뒤 담당 팀에 근거와 함께 전달하는 흐름을 제시한다. 출처

Microsoft는 Cosmos DB와 SharePoint Framework 등을 대상으로 한 실제 평가가 여러 수정으로 이어졌으며, Azure Cosmos DB Agent Kit에는 46개 개선 사항이 반영됐다고 밝혔다. 플레이북을 대화형으로 익히는 AX Practitioner 스킬도 함께 공개했다. 이 스킬은 플레이북 내용 안에서 답하고 범위를 벗어나면 다른 출처를 사용하기 전에 묻도록 설계됐다. Microsoft가 플레이북 관련 질문 330개로 측정한 평균 점수는 95%다. 이 수치는 Microsoft가 보고한 플레이북 내용 일치도다. 생성 코드의 정확도는 이 질문 평가에서 측정하지 않았다. 출처

OYOPICK의 시선

이 방법의 가치는 코딩 에이전트의 실수를 막연히 모델 성능 탓으로 돌리지 않고, 제품팀이 바꿀 수 있는 문서와 도구의 문제로 나눠 측정한다는 데 있다. 특히 결과물 검사와 실행 경로 검사를 분리하면 같은 오류가 반복되는 이유를 더 구체적으로 찾을 수 있다. 새 기능을 출시할 때 사람용 문서 검토와 함께 대표 작업을 에이전트로 실행하는 회귀 검사를 두는 방식도 현실적인 적용 사례가 될 수 있다.

에이전트 점수만 높이도록 문서를 최적화하면 사람에게 읽기 어려운 지침이나 지나치게 넓은 도구 권한이 생겨 유지보수성과 안전이 나빠질 수 있다. 평가 기준에는 정확한 버전과 실행 성공뿐 아니라 최소 권한, 보안상 권장 패턴, 사람이 이해할 수 있는 오류 설명도 포함하는 편이 합리적이다.

AI가 개발 도구를 더 능숙하게 다루는 미래에는 사람의 전문성이 줄어들기보다 평가 기준과 검토 경로를 설계하는 역할로 확장되기를 바란다. 공급업체가 보고한 사례와 스킬 점수는 출발점이다. 각 팀은 대표 업무와 실제 개발 환경에서 기준을 보정하고, 영향이 큰 변경은 사람이 승인하는 절차를 유지해야 한다.