Microsoft 365 활용

Copilot Studio 에이전트 평가, 만드는 사람과 결과 보는 사람 나누기

2026년 10월 7일 공개된 Copilot Studio 평가 범위 확대, Custom Graders Library, Evaluation Viewer 역할로 평가 담당과 제작 담당을 나누는 방법을 정리했습니다.

체크 표시가 있는 클립보드와 그 옆에서 결과지를 비추는 돋보기가 있는 Copilot 블로그 표지

1. 평가 결과만 볼 사람에게 제작 권한을 주지 않아도 됩니다

에이전트를 만든 사람이 평가를 실행하고, 그 결과를 업무 담당자나 품질 검토자가 확인하는 구조를 생각해 보십시오. 검토자는 결과만 보면 되는데, 그 때문에 에이전트를 고칠 수 있는 권한까지 주기는 부담스럽습니다.

Microsoft는 2026년 10월 7일 Microsoft Copilot 블로그에 Copilot Studio 9월 업데이트를 정리한 글을 올렸고, 여기서 이 상황에 쓸 수 있는 역할을 소개했습니다. 블로그는 "Finally, a new Evaluation Viewer role lets reviewers and other stakeholders see evaluation results without requiring broader maker permissions."라고 적었습니다. 새 Evaluation Viewer 역할을 받은 검토자와 이해관계자는 더 넓은 제작 권한 없이 평가 결과를 볼 수 있습니다.

같은 블로그 글에 실린 Review 패널은 게시 전 경고를 다루는 기능이어서 이 글에서는 다루지 않습니다. 여기서는 평가 대상, 채점 기준, 결과를 볼 사람을 어떻게 나눌지만 정리합니다.

2. 평가 대상이 자동화 전체로 넓어졌습니다

블로그는 "Makers can now evaluate both individual AI nodes and the broader automation, which helps teams understand whether processes are performing as intended and catch issues earlier."라고 밝혔습니다. 만드는 사람이 자동화 안의 개별 AI 노드와 그 노드가 들어 있는 자동화 전체를 모두 평가할 수 있다는 내용입니다. 회사 설명에 따르면 이를 통해 팀은 프로세스가 의도대로 작동하는지 파악하고 문제를 더 일찍 찾을 수 있습니다.

작성자는 이 변화가 평가 담당을 따로 둘 이유가 된다고 봅니다. 개별 AI 노드의 답이 적절한지는 만드는 사람이 판단할 수 있지만, 자동화 전체가 업무 결과를 제대로 내는지는 그 업무를 맡은 사람이 더 잘 판단합니다. 예시로, 구매 요청을 분류해 승인 담당자에게 넘기는 자동화라면 분류 노드의 정확도는 만드는 사람이 보고, 요청이 올바른 승인 담당자에게 넘어갔는지는 구매 담당자가 보는 식으로 나눌 수 있습니다.

3. 채점 기준에 넣을 기대값은 업무 담당자와 함께 정합니다

블로그는 시나리오별로 성능을 재는 기준도 소개했습니다. 원문은 "Task Completion checks whether an agent accomplished the intended user outcome, Tool Accuracy evaluates whether it selected the expected tools and inputs, and Safety measures responses against configurable content safety thresholds."라고 설명합니다. Task Completion은 사용자가 의도한 결과를 에이전트가 이뤘는지, Tool Accuracy는 기대한 도구와 입력을 골랐는지 확인하고, Safety는 설정할 수 있는 콘텐츠 안전 임계값에 비춰 응답을 측정합니다.

Task Completion, Tool Accuracy, Safety의 정의에는 모두 '의도한 결과', '기대한 도구와 입력', '임계값'처럼 미리 정해 둘 기대값이 들어 있습니다. 이 기대값은 업무를 아는 사람이 정해야 정확합니다. 그래서 작성자는 기대 결과 문장과 불러야 할 도구 목록은 업무 담당자가 쓰고, 이를 Copilot Studio 평가에 설정해 실행하는 일은 만드는 사람이 맡는 분담을 제안합니다.

아래 도식은 이 분담을 만드는 사람과 결과를 보는 사람의 작업 줄로 나눠 그렸습니다. 실선 상자는 블로그에 적힌 기능이고, 점선 상자와 점선 화살표는 작성자의 분담 제안입니다.

만드는 사람 줄에는 채점 기준 설정, AI 노드와 자동화 전체 평가 실행, 결과를 보고 에이전트 수정이 있고, 결과를 보는 사람 줄에는 기대값 함께 정하기와 Evaluation Viewer 역할로 결과 확인이 있는 역할 분담 도식
실선 상자의 기능 이름과 설명은 Microsoft Copilot Blog(2026년 10월 7일) 원문 사실입니다. 점선으로 그린 기대값 함께 정하기, 생성 기준 검토, 결과를 보고 에이전트 수정, 의견 전달은 작성자 제안입니다. 이미지를 열어 확대할 수 있습니다. 화면이 좁으면 도식을 가로로 스크롤해 글자를 확인하세요.

4. 생성한 채점 기준은 업무 담당자가 읽고 고칩니다

업무에 맞는 기준이 따로 필요할 때를 위해 블로그는 새 Custom Graders Library를 소개했습니다. 또 "Makers can also have Copilot Studio generate a custom grader for a specific agent and evaluation scenario, reducing the need to write the grading criteria from scratch."라고 밝혔습니다. 특정 에이전트와 평가 시나리오에 맞는 custom grader(사용자 지정 채점 기준)를 Copilot Studio가 생성해 주므로, 채점 기준을 처음부터 쓸 부담이 줄어든다는 설명입니다.

생성 기능이 있어도 기준의 내용이 업무 기대와 맞는지는 사람이 확인해야 합니다. 작성자는 생성된 기준을 업무 담당자가 먼저 읽고, 실제 업무에서 문제가 되는 경우가 빠지지 않았는지 고친 다음 평가에 쓰기를 권합니다. custom grader의 개념은 Microsoft가 2026년 3월 26일 같은 블로그에 올린 글에서 따로 다뤘으므로 배경 자료로 참고할 수 있습니다. Custom Graders Library에서 기준을 관리하는 방법은 이 글에서 다루지 않습니다.

5. 제공 상태와 확인하지 못한 것

블로그는 Evaluation Viewer 역할과 Custom Graders Library를 new라고만 소개했고, 정식 출시나 프리뷰 같은 제공 상태를 따로 적지 않았습니다. 같은 글에서 Review 패널은 정식 출시(generally available)라고 밝혔으므로, 이 둘과는 표기가 다릅니다. 요금제, 지역 제한, 한국 제공 여부도 원문에 없어 확인하지 못했습니다.

날짜도 짚어 둡니다. 블로그 화면에는 연도 없이 October 7만 표시됩니다. 이 글은 페이지 메타데이터의 게시 시각 2026-10-07T15:30:00+00:00(article:published_time)과 페이지 제목의 September 2026 표기로 연도를 2026년으로 확인했습니다. 9월 업데이트를 10월 7일에 묶어 발표한 글이어서, 각 기능이 실제 환경에 적용된 날짜는 적혀 있지 않습니다.

작성자는 Copilot Studio에서 Evaluation Viewer 역할을 직접 부여해 보지 않았습니다. 역할을 어디에서 부여하는지, 이 역할로 볼 수 있는 화면이 어디까지인지는 원문에 없어 다루지 않았습니다.

6. 이번 주에 해 볼 첫 단계

게시를 앞둔 에이전트 1개를 골라 평가 결과를 확인할 업무 담당자 1명을 정하십시오. 그 담당자와 함께 Task Completion에 쓸 의도한 결과 문장과 Tool Accuracy에 쓸 불러야 할 도구 목록을 문서 1건에 함께 적으면 됩니다. Evaluation Viewer 역할을 쓸 수 있는 환경인지는 Copilot Studio 관리자에게 확인하고, 쓸 수 있다면 그 담당자에게 제작 권한 대신 이 역할을 주는 것부터 시작하십시오.

확인한 공식 출처

  1. New and improved: Build apps, extend agents, and transform business processes in Microsoft Copilot Studio (Microsoft Copilot Blog, 2026년 10월 7일, 연도는 페이지 메타데이터 기준)
  2. Custom graders in Copilot Studio: Setting high standards for agent evals (Microsoft Copilot Blog, 2026년 3월 26일, 배경 자료)