AI가 길게 말하는 대신 ‘확률’로 딱 고른다? MS ‘디시전-1’ 결정 모델을 초보도 쉽게

테크부터 경제, 생활까지. 복잡한 소식을 쉽게 풀어봅니다.

큰 회사 고객센터에 전화를 걸면 먼저 안내 직원이 받아요. 이 직원의 일은 긴 설명을 해 주는 게 아니라, 내 말을 듣고 “결제 문제네요, 결제팀으로 연결해 드릴게요” 하고 딱 골라 주는 거예요. 만약 이 직원이 매번 A4 한 장짜리 답변을 써서 읽어 준다면 어떨까요? 정확할지는 몰라도 줄은 한없이 길어지겠죠.

지금까지 많은 AI 서비스가 바로 그렇게 일해 왔어요. 간단한 분류 하나에도 말 잘하는 대형 AI(LLM)가 긴 문장을 만들어 냈거든요. 그런데 마이크로소프트(MS)가 10월 9일(현지 시각) 글을 아예 쓰지 않고 정해진 선택지 중 하나를 ‘확률’과 함께 골라 주는 AI, 마이크로소프트 디시전-1(Microsoft-Decision-1)을 공개했습니다. 이게 뭔지, 왜 빠르고 싼지, 우리 생활과는 어떻게 이어지는지 고객센터 예시로 차근차근 풀어 볼게요.

긴 문장으로 답하는 일반 AI와 달리, 결정 모델은 정해진 선택지 하나를 확률과 함께 짧게 골라 준다
긴 문장으로 답하는 일반 AI와 달리, 결정 모델은 정해진 선택지 하나를 확률과 함께 짧게 골라 준다

한 줄로 먼저

  • 디시전-1은 문장을 쓰는 대신 “결제팀 92%, 기술팀 5%, 계정팀 3%”처럼 선택지마다 확률을 붙여 주는 결정 모델이에요.
  • MS 발표 기준으로 36개 벤치마크(약 15만 문항)에서 비교 대상 중 가장 정확했고, 응답 속도는 GPT-6 솔보다 약 35배 빨랐어요. 값은 입력 100만 토큰당 0.042달러, 출력은 무료입니다.
  • 확률이 함께 나오니 “확실하면 자동 처리, 애매하면 사람에게” 같은 규칙을 만들기 쉬워요. 다만 대화·번역·요약은 못 하고, 왜 그렇게 골랐는지 이유도 말해 주지 않아요.

한눈에 보는 이번 소식

항목 내용
누가 마이크로소프트(MS) CTO 오피스
무엇을 빠른 의사결정 전용 AI 모델 Microsoft-Decision-1(디시전-1)
언제 2026년 10월 9일(현지 시각) 공개
바탕 모델 알리바바의 공개 모델 큐원3.5-9B(Qwen3.5-9B)를 추가 학습. 앞으로 MS의 MAI, 오픈AI 모델 기반으로도 바꿀 계획
잘하는 일 분류, 라우팅(어디로 보낼지 정하기), 우선순위, 검증, 에이전트 제어, AI 답변 채점
못하는 일 자유로운 대화, 번역, 요약 같은 글 생성
어디서 MS 파운드리(Microsoft Foundry), 오픈라우터(OpenRouter) 같은 개발자용 서비스
가격 입력 100만 토큰당 0.042달러, 출력 무료
한 번에 읽는 양 최대 약 3만2천 토큰(32,768)

먼저 단어부터

이번 소식을 읽을 때 자주 나오는 단어를 먼저 정리해 볼게요.

용어 쉬운 뜻 생활 비유
LLM(대형 언어 모델) 챗GPT·클로드·제미나이처럼 문장을 만들어 내는 AI 말 잘하는 상담원
결정 모델 정해진 선택지 중 무엇이 맞는지 숫자로 판정만 하는 AI 전화 받고 부서만 골라 주는 안내 직원
라우팅 들어온 요청을 알맞은 곳(팀, 도구, 다른 AI)으로 보내는 일 택배 분류 센터
보정된 확률 “90%”라고 말한 판단이 실제로도 10번 중 9번쯤 맞도록 맞춰 둔 확률 “비 올 확률 90%” 예보가 정말 그만큼 맞는 것
토큰 AI가 글을 잘게 쪼개 읽는 단위. 요금 계산의 기준 글자를 세는 원고지 칸
AI 에이전트 대답만 하지 않고 클릭·검색·입력 같은 행동까지 하는 AI 심부름까지 해 주는 비서

어떻게 작동할까: 문의 한 건을 따라가 보기

쇼핑몰 고객센터에 “주문 A-4471이 두 번 결제됐어요. 중복 결제를 환불해 주세요”라는 문의가 들어왔다고 해 볼게요. 개발자는 디시전-1에 문의 내용과 질문, 그리고 고를 수 있는 선택지를 함께 보냅니다. 그러면 디시전-1은 문장 대신 선택지별 확률표를 돌려줘요.

고객 문의를 넣으면 결정 모델이 결제팀·기술팀·계정팀 같은 선택지마다 확률을 붙여 돌려준다 (숫자는 예시)
고객 문의를 넣으면 결정 모델이 결제팀·기술팀·계정팀 같은 선택지마다 확률을 붙여 돌려준다 (숫자는 예시)
보내는 것 / 받는 것 예시 쉬운 설명
상황(state) “주문이 두 번 결제됐어요. 환불해 주세요” 판단할 재료. 글이든 표 형태의 데이터(JSON)든 가능
질문 “이 문의는 어느 팀이 맡아야 하나요?” 한 번에 여러 질문을 함께 보낼 수도 있음
선택지 결제팀 / 기술팀 / 계정팀 / 기타 각 선택지에 짧은 설명을 붙여 줌
돌아오는 답 결제팀 선택 + 결제 0.92 · 기술 0.05 · 계정 0.03 (예시 숫자) 고른 답과 선택지별 확률. 이유 설명은 없음

여기서 핵심은 답이 항상 같은 모양으로 온다는 점이에요. LLM은 “아마 결제 문제인 것 같은데요, 다만…”처럼 매번 다른 문장으로 답할 수 있어서, 프로그램이 그 문장을 다시 해석해야 해요. 결정 모델은 처음부터 정해진 칸에 숫자만 채워 주니 프로그램이 바로 받아서 다음 일을 할 수 있습니다.

물어볼 수 있는 질문은 세 종류

디시전-1이 다루는 질문 세 종류: 예/아니오 확률, 객관식 선택, 단계별 점수 매기기
디시전-1이 다루는 질문 세 종류: 예/아니오 확률, 객관식 선택, 단계별 점수 매기기
질문 종류 이렇게 물어요 이렇게 답해요 쓰임새 예
예/아니오 “환불이 처리됐나요?” 0~1 사이 확률 하나 (예: 0.97) 스팸인지, 규칙 위반인지, 개인정보가 들어 있는지
객관식 “어느 팀이 맡아야 하나요?” 고른 선택지 + 모든 선택지의 확률 고객 문의 분류, 어떤 AI·도구를 쓸지 고르기
점수 매기기 “이 답변의 품질은 1~5 중 몇 점?” 점수 + 점수 단계별 확률 AI 답변 채점, 긴급도 등급, 검색 결과 관련도

왜 빠르고 쌀까: LLM과 나란히 비교

MS는 블로그에서 이런 예를 들었어요. AI 업무 하나에 판단이 20번 연달아 필요하다면, 판단 한 번에 0.1초만 더 걸려도 전체로는 2초가 늘어난다는 거죠. 결정 모델은 긴 글을 쓰지 않고 한 번에 확률만 계산하기 때문에 이런 지연을 크게 줄입니다.

비교 일반 LLM으로 분류할 때 디시전-1로 분류할 때
결과 모양 문장 (매번 표현이 조금씩 다름) 정해진 선택지 + 확률 (항상 같은 모양)
속도 긴 글을 한 글자씩 만들어야 해서 느림 MS 측정 기준 응답 속도가 GPT-6 솔보다 약 35배 빠름
비용 입력과 함께 출력 글자에도 요금 입력 100만 토큰당 0.042달러, 출력은 무료
확신 정도 “확실합니다”라는 말이 실제 정확도와 따로 놀 때가 많음 확률 자체가 결과의 일부. 90%면 10번 중 9번쯤 맞도록 보정
흔들림 말을 살짝 바꾸면 답이 바뀌기도 함 같은 요청을 8가지로 바꿔 봤을 때 판단이 바뀐 비율 평균 1.3%, 선택지 순서를 섞었을 때는 0건 (MS 측정)
잘하는 일 설명, 대화, 글쓰기, 복잡한 추론 고르기, 판정하기, 점수 매기기

가격을 감으로 느껴 볼까요? 예시 계산으로, 고객 문의 한 건이 질문·선택지를 합쳐 500토큰쯤 된다고 가정하면 100만 건은 5억 토큰이에요. 디시전-1 입력 요금으로는 약 21달러(5억 ÷ 100만 × 0.042달러)입니다. 실제 비용은 서비스·지역·요청 길이에 따라 달라지지만, 백만 건 분류를 커피 몇 잔 값으로 해낼 수 있다는 감은 오죠.

MS가 사내에서 먼저 써 본 결과

MS는 공개 전에 여러 팀이 디시전-1을 써 본 결과도 함께 밝혔어요. 모두 MS가 스스로 측정한 수치라는 점은 기억해 두세요.

팀 맡긴 일 MS가 밝힌 결과
엑스박스(Xbox) 연구팀 설문, 스팀(Steam), X에 올라온 게임 의견 1만 건 이상을 정해진 주제로 분류 GPT-6 솔과 비슷한 품질, 14배 이상 빠르고 비용은 200분의 1
코파일럿(Copilot) 팀 챗봇·에이전트 답변의 품질 채점 GPT-5.6 루나와 견줄 만한 품질, 100배 빠름
장애 대응 엔지니어 서비스 장애 때 로그·티켓·메시지에서 관련 정보 찾기 기존 LLM보다 더 정확하고 빠름
MS 디스커버리(과학 연구) 실험 결과를 기준표로 채점하고 다음 계획 고치기 LLM 채점보다 일관성 46배, 속도 3배, 계획 수정 전체는 거의 4배 빨라짐

확률이 왜 그렇게 중요할까: 신호등처럼 쓰기

디시전-1의 진짜 쓸모는 “답” 자체보다 답과 함께 오는 확신도에 있어요. MS 문서도 이 확률로 자동으로 처리할지, 한 번 더 확인할지, 사람에게 넘길지를 정하라고 안내합니다. 신호등처럼 생각하면 쉬워요.

확신도가 높으면 자동 처리, 중간이면 한 번 더 확인, 낮으면 사람에게 넘기는 식으로 활용한다 (기준 숫자는 예시)
확신도가 높으면 자동 처리, 중간이면 한 번 더 확인, 낮으면 사람에게 넘기는 식으로 활용한다 (기준 숫자는 예시)
확신도 (예시 기준) 처리 방법 고객센터라면
아주 높음 (예: 90% 이상) 자동 처리 바로 결제팀 대기열로 보내기
중간 (예: 60~90%) 한 번 더 확인 더 큰 AI에게 다시 묻거나 질문을 추가로 확인
낮음 (예: 60% 미만) 사람에게 넘김 상담 매니저가 직접 읽고 분류

기준 숫자는 회사마다 직접 정해야 해요. 실수했을 때 손해가 큰 일(환불, 계정 정지 등)이라면 자동 처리 기준을 더 높게 잡는 식이죠.

AI 에이전트의 ‘브레이크’ 역할도

요즘 AI는 웹사이트를 열고 버튼을 누르는 에이전트로 진화하고 있어요. 그런데 에이전트가 하면 안 되는 일을 해 버리는 사고도 이어지고 있죠. 오늘 새벽 MoricWorld에서 다룬 앤트로픽 AI가 경찰 제보 사이트에 가짜 제보를 보낸 사건이 대표적인 예예요.

MS는 디시전-1의 쓰임새로 “에이전트가 다음에 하려는 행동을 보고 계속할지, 멈출지, 다시 할지, 사람에게 넘길지 판정하기”를 꼽았어요. 에이전트가 “제출” 버튼을 누르기 직전에 빠르고 값싼 판정기가 “이건 진짜 사이트에 보내는 행동인가요?”를 묻고, 확률이 높으면 멈춰 세우는 식이죠. 판정이 빠를수록 모든 행동마다 검사해도 부담이 적습니다.

MS가 제안한 쓰임새 쉬운 예
에이전트 제어 AI 비서가 결제 버튼을 누르기 전 “계속/중지/사람에게” 판정
모델 라우팅 쉬운 질문은 싼 AI로, 어려운 질문은 비싼 AI로 보내기
데이터 라벨링 리뷰 수만 건을 “배송/품질/가격” 같은 주제로 일관되게 분류
AI 채점 AI가 쓴 답변을 기준표로 채점해 통과/수정/반려 결정
안전·보안 검사 요청이나 행동을 위험도로 분류해 허용/차단/보고
컴퓨터 사용 현재 화면에서 다음에 누를 버튼을 선택지 중에서 고르기

결정 모델, 요즘 왜 이렇게 많이 나올까

MS는 블로그 첫 문장에서 결정 모델을 “AI의 중요한 새 분야”라고 불렀어요. 실제로 최근 몇 주 사이 비슷한 움직임이 잇따랐습니다.

누가 무엇 언제(현지 기준)
마이크로소프트 디시전-1 공개 (MS 파운드리·오픈라우터) 10월 9일
오픈AI 정해진 선택지·확률·점수만 돌려주는 디시전스 API(Decisions API)를 공개 베타로 전체 개발자에게 개방. 기존 방식(GPT-6 루나 + Responses API)보다 최대 10배 빠르다고 설명 10월 초 (오픈AI 개발자 계정 발표 6일)
타입세이프 AI 9월에 결정 모델 제브(Jev)를 내놓은 스타트업. a16z 주도로 8억7천만 달러를 투자받아 기업가치 75억 달러 평가 10월 9일 투자 발표

배경은 단순해요. AI 에이전트가 하나의 일을 끝내려면 작은 판단을 수십, 수백 번 해야 하는데, 그때마다 크고 비싼 LLM을 부르면 느리고 돈이 많이 들거든요. “말은 큰 AI가, 고르기는 작은 결정 모델이” 하는 식으로 일을 나눠 맡기는 흐름이 생기고 있는 겁니다.

알아 둘 한계

한계 무슨 뜻인가요
글을 못 써요 대화, 번역, 요약, 설명은 지원하지 않아요. 고르기 전용입니다.
이유를 말해 주지 않아요 왜 결제팀을 골랐는지 설명이 없어요. 이유가 꼭 필요한 일이라면 사람이나 LLM이 따로 확인해야 해요.
선택지 밖은 못 골라요 보기에 없는 답은 고를 수 없어요. 그래서 “기타” 선택지를 넣어 두는 게 좋아요.
성적표는 MS가 직접 낸 것 정확도·속도 비교는 MS 자체 측정이에요. 비교 대상이나 수치가 발표 후 수정되기도 했어요. 내 데이터로 직접 시험해 보는 게 안전해요.
모델이 계속 바뀌어요 오픈라우터 설명에 따르면 요청 형식은 그대로 두고 모델 내부는 계속 업데이트돼요. 같은 질문의 결과가 시간이 지나며 달라질 수 있어 주기적으로 점검해야 해요.
아직 개발자용 챗GPT처럼 바로 쓰는 앱이 아니라, 서비스를 만드는 개발자가 API로 붙여 쓰는 부품이에요.

그래서 우리 생활엔 뭐가 달라질까

당장 디시전-1을 직접 쓸 일은 많지 않아요. 대신 우리가 쓰는 서비스 뒤편에서 조용히 일하게 될 가능성이 커요.

  • 고객센터: 문의가 알맞은 부서로 더 빨리 연결되고, 애매한 건 사람이 보게 될 수 있어요.
  • 쇼핑 리뷰·댓글: 광고성 댓글이나 악성 리뷰 거르기가 빨라지고 싸져요.
  • AI 비서: 결제·제출처럼 되돌리기 어려운 행동 앞에서 “잠깐 확인할게요”가 더 자주 붙을 수 있어요.
  • AI 요금: 쉬운 일은 작은 모델이 맡으면서 서비스 운영비가 내려가고, 그만큼 무료·저가 기능이 늘어날 여지가 생겨요.

개발자라면: 써 보는 길

단계 할 일
1. 고르기 MS 파운드리 모델 카탈로그나 오픈라우터에서 Microsoft-Decision-1 선택
2. 질문 설계 선택지를 겹치지 않게 정하고 짧은 설명을 붙이기. “기타” 선택지 넣기
3. 시험 내가 정답을 아는 예시 수백 건으로 정확도와 확률이 실제와 맞는지 확인
4. 기준 정하기 확률 몇 % 이상이면 자동 처리할지, 언제 사람에게 넘길지 결정
5. 점검 모델이 계속 업데이트되니 주기적으로 같은 예시로 다시 시험

한 가지 더, 오픈라우터의 결정 모델은 챗GPT식 대화 API가 아니라 별도의 결정 전용 API로 호출해요. 기존 채팅용 코드를 그대로 쓰면 작동하지 않으니 문서를 먼저 확인하세요.

마무리

지금까지 AI 경쟁이 “누가 더 말을 잘하나”였다면, 디시전-1은 “누가 더 빨리, 싸게, 믿을 만하게 고르나”라는 다른 경기장을 보여 줘요. 말 잘하는 상담원과 척척 연결해 주는 안내 직원이 함께 일하는 고객센터처럼, 앞으로의 AI 서비스도 큰 모델과 작은 결정 모델이 역할을 나눠 맡게 될 가능성이 큽니다. 다음에 고객센터 챗봇이 유난히 빨리 “담당 부서로 연결해 드릴게요”라고 한다면, 그 뒤에 이런 결정 모델이 있을지도 몰라요.