이메일 AI 비서에게 필요한 일은 문장을 그럴듯하게 쓰는 것만이 아니다. Fyxer는 새 이메일이 오면 먼저 답장이 필요한지, 일정 조치가 필요한지, 아니면 사용자에게 알리면 되는지를 구분한다. 답장이 필요한 경우에는 이메일의 의도와 예상되는 상호작용 결과도 분석한다. 사용자가 알아야 할 변화는 ‘무슨 답장을 쓸까’보다 ‘지금 답장을 써야 할까’부터 판단하도록 설계됐다는 점이다. 출처

이 사례가 특히 관련 있는 곳은 이메일과 업무 대화의 맥락, 상대와의 관계, 사람마다 다른 말투를 반영해야 하는 AI 제품을 만드는 팀이다. 일반 사용자에게는 AI가 만든 초안을 완성된 답장으로 받아들이기보다, 앞선 대화와 자신의 의도가 제대로 반영됐는지 살피는 관점이 중요하다. 다만 아래 단계는 Fyxer가 설명한 제품 개발 방식이지, 독자가 자신의 이메일 서비스에서 그대로 켤 수 있는 설정 방법은 아니다. 출처

시작 전: 어떤 일을 맡길지 나누기

Fyxer는 이메일 작성을 하나의 생성 작업으로 묶지 않았다. 답장 필요 여부 판단, 의도 분석, 상황에 맞는 맥락 검색, 초안 작성 등을 나누고 30~50개의 전문 모델이 각각 맡도록 설계했다. 업무용 AI를 만드는 팀이라면 먼저 ‘메일을 잘 써준다’는 넓은 목표를 이런 하위 작업으로 쪼개 보는 것이 이 사례에서 확인되는 출발점이다. 그래야 초안 문장의 문제인지, 애초에 답장이 필요한 메일을 잘못 골랐는지 따로 살펴볼 수 있다. 출처

1단계: 답장할 메일부터 판단하기

새 메일을 받았다고 모두 같은 흐름으로 보내지는 않는다. Fyxer의 분류 단계는 답장, 일정 조치, 단순 알림 중 무엇이 필요한지 가린다. 답장이 필요하다고 판단한 뒤에야 추가 모델이 상대의 의도와 예상되는 상호작용 결과를 분석한다. 제품을 설계한다면 초안의 문장 품질만 볼 것이 아니라, 메일을 어떤 작업으로 분류했는지도 별도로 확인해야 하는 이유다. 출처

2단계: 이전 대화 중 필요한 맥락 찾기

답장에 필요한 정보가 늘 지금 받은 메일 안에만 있는 것은 아니다. Fyxer는 대화마다 장기적으로 기억할 정보를 판단하고, 저장된 상호작용 가운데 해당 사용자와 대화에 관련된 기억을 검색한다. 여기서 핵심은 이전 내용을 무조건 많이 가져오는 것이 아니라 지금 대화에 관련된 내용을 찾는 흐름이다. 다만 자료에는 무엇을 어떤 기준으로 저장하는지, 개인정보를 어떻게 처리하는지에 관한 구체적인 설명이 없어 그 방식까지 평가할 수는 없다. 출처

3단계: 실제 업무 사례로 만들고 검증하기

Fyxer는 제품 개발 전에 사람 기반 임원 비서 서비스를 운영하며 50만 시간 이상의 주석 처리된 업무 흐름 데이터를 축적했다. 여기에는 언제 응답하는지, 어떤 과거 대화가 관련되는지, 사용자에 따라 답장이 어떻게 달라지는지에 관한 사례가 담겼다. 모델 학습에는 지도 미세조정(SFT)과 LoRA를 사용해 업무별 변형을 만들었고, 특히 정확도가 중요한 작업에는 OpenAI 미세조정 플랫폼을 활용했다고 밝혔다. 이 과정은 단순히 모델을 선택하는 일보다 실제 업무 사례를 확보하는 일이 중요하다는 점을 보여준다. 출처

배포 전에는 자체 이메일 작업 검증 세트로 초안 작성, 분류, 우선순위 지정 성능을 평가한다. 정확도만이 아니라 응답 시간과 비용도 함께 고려한다. 따라서 비슷한 제품을 만드는 팀이라면 ‘답장이 자연스러운가’라는 한 가지 질문에 그치지 말고, 작업별 결과와 속도·비용을 함께 점검하는 절차를 마련해야 한다. 출처

4단계: 사용자가 고친 부분으로 개선하기

초안이 실제로 도움이 됐는지는 사용자가 보낸 최종 이메일과 비교해 볼 수 있다. Fyxer는 원래 초안과 사용자가 수정한 최종본의 차이를 선호 데이터로 활용하고, 두 출력을 비교하는 방식으로 DPO 학습 데이터를 만든다. 모든 초안 변경은 A/B 테스트를 거치며, 통계적으로 유의한 개선이 있을 때만 출시한다고 설명했다. 이런 개선 흐름을 만들려면 초안과 최종본을 비교할 수 있는 피드백 경로, 그리고 변경 결과를 검증할 실험 절차가 필요하다. 출처

결과를 볼 때 확인할 것

OpenAI가 소개한 Fyxer 사례에서는 AI 생성 초안의 53%가 수정 없이 채택됐다. 공동 창업자는 가입 90일 시점에도 사용자 90% 이상이 유료 이용을 유지하며 매일 사용한다고 밝혔다. 다만 제공된 자료에는 이 수치의 산정 방식이나 독립 검증 결과가 제시되지 않았다. 다른 제품에서도 같은 결과가 나온다는 뜻으로 받아들이기보다, 이 사례에서 발표된 성과로 읽는 편이 정확하다. 출처

내게 적용한다면 어디까지일까

일반 사용자라면 AI 초안을 확인할 때 ‘말투가 자연스러운가’와 함께 ‘답장이 필요한 메일이 맞는가’, ‘앞선 대화의 관련 내용이 반영됐는가’를 살펴볼 수 있다. 업무용 AI를 만드는 팀이라면 작업 분해, 실제 사례 확보, 정확도·속도·비용 평가, 사용자 수정 반영, A/B 테스트를 순서대로 점검하는 것이 이 사례에서 확인할 수 있는 실행 항목이다. 다만 모델별 세부 구성과 비용, 개인정보 처리 방식, 다른 제품에서 같은 성과를 재현할 조건까지 공개된 것은 아니다. 출처