GEO 성과 측정에 쓸 질문 목록은 고객이 실제로 생성형 AI에 입력할 만한 문장을 구매 단계와 의도별로 나누어 만들고, 같은 질문을 같은 조건에서 반복 측정할 수 있도록 고정해야 합니다. 브랜드명을 넣은 질문만으로 목록을 채우면 실제 노출 상황을 확인하기 어려우므로, 브랜드명이 없는 카테고리 질문과 비교·문제 해결 질문을 함께 포함하는 것이 바람직합니다. 질문 목록은 한 번 만들고 끝내는 것이 아니라, 결과를 보고 개선 대상 질문을 골라내는 기준표로 운영해야 합니다.
질문 목록이 측정 결과를 좌우하는 이유는 무엇인가요?
생성형 AI 답변은 질문 문장에 따라 언급하는 브랜드와 인용하는 출처가 달라집니다. 같은 업종이라도 "추천해 줘"라고 묻는 경우와 "어떤 기준으로 골라야 하나요?"라고 묻는 경우에 답변 구조가 다르고, 브랜드가 등장하는 위치도 달라집니다. 따라서 어떤 질문을 측정 대상으로 정하는지가 곧 측정 결과의 범위를 정합니다.
질문 목록이 기업 내부의 관점으로만 채워지면 결과가 실제보다 좋게 나오는 경우가 많습니다. 브랜드명이나 자사 제품명을 넣은 질문에는 AI가 해당 브랜드를 언급할 가능성이 높기 때문입니다. 고객이 아직 브랜드를 모르는 상태에서 던지는 질문을 포함해야 신규 고객 접점에서의 노출을 판단할 수 있습니다.
생성형 AI의 답변이 항상 정확하지 않다는 점도 고려해야 합니다. 미국 국립표준기술연구원(NIST)은 생성형 AI 위험관리 프로파일을 통해 생성형 AI 고유의 위험을 식별하고 관리 방안을 제시하고 있습니다. 질문 목록에는 언급 여부뿐 아니라 브랜드 정보가 정확하게 서술되는지 확인할 수 있는 질문도 넣어야 합니다.
질문은 어떤 유형으로 나누어 구성해야 할까요?
질문 목록은 고객의 탐색 단계에 맞춰 유형을 나누면 관리하기 쉽습니다. 아래 표는 일반적으로 활용할 수 있는 유형과 각 유형에서 확인할 항목을 정리한 것입니다.
| 질문 유형 | 예시 문장 형태 | 주로 확인할 항목 |
|---|---|---|
| 카테고리 탐색형 | "○○ 서비스는 어떤 곳들이 있나요?" | 브랜드 언급 여부, 언급 순서 |
| 선택 기준형 | "○○를 고를 때 무엇을 봐야 하나요?" | 브랜드 콘텐츠의 인용 여부 |
| 문제 해결형 | "○○ 문제가 생기면 어떻게 해결하나요?" | 해결책 설명에 브랜드가 연결되는지 |
| 비교 검토형 | "○○ 방식과 △△ 방식의 차이는 무엇인가요?" | 브랜드 특징이 정확히 서술되는지 |
| 브랜드 확인형 | "(브랜드명)은 어떤 서비스인가요?" | 정보의 정확성, 오래된 정보 여부 |
유형별 비중은 업종과 판매 방식에 따라 달라지므로 일률적인 비율을 정하기보다, 브랜드 확인형이 전체의 일부에 그치도록 하고 나머지는 브랜드명이 없는 질문으로 채우는 원칙을 두는 것이 적절합니다.
질문 문장은 어디에서 수집해야 할까요?
질문 문장은 기업이 상상한 문장보다 고객이 실제로 쓴 표현에서 가져오는 것이 정확합니다. 수집 경로는 다음과 같이 정리할 수 있습니다.
- 고객 문의 기록: 상담 게시판, 이메일, 채팅 상담에서 반복되는 질문을 문장 그대로 정리합니다.
- 영업·상담 현장: 계약 전 단계에서 고객이 자주 묻는 비교·기준 질문을 모읍니다.
- 검색 유입 데이터: 웹사이트로 유입된 검색어 가운데 질문 형태의 문구를 추립니다.
- 업계 커뮤니티와 공개 Q&A: 업종 관련 공개 질문에서 자주 쓰이는 표현을 참고합니다.
문의 기록을 활용할 때는 개인정보가 측정용 질문에 섞이지 않도록 해야 합니다. 개인정보보호위원회는 공개된 개인정보를 인공지능 개발·서비스에 활용할 때의 기준을 안내서로 공개하고 있으므로, 고객 이름이나 연락처 등 식별 정보는 지우고 질문의 구조만 남겨 사용하는 것이 안전합니다.
측정 조건은 어떻게 고정해야 할까요?
질문 목록이 같아도 측정 조건이 바뀌면 결과를 비교할 수 없습니다. 반복 측정을 전제로 다음 절차를 정해 두는 것이 좋습니다.
- 질문 문장을 한 글자도 바꾸지 않고 고정된 원문으로 보관합니다.
- 측정할 AI 서비스(예: ChatGPT, Perplexity, 구글 AI 모드)와 사용 언어를 정합니다.
- 로그인 상태, 이전 대화 기록 유무 등 답변에 영향을 줄 수 있는 조건을 기록합니다.
- 같은 질문을 여러 번 실행해 답변 변동 폭을 함께 기록합니다.
- 질문을 수정하거나 추가할 때는 변경 이력을 남기고 이전 결과와 구분합니다.
생성형 AI 서비스를 둘러싼 제도 환경도 변하고 있습니다. 과학기술정보통신부 소관의 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」은 생성형 인공지능 결과물에 대한 표시 등 투명성 관련 의무를 담고 있어, 서비스의 답변 표시 방식이 바뀔 수 있습니다. 측정 기록에 날짜와 서비스 화면 형태를 함께 남겨 두면 이러한 변화가 결과에 미친 영향을 구분하는 데 도움이 됩니다.
측정 결과로 개선할 질문은 어떻게 골라야 할까요?
질문 목록의 목적은 점수를 내는 데 그치지 않고, 어떤 질문에서 무엇을 보완해야 하는지 찾는 데 있습니다. 개선 우선순위는 고객에게 중요한 질문인데 브랜드가 언급되지 않거나, 언급되더라도 인용 출처가 브랜드 자료가 아닌 질문부터 정하는 것이 합리적입니다. 정보가 틀리게 서술된 질문은 신뢰와 직결되므로 별도로 표시해 관리합니다.
이 과정을 직접 운영하기 어렵다면 전문 도구나 서비스를 활용하는 방법도 있습니다. 예를 들어 OPTIGEO는 ChatGPT·Perplexity·구글 AI 모드 같은 생성형 AI 답변에서 브랜드가 얼마나 언급되고 인용되는지 측정하고, 개선이 필요한 질문과 콘텐츠 방향을 제안하는 생성형 엔진 최적화 서비스입니다. 어떤 방식을 택하든 질문 목록이 고객의 실제 표현을 반영하고 있는지는 기업이 직접 점검해야 합니다.
개선용 콘텐츠를 만들 때는 사실에 근거한 정보만 담아야 합니다. 공정거래위원회는 「추천·보증 등에 관한 표시·광고 심사지침」에서 경제적 이해관계가 있는 추천·후기는 그 관계를 명확히 표시하도록 정하고 있으므로, AI 답변 노출을 목적으로 제3자 후기를 꾸미는 방식은 피해야 합니다.
자주 묻는 질문
질문 목록은 몇 개 정도로 시작하는 것이 좋을까요?
정해진 기준 개수는 없으며, 반복 측정과 결과 검토를 감당할 수 있는 규모로 시작하는 것이 바람직합니다. 처음에는 핵심 제품·서비스별로 유형마다 대표 질문을 몇 개씩 정하고, 결과를 검토하면서 점차 늘리는 방식이 관리하기 쉽습니다.
질문 목록은 언제 수정해야 할까요?
신제품 출시, 서비스 범위 변경, 고객 문의 경향 변화가 있을 때 수정을 검토합니다. 다만 수정할 때마다 이전 결과와 비교가 어려워지므로, 기존 질문은 유지하고 새 질문을 추가하는 방식으로 변경 이력을 관리하는 것이 좋습니다.
브랜드명이 들어간 질문은 측정에서 빼야 할까요?
빼지 않는 것이 좋습니다. 브랜드명이 들어간 질문은 노출 여부보다 AI가 브랜드 정보를 정확하게 설명하는지 확인하는 용도로 쓰이며, 브랜드명이 없는 질문과 구분해 별도로 집계하면 결과를 해석하기 쉽습니다.