자연어 분석 기능을 사용하면 대시보드에 질문을 던지기가 매우 간편합니다. 하지만 더 까다로운 부분은 해당 질문이 명확하고 측정 가능한 단일 의미를 갖도록 보장하는 것입니다.
저희는 수익, 이익, 이익률, 주문 건수, 반품률, 전년 동기 대비 성장률을 포함한 통제된 지역별 성과 데이터 세트와 4개 지역의 분기별 데이터를 활용하여 ChartGen으로 이를 테스트했습니다.
첫 번째 질문은 일부러 모호하게 작성되었습니다:
“어느 지역의 성적이 가장 좋았나요?”
그 후 우리는 더 구체적인 질문을 던졌습니다:
“2026년 2분기 지역별 총수익을 비교하고 지역을 수익이 높은 순서부터 낮은 순서까지 순위를 매기십시오.”
두 개의 프롬프트는 전혀 다른 유형의 답변을 생성했습니다.
이러한 차이는 대화형 AI 대시보드 의 중요한 한계를 보여줍니다. 자연어는 데이터 탐색을 쉽게 만들어 주지만, '최고', '우수', '성공'과 같은 비즈니스 용어가 실제로 무엇을 의미하는지 자동으로 정의해 주지는 않습니다.
하나의 간단한 질문에서 여러 가지 타당한 답이 나왔다
우리의 첫 번째 프롬프트는 "최상의 성능을 발휘한다"는 의미를 정의하지 않았습니다.
ChartGen은 데이터 세트를 임의의 순위로 강제 배치하지 않았습니다. 대신 여러 사용 가능한 지표를 통해 지역별 성과를 평가했습니다.
서부 지역은 수익성 면에서 두드러졌다. 입수 가능한 분기별 데이터 전체를 살펴보면, 해당 지역의 전체 이익률은 약 20.8%로 4개 지역 중 가장 높았다.
북부 지역이 규모 면에서 선두를 달렸습니다. 해당 지역은 최고의 매출과 주문량을 기록했지만, 전체 이익률은 약 16.8%로 다소 낮은 수준이었습니다.
남부 지역이 가장 강한 성장세를 보였으며, 평균 전년 동기 대비 성장률은 약 11%에 달했습니다.
동부 지역은 수익률에서 가장 우수한 성적을 보였으며, 전체 수익률은 약 2.56%로 4개 지역 중 가장 낮았습니다.
따라서 ChartGen은 수익성을 최우선으로 할 경우 웨스트 지역이 더 강세이며, 규모와 거래량이 더 중요한 경우에는 노스 지역이 우위를 점한다는 결론을 내렸습니다.
그 결과는 본래 질문의 진짜 문제점을 드러내기 때문에 유용하다.
데이터에서 '최적'에 대한 단일한 정의는 존재하지 않았습니다.

(동일한 데이터 세트에서도 성과를 매출, 수익성, 성장률, 수익률 중 어느 기준으로 측정하느냐에 따라 선두 기업이 달라졌다.)
“최고 성과자”는 스프레드시트의 필드가 아닙니다
원본 파일에는 매출, 이익, 이익률, 주문 건수, 반품률, 전년 동기 대비 성장률이 포함되어 있었지만, '최고 실적 지역'이라는 필드는 존재하지 않았습니다.
우리가 ChartGen에 "어느 지역의 성적이 가장 좋았나요?"라고 물었을 때, 그 답은 이러한 모호함을 그대로 드러냈습니다. ChartGen은 데이터를 억지로 단일 순위로 정렬하는 대신 여러 지표를 기준으로 지역 간 비교를 진행했습니다.

이번 테스트에서 북부는 매출과 주문량에서 선두를 차지했고, 서부는 이익과 이익률에서 우위를 점했으며, 동부는 수익률이 가장 낮았고, 남부는 가장 강한 성장세를 보였습니다.
중요한 점은 인공지능이 잘못된 답을 선택했다는 것이 아니다. 해당 비즈니스 질문 자체가 '최적'이 무엇을 의미하는지 정의하지 않았기 때문이다.
더 구체적인 질문은 검증 가능한 답변을 도출한다
두 번째 테스트에서는 모호한 단어인 "최고"를 제거하고 무엇을 정확히 비교해야 하는지 명확히 정의했습니다.
저희가 질문했습니다:
2026년 2분기 지역별 총 매출을 비교하고 지역을 매출액 높은 순서대로 정렬하십시오.
이번에는 결과가 훨씬 더 구체적이었습니다.
ChartGen은 2분기 매출을 다음과 같이 순위 매겼습니다:
북부 — 520,000달러
동부 — 47만 달러
남부 — 455,000달러
서부 — 430,000달러

(측정 기준과 기간이 정의된 후, ChartGen은 지역별 2026년 2분기 매출 순위를 명확하게 반환했습니다.)
2분기 최고 매출과 최저 매출의 차이는 9만 달러입니다.
더 중요한 점은, 이제 업로드된 소스 파일과 직접 대조하여 결과를 확인할 수 있다는 것입니다.
인공지능이 “성능”이 무엇을 의미하는지 결정할 필요는 없었습니다.
해당 지표는 매출이었습니다.
해당 계산은 총수입을 기준으로 진행되었습니다.
해당 범위는 지역이었습니다.
해당 기간은 2026년 2분기였습니다.
이 네 가지 세부 사항은 결론이 정해지지 않은 비즈니스 질문을 다른 검토자가 재현할 수 있는 명확한 답변으로 바꾸어 주었습니다.
시간대 역시 의미를 바꿀 수 있다
첫 번째 프롬프트는 또 다른 결정 사항을 정의하지 않은 채 남겨두었습니다.
어느 지역의 성적이 가장 우수했나요?
성과를 1분기, 2분기, 최근 분기 또는 모든 이용 가능한 기간에 대해 평가해야 하는지 여부에 대해 명시하지 않습니다.
우리의 테스트에서 ChartGen은 사용 가능한 분기별 기록을 활용하여 4개 지역에 관한 보다 폭넓은 관찰 결과를 도출했습니다.
이는 데이터셋을 탐색하는 합리적인 방법이었지만, 답변을 공식 보고서에 사용할 때 시간 범위가 왜 중요한지도 보여줍니다.
이 두 가지 질문을 비교해 보십시오:
매출액이 가장 높은 지역은 어디인가요?
그리고:
2026년 2분기에 총수익이 가장 높았던 지역은 어디인가요?
두 번째 질문은 다른 사람이 포함되어야 할 기록이 정확히 무엇인지 알고 있기 때문에 확인하기 더 쉽습니다.
명확한 기간이나 지표가 없더라도 AI는 여전히 해석을 내려야 합니다.
대화 분석에 비즈니스 컨텍스트가 필요한 이유
이 문제는 ChartGen에만 국한된 것이 아닙니다.
마이크로소프트는 Power BI를 기존의 Q\&A 환경에서 코파일럿으로 전환하고 있습니다. 기존 Q\&A 시스템은 이미 동의어와 모델 용어를 기반으로 자연어 질문이 올바른 필드에 매핑되도록 지원해 왔으며, 마이크로소프트는 2026년 12월에 레거시 Q\&A 환경을 서비스 종료할 계획입니다. \(Microsoft Learn, 「소개: Power BI Q\&A로 자연어를 사용하여 데이터 탐색」\)
구글은 Looker 대화형 분석을 통해 이 문제를 더욱 심도 있게 다룹니다. 해당 솔루션의 데이터 에이전트는 의미 모델과 맞춤 지침을 활용할 수 있는데, 이를 통해 어떤 필드가 중요한지, 계산 방식은 어떻게 해야 하는지, 특정 비즈니스 용어가 무엇을 의미하는지가 정의됩니다. \(Google Cloud, 「Looker 대화형 분석 개요」\)
이 점은 언어를 이해하는 것과 비즈니스 의미를 이해하는 것 사이의 차이를 명확히 보여줍니다.
시스템은 "성능이 가장 우수한 지역"이라는 단어를 이해할 수는 있지만, 답변이 명확해지려면 여전히 성능에 대한 정의가 필요합니다.
네 가지 세부 사항으로 AI 대시보드 질문의 검증이 더 수월해집니다
유용한 대시보드 질문은 일반적으로 네 가지를 정의합니다.
지표 정의하기
“최고”, “가장 강한”, “가장 성공적인” 등의 포괄적인 단어를 측정 가능한 표현으로 바꾸십시오.
다음 대신:
질문:
이제 해당 결과에는 구체적인 지표가 뒷받침되고 있습니다.
계산 정의하기
해당 질문이 총계, 평균, 개수, 백분율 또는 비율을 요구하는지 명확히 하십시오.
“최고 수익”은 “주문당 최고 평균 수익”과 다릅니다.
“대부분의 수익”은 “최고 수익률”과 다릅니다.
범위 정의
분석에 포함될 데이터의 부분을 지정하십시오.
인공지능 대시보드 제작 도구 는 분석 및 시각화 과정의 상당 부분을 자동화할 수 있지만, 여전히 해당 질문이 어떤 데이터를 다루려는지 파악해야 합니다.
기간 정의
2026년 2분기, 2026년 7월, 연초부터 현재까지, 혹은 최근 6개월 등 명확한 기간을 사용하십시오.
이렇게 하면 시스템이 별도로 내려야 했던 또 다른 의사결정 단계가 사라집니다.
엑셀 AI 대시보드를 작업할 때도 동일한 원칙이 적용됩니다. 구조가 잘 짜여진 통합 문서는 도구가 필드와 값을 인식하는 데 도움이 되지만, 데이터 모델이나 질문 내 어딘가에 해당 정의가 존재하지 않는 한 통합 문서 자체로는 어떤 비즈니스 목표가 중요한지 결정할 수 없습니다.

소스 데이터와 답을 대조하여 확인하십시오
자연어로 작성된 답변이 그럴듯하게 들린다는 이유만으로 수용되어서는 안 됩니다.
보고서에서 해당 결과를 사용하기 전에 시스템이 의도한 지표, 계산 방식, 적용 범위 및 기간을 사용했는지 확인하십시오.
두 번째 테스트에서 해당 확인 작업은 매우 간단했습니다.
질문에서 수익을 요구했으므로 출력 시에는 이익이나 주문이 아닌 수익을 사용해야 합니다.
총 수익을 요청했으므로 값을 평균 내서는 안 됩니다.
해당 설정에서 지역을 지정했으므로 출력 결과에서는 4개 지역을 비교해야 합니다.
해당 내용은 2026년 2분기로 명시되어 있으므로 1분기 실적은 순위에 영향을 미치지 않아야 합니다.
그러면 최종 주문을 CSV와 직접 비교할 수 있습니다:
먼저 북쪽, 그 다음 동쪽, 남쪽, 서쪽 순서입니다.
이것이 두 번째 답변을 공식 보고서 작성에 더 유용하게 만드는 이유입니다. 단순히 더 상세한 것만이 아닙니다. 원본 데이터로 명확하게 거슬러 올라갈 수 있는 경로가 존재하기 때문입니다.
AI는 데이터를 분석할 수 있지만, 비즈니스가 질문을 정의한다
첫 번째 ChartGen 결과를 실패로 간주해서는 안 됩니다.
사실 그것은 유용했습니다.
수익성, 규모, 성장성, 수익률을 분리함으로써 지역 성과에 대한 여러 정의가 가능하다는 점이 드러났다.
이러한 탐색적 답변은 사용자가 데이터 중 어떤 부분을 추가로 조사할 가치가 있는지 파악하는 데 도움을 줄 수 있습니다.
답변이 보도의 헤드라인, KPI 결론 또는 비즈니스 의사결정이 되어야 할 때 기준이 바뀝니다.
그 시점에서 해당 지표는 다른 사람이 그 결과를 재현할 수 있을 만큼 명확해야 합니다.
ChartGen의 AI 대시보드 생 는 Excel 또는 CSV 데이터를 활용해 대시보드, 시각화 자료, 자연어 기반 인사이트를 제작할 수 있습니다. 다만 기업은 자체적인 맥락에서 '최고', '고가치', '성공적', '저조' 등의 용어가 구체적으로 무엇을 의미하는지 직접 정의해야 합니다.
AI는 정의를 처리할 수 있습니다.
그것이 묵묵히 해당 정의의 소유자가 되어서는 안 된다.
더 나은 질문은 더 검증 가능한 답을 이끌어낸다
우리의 두 가지 ChartGen 테스트는 동일한 기본 지역 데이터 세트를 사용했습니다.
첫 번째 질문은 다음과 같습니다:
“어느 지역의 성적이 가장 좋았나요?”
여러 답변이 타당성을 인정받을 수 있었기 때문에 다중 지표 해석이 도출되었습니다. 서부는 수익성에서 우위를 점했고, 북부는 규모에서 우위를 점했으며, 남부는 성장에서 우위를 점했고, 동부는 수익률이 가장 낮았습니다.
두 번째 질문은 다음과 같습니다:
“2026년 2분기 지역별 총수익을 비교하고 지역을 수익이 높은 순서부터 낮은 순서까지 순위를 매기십시오.”
원본 데이터와 대조해 검증 가능한 명확한 순위가 한 차례 도출되었는데, 북부가 52만 달러, 동부가 47만 달러, 남부가 45만 5천 달러, 서부가 43만 달러 순이었습니다.
그 차이가 바로 실질적인 교훈이다.
자연어 분석을 통해 데이터에 관한 질문을 훨씬 쉽게 할 수 있지만, 모호한 비즈니스 정의가 사라지는 것은 아닙니다.
AI 대시보드의 답변을 신뢰하기 전에 지표, 계산 방식, 적용 범위 및 시간대를 정의하십시오.
이 네 가지 요소가 명확할수록 답변을 검증하기 더 쉬워지며, 비즈니스 보고서에 사용할 때도 더 안전해집니다.

