Una herramienta de IA puede leer una hoja de cálculo, generar varios gráficos y explicar el resultado antes de que la mayoría de las personas hayan revisado la primera fórmula. Esa velocidad es útil, pero también hace que una respuesta contundente sea fácil de aceptar de forma prematura.
Para ver qué aspectos aún requieren revisión, cargamos un conjunto de datos controlado de comercio electrónico correspondiente a seis meses en ChartGen y le preguntamos qué mes tuvo el mejor rendimiento y qué causó el cambio.
El resultado no fue un simple éxito o fracaso. ChartGen detectó el movimiento principal de los ingresos, lo vinculó con los pedidos y el valor promedio de los pedidos, y notó la única métrica que complicaba el panorama. Un segundo indicativo facilitó mucho la auditoría de los cálculos.
Incluso en ese caso, algunas etiquetas y suposiciones requerían una revisión humana antes de que el resultado estuviera listo para un informe.
El conjunto de datos utilizado en la prueba
El archivo contenía seis registros mensuales y seis campos:
El conjunto de datos se mantuvo deliberadamente reducido. Cada porcentaje podía recalcularse manualmente, y no existían campos de cliente, campaña, producto o motivo de reembolso que pudieran explicar por qué variaba una métrica.
Primero preguntamos:
«Analice estos datos mensuales de rendimiento del comercio electrónico. ¿Qué mes tuvo el mejor desempeño y qué causó el cambio?»
La primera respuesta fue mejor que un simple resumen de ingresos
ChartGen calificó el aumento de los ingresos de junio como un "impulso de doble motor", ya que tanto el volumen de pedidos como el valor promedio de los pedidos aumentaron al mismo tiempo. También sugirió varias explicaciones posibles, entre ellas una campaña de ventas adicionales, un cambio en la combinación de productos o una promoción.
Más importante aún, no se limitó a los indicadores positivos. Señaló que la tasa de reembolso era una señal de alerta y concluyó que junio tuvo el mejor rendimiento bruto, mientras que el panorama neto era menos claro.

ChartGen vinculó el aumento de los ingresos de junio con los pedidos y el valor promedio de los pedidos, y luego matizó el resultado debido al pico de reembolsos.
Este fue un primer análisis útil. La descripción de un levantamiento dual coincidía con los datos, y términos como “sugiere” dejaban claro que las causas propuestas eran posibilidades, no hechos confirmados.
Una frase seguía quedando fuera del alcance del informe. En la respuesta se indicaba que el crecimiento simultáneo de los pedidos y del valor medio de los pedidos era «relativamente poco frecuente». Los seis registros mensuales no permitían determinar qué tan poco frecuente era ese patrón. Para corroborar esa afirmación se necesitaría un conjunto de datos históricos más amplio o una fuente externa.
Las posibles explicaciones seguían siendo meras hipótesis. Nada en la hoja de cálculo indicaba si ChartGen estaba analizando una promoción, una nueva categoría de productos, un cambio de precios o una combinación de clientes distinta.
Los ingresos eran correctos, pero el eje alteró la impresión
El primer gráfico generado mostraba los ingresos mensuales de enero a junio. Los seis valores eran correctos, y junio estaba claramente marcado con 120 000 dólares.

El gráfico de ingresos generado utilizó una línea de base de 80 000 dólares, lo que hizo que la diferencia entre las barras mensuales pareciera mayor.

El eje vertical comenzó en 80 000 dólares en lugar de en cero. Esa elección hizo que la barra de junio pareciera aproximadamente el doble de alta que la barra de enero por encima de la línea de base visible.
Los ingresos reales aumentaron de 100 000 dólares a 120 000 dólares, lo que supone un incremento del 20 %. El gráfico no modificó los valores, pero otorgó a la diferencia visual más peso del que justificaban los números por sí solos.
Esta es una distinción importante en el análisis de gráficos de IA. Una etiqueta correcta no garantiza una escala visual neutra. La Función de Análisis del Gobierno del Reino Unido señala en su guía de gráficos que la ruptura de un eje numérico puede ayudar a los lectores a apreciar una tendencia estrecha, pero no siempre es apropiada. En este caso, la línea de base de 80 000 dólares otorgó a un aumento del 20 % un peso visual mayor del que correspondía.
El hecho de que dos líneas mostraran una tendencia al alza no significaba que las escalas fueran comparables
ChartGen también colocó los pedidos y el valor promedio de los pedidos en un gráfico de líneas de doble eje.

Los pedidos se representan en el eje izquierdo, mientras que el valor medio de los pedidos utiliza una escala independiente en el eje derecho.
El gráfico mostraba correctamente que ambas métricas aumentaron en junio. Sin embargo, las dos líneas utilizaban unidades y ejes diferentes: los pedidos en el eje izquierdo y los dólares por pedido en el eje derecho.
Sus posiciones verticales no podían compararse directamente. Las líneas cercanas no significaban que las dos métricas tuvieran el mismo tamaño, se movieran en el mismo porcentaje o mantuvieran una relación causal entre ellas.
El gráfico también conservó etiquetas de estilo de hoja de cálculo como Average\_Order\_Value, y la leyenda acortó el nombre del campo. Se trata de pequeños problemas de presentación, pero cobran importancia cuando un gráfico sale de un espacio de trabajo de análisis y pasa a formar parte de un informe para el cliente.
La versión más segura utilizaría dos gráficos alineados con el mismo eje mensual, o etiquetaría claramente el cambio porcentual de cada métrica en lugar de invitar a los lectores a comparar la altura de las líneas.
Un gráfico generado no estaba listo para publicarse
El tercer resultado tenía como objetivo mostrar la tendencia mensual de la tasa de reembolso. Su título indicaba correctamente que en junio se había alcanzado un 5,02 %, pero la imagen exportada solo mostraba una línea de referencia promedio de aproximadamente el 2,48 %. Los seis valores mensuales y el pico de junio no eran visibles en el gráfico.
Excluimos esa imagen de los elementos visuales del artículo.
Esto no era un problema con el cálculo subyacente, sino con la evidencia representada. El lector podía ver la afirmación en el subtítulo, pero no podía verificarla a partir del propio gráfico.
Es fácil pasar por alto esta comprobación cuando el análisis escrito ya parece correcto: confirma que cada gráfico exportado muestre realmente las series descritas en su título y su pie de foto.
Un segundo indicio facilitó la auditoría del razonamiento
A continuación, le pedimos a ChartGen que utilizara únicamente los datos cargados, mostrara sus cálculos, separara las observaciones de las explicaciones e identificara cualquier métrica que contradijera la conclusión principal.
La segunda respuesta calculó:
Crecimiento de los ingresos de mayo a junio: 9,09%
Crecimiento de pedidos: 3,40 %
Crecimiento del valor promedio de pedido: 5,49%
Crecimiento de reembolsos: 161,9 %
Tasa de reembolso: del 1,98 % al 5,02 %
También se verificó si los Ingresos eran coherentes con el resultado de multiplicar los Pedidos por el Valor Promedio por Pedido. Las pequeñas diferencias se debieron a que los valores del VPP se almacenaron con dos decimales.

La respuesta de seguimiento expuso los cálculos y verificó si los campos relacionados estaban conciliados.
Esto resultó más útil que otro resumen general, ya que mostraba el origen de los porcentajes y hacía visibles las diferencias por redondeo.
ChartGen también separó las posibles explicaciones de sus observaciones. Las promociones, las nuevas categorías de productos, los problemas de calidad y el momento de los reembolsos se presentaron explícitamente como hipótesis que el conjunto de datos no pudo confirmar.

La segunda respuesta marcó claramente las explicaciones sobre campañas, productos, cumplimiento y contabilidad como hipótesis no confirmadas.
Esa separación hizo que la respuesta fuera más segura de usar. Evitó que una narrativa empresarial plausible se confundiera con un resultado contenido en la hoja de cálculo.
La respuesta de verificación aún requiere verificación
La segunda respuesta mejoró el análisis, pero no estaba lista para ser copiada directamente en un informe sin modificaciones.
El “promedio del conjunto de datos” utilizó una línea de base incorrecta
Denominó al 1,99 % la tasa de reembolso "promedio del conjunto de datos". A lo largo de los seis meses, el promedio fue de aproximadamente el 2,48 %. La cifra del 1,99 % representaba la línea de base de enero a mayo, antes del pico registrado en junio. El número era útil, pero la etiqueta era incorrecta.
La estimación de los ingresos netos se basó en tres supuestos
La respuesta también estimó los ingresos netos de junio multiplicando el número de reembolsos por el valor promedio de los pedidos y restando el resultado de los ingresos brutos. El cálculo aritmético era comprensible, pero el archivo de origen no contenía los valores reales de los reembolsos. Tampoco indicaba si los reembolsos de junio correspondían a pedidos realizados en ese mismo mes.
Esa estimación se basaba en al menos tres supuestos:
- Todos los pedidos reembolsados tenían el mismo valor que el pedido promedio mensual.
- Todos los reembolsos registrados en junio corresponden a las ventas de junio.
- El campo de Ingresos aún no se había ajustado para tener en cuenta los reembolsos.
Podría presentarse como un escenario, pero no como una observación basada únicamente en hechos.
El aumento del 164% se basó en una línea de referencia poco clara
La respuesta también indicó que el aumento de la tasa de reembolso fue del 164%, sin especificar el período de comparación. Al pasar del 1,98% de mayo al 5,02% de junio, el aumento relativo fue de aproximadamente el 153,5%. Un aumento del 164% se basaría en un valor de referencia distinto, cercano al 1,90% registrado en enero.
Seis meses no fueron suficientes para una reclamación formal de valor atípico
Por último, calificar a junio como un valor atípico estadístico basándose en seis observaciones mensuales fue una afirmación más contundente de lo necesario. Junio fue claramente una anomalía en comparación con el rango registrado entre enero y mayo. Una conclusión estadística formal requeriría un historial de datos más amplio y un método adecuado para el proceso subyacente.
Ninguno de estos problemas hizo que la segunda respuesta fuera inútil. Demostraron por qué un mensaje de verificación mejora el trabajo sin sustituir al revisor.
La conclusión que realmente publicaríamos
Tras verificar los datos de origen, los cálculos, las etiquetas y los supuestos, el resultado se puede expresar de forma más clara:
En junio se registraron los ingresos brutos, el volumen de pedidos y el valor promedio por pedido más altos de todo el conjunto de datos de seis meses. Los ingresos aumentaron un 9,09 % respecto a mayo, mientras que los pedidos subieron un 3,40 % y el valor promedio por pedido creció un 5,49 %.
El resultado no supuso una mejora incondicional. Las devoluciones pasaron de 42 a 110, y la tasa de devoluciones subió del 1,98 % al 5,02 %, lo que representa un incremento de 3,04 puntos porcentuales.
Este conjunto de datos no incluye valores de reembolsos, registros a nivel de producto, información de campañas ni motivos de reembolso. Por lo tanto, no se puede confirmar los ingresos netos de junio ni explicar qué provocó el aumento repentino de reembolsos.
Esta versión conserva los hallazgos que pueden reproducirse y elimina las explicaciones que el archivo no puede ofrecer.
¿Qué cambios hubo entre la primera respuesta y la versión final?
La primera respuesta de ChartGen fue sólida en términos direccionales: identificó el mes más relevante, reconoció los dos factores que impulsaron el crecimiento de los ingresos y detectó la anomalía en los reembolsos sin que se lo solicitaran.
El segundo indicador mejoró la respuesta al exponer los cálculos y separar los hechos de las hipótesis.
La revisión humana aún modificó cuatro aspectos:
El gráfico de ingresos necesitaba una línea de base más adecuada.
El gráfico de reembolsos debía regenerarse, ya que su serie mensual no era visible.
La línea de base de la tasa de reembolso necesitaba una etiqueta correcta.
La estimación de los ingresos netos y las explicaciones causales debían permanecer fuera de los hallazgos verificados.
Esa es una forma práctica de usar un Generador de gráficos con IA. Deja que realice el primer procesamiento rápido, luego revisa las partes que requieren contexto o criterio.
Un proceso de revisión breve para los conocimientos generados por IA a partir de gráficos
Comprueba primero que el gráfico contenga los campos, fechas, unidades y agregación correctos. Vuelve a calcular el cambio del titular a partir del archivo de origen, en lugar de hacerlo a partir de la etiqueta del gráfico.
A continuación, inspecciona la propia visualización. Comprueba la línea de base de los ejes, confirma que todas las series prometidas sean visibles y ten precaución cuando dos métricas utilicen escalas diferentes.
A continuación, separa tres tipos de enunciados:
Valores copiados directamente de los datos
Resultados calculados a partir de dichos valores
Explicaciones que requieren información externa al archivo
Por último, formula una segunda pregunta diseñada para cuestionar la primera respuesta. Solicita las fórmulas, las métricas contradictorias, los supuestos y las pruebas faltantes. La segunda respuesta también debe ser revisada; una respuesta más detallada puede introducir nuevos supuestos junto con comprobaciones útiles.
El resultado es fiable, pero solo con la verificación adecuada
Esta prueba llegó a una conclusión clara. ChartGen identificó el patrón principal, pero su resultado no estaba listo para publicarse sin una revisión previa.
Las cifras de ingresos, los cálculos de mayo a junio y el pico de reembolsos coincidieron con los datos de origen. Los ingresos netos estimados y las causas propuestas no contaban con pruebas suficientes.
El análisis de gráficos por IA es útil para una primera revisión rápida, pero no como prueba definitiva. Verifique los valores, cálculos, diseño del gráfico y afirmaciones causales antes de utilizar el resultado en un informe.
Prueba ChartGen con tu archivo CSV o Excel, y luego usa un segundo mensaje de instrucción para verificar el resultado antes de publicarlo.

