Estadística: comprender los datos para tomar mejores decisiones
Introducción
La estadística es la disciplina que se ocupa de recopilar, ordenar, representar, analizar e interpretar datos. Su finalidad es transformar observaciones aisladas en información útil para describir una realidad, identificar patrones, evaluar riesgos y respaldar decisiones.
Su importancia radica en que permite estudiar fenómenos caracterizados por la variabilidad y la incertidumbre. No todas las personas, empresas, productos o períodos presentan el mismo comportamiento; por ello, la estadística proporciona métodos para resumir esas diferencias y obtener conclusiones razonables a partir de la información disponible.
Actualmente, la estadística es fundamental en áreas como la economía, contabilidad, auditoría, administración, medicina, ingeniería, ciencias sociales, investigación científica, informática y políticas públicas. En una empresa puede emplearse para analizar ventas, proyectar ingresos, controlar costos, detectar operaciones inusuales, evaluar proveedores y medir el cumplimiento de los presupuestos.
Contenido
1. Conceptos fundamentales
Población
La población corresponde al conjunto completo de personas, empresas, documentos, operaciones u objetos que se desea estudiar.
Ejemplos:
- Todas las facturas emitidas por una empresa durante un año.
- Todos los trabajadores de una organización.
- Todos los clientes de una institución financiera.
- Todos los productos fabricados durante un mes.
Muestra
La muestra es una parte de la población seleccionada para realizar el análisis.
Por ejemplo, si una empresa emitió 10.000 facturas durante el año y se revisan 500, esas 500 facturas constituyen la muestra.
Una muestra debe ser suficientemente representativa para que las conclusiones obtenidas puedan aplicarse razonablemente a la población.
Unidad estadística
Es cada elemento individual que forma parte de la población o muestra.
En una revisión de facturas, cada factura es una unidad estadística. En una encuesta laboral, cada trabajador encuestado constituye una unidad estadística.
Dato
Es el valor observado o registrado respecto de una unidad estadística.
Ejemplos:
- Monto de una factura.
- Edad de un trabajador.
- Número de productos vendidos.
- Días de atraso de un cliente.
- Resultado de una encuesta.
Variable
Es la característica que se desea observar, medir o analizar.
Por ejemplo, al estudiar a los trabajadores de una empresa pueden utilizarse variables como edad, remuneración, antigüedad, cargo o número de días ausentes.
2. Tipos de variables
Variables cualitativas
Representan características o categorías que no se expresan originalmente mediante cantidades.
Cualitativas nominales: no poseen un orden determinado.
Ejemplos:
- Tipo de contrato.
- Comuna de residencia.
- Medio de pago.
- Actividad económica.
Cualitativas ordinales: poseen un orden o jerarquía.
Ejemplos:
- Nivel de satisfacción: bajo, medio o alto.
- Riesgo: bajo, moderado o elevado.
- Prioridad de pago: urgente, normal o postergable.
Variables cuantitativas
Se expresan mediante números.
Cuantitativas discretas: toman valores enteros y generalmente proceden de un conteo.
Ejemplos:
- Número de trabajadores.
- Cantidad de facturas.
- Número de reclamos.
- Cantidad de productos vendidos.
Cuantitativas continuas: pueden tomar distintos valores dentro de un intervalo y generalmente proceden de una medición.
Ejemplos:
- Peso de un producto.
- Tiempo de fabricación.
- Temperatura.
- Monto de una venta.
- Porcentaje de rentabilidad.
3. Estadística descriptiva
La estadística descriptiva comprende los métodos utilizados para organizar, resumir y presentar un conjunto de datos mediante tablas, gráficos y medidas numéricas.
Su propósito es describir lo que ocurrió dentro de los datos estudiados, sin extender necesariamente las conclusiones a una población más amplia.
Entre sus principales herramientas se encuentran:
- Tablas de frecuencia.
- Gráficos estadísticos.
- Medidas de tendencia central.
- Medidas de dispersión.
- Medidas de posición.
- Análisis de la forma de una distribución.
4. Tablas de frecuencia
Una tabla de frecuencia organiza los datos según la cantidad de veces que aparece cada valor o categoría.
Frecuencia absoluta
Indica el número de veces que se presenta un valor.
Frecuencia relativa
Representa la proporción que corresponde a cada valor respecto del total.
[f_r=\frac{f_i}{n}]
Donde:
- (f_i) es la frecuencia absoluta.
- (n) es el número total de observaciones.
Frecuencia porcentual
Se obtiene multiplicando la frecuencia relativa por 100:
[f_{%}=f_r\times100]
Frecuencia acumulada
Representa la suma progresiva de las frecuencias hasta un valor determinado.
5. Representación gráfica
Los gráficos permiten presentar los datos de manera visual y facilitar la identificación de tendencias, diferencias y comportamientos inusuales.
Gráfico de barras
Se utiliza principalmente para variables cualitativas o cuantitativas discretas.
Ejemplo: cantidad de ventas por vendedor.
Gráfico circular
Representa la participación porcentual de cada categoría respecto del total.
Ejemplo: distribución de gastos entre remuneraciones, proveedores, arriendos y servicios.
Histograma
Representa la distribución de una variable cuantitativa continua agrupada en intervalos.
Ejemplo: distribución de los montos de las facturas emitidas.
Gráfico de líneas
Permite observar la evolución de una variable a través del tiempo.
Ejemplo: ventas mensuales durante un año.
Diagrama de dispersión
Representa la relación entre dos variables cuantitativas.
Ejemplo: relación entre gastos en publicidad y ventas mensuales.
Diagrama de caja
Resume la distribución de los datos mediante la mediana, los cuartiles y los posibles valores atípicos.
6. Medidas de tendencia central
Las medidas de tendencia central indican el valor alrededor del cual se concentra un conjunto de datos.
Media aritmética
La media, conocida también como promedio, se obtiene sumando todos los valores y dividiendo el resultado por la cantidad de observaciones:
[\bar{x}=\frac{\sum x_i}{n}]
La media utiliza todos los valores del conjunto, pero puede ser afectada considerablemente por cifras extremadamente altas o bajas.
Mediana
La mediana es el valor que ocupa la posición central después de ordenar los datos de menor a mayor.
Cuando existe un número par de observaciones, se calcula el promedio de los dos valores centrales.
La mediana suele ser más representativa que la media cuando existen valores atípicos.
Moda
La moda corresponde al valor o categoría que se repite con mayor frecuencia.
Un conjunto puede ser:
- Unimodal: posee una moda.
- Bimodal: posee dos modas.
- Multimodal: posee varias modas.
- Amodal: ningún valor se repite.
7. Medidas de dispersión
Las medidas de dispersión indican cuánto se separan o varían los datos respecto de un valor central.
Rango
Es la diferencia entre el valor máximo y el valor mínimo:
[R=x_{\max}-x_{\min}]
Es fácil de calcular, pero solo considera los dos valores extremos.
Varianza poblacional
Mide el promedio de las diferencias al cuadrado entre cada observación y la media poblacional:
[\sigma^2=\frac{\sum(x_i-\mu)^2}{N}]
Varianza muestral
Cuando se trabaja con una muestra se utiliza:
[s^2=\frac{\sum(x_i-\bar{x})^2}{n-1}]
Desviación estándar
Es la raíz cuadrada de la varianza:
[\sigma=\sqrt{\sigma^2}]
Indica, en las mismas unidades de la variable, cuánto se alejan normalmente los valores respecto de la media.
Una desviación estándar pequeña representa datos relativamente concentrados. Una desviación estándar elevada indica mayor variabilidad.
Coeficiente de variación
Permite comparar la dispersión de conjuntos con diferentes escalas o medias:
[CV=\frac{s}{\bar{x}}\times100]
8. Medidas de posición
Las medidas de posición permiten determinar la ubicación relativa de un dato dentro de una distribución.
Cuartiles
Dividen los datos ordenados en cuatro partes:
- (Q_1): deja aproximadamente al 25% de los datos por debajo.
- (Q_2): corresponde a la mediana.
- (Q_3): deja aproximadamente al 75% de los datos por debajo.
Deciles
Dividen la distribución en diez partes iguales.
Percentiles
Dividen la distribución en cien partes.
Por ejemplo, estar en el percentil 90 significa que el valor observado es igual o superior al de aproximadamente el 90% de las observaciones.
9. Valores atípicos
Un valor atípico es una observación considerablemente diferente de las demás.
Puede originarse por:
- Error de digitación.
- Error de medición.
- Operación excepcional.
- Fraude o irregularidad.
- Comportamiento legítimo, pero poco frecuente.
En auditoría, los valores atípicos no deben eliminarse automáticamente. Primero deben investigarse para determinar su origen y efecto sobre el análisis.
10. Estadística inferencial
La estadística inferencial permite utilizar los resultados obtenidos en una muestra para formular conclusiones o estimaciones acerca de una población.
Entre sus principales herramientas se encuentran:
- Estimación de parámetros.
- Intervalos de confianza.
- Pruebas de hipótesis.
- Análisis de regresión.
- Análisis de varianza.
- Métodos de muestreo.
A diferencia de la estadística descriptiva, la inferencia reconoce expresamente que las conclusiones están sujetas a un determinado nivel de incertidumbre.
11. Parámetros y estadísticos
Un parámetro es una medida numérica que describe una población.
Ejemplos:
- Media poblacional (\mu).
- Proporción poblacional (p).
- Desviación estándar poblacional (\sigma).
Un estadístico es una medida calculada a partir de una muestra.
Ejemplos:
- Media muestral (\bar{x}).
- Proporción muestral (\hat{p}).
- Desviación estándar muestral (s).
Los estadísticos se utilizan para estimar los parámetros desconocidos de una población.
12. Métodos de muestreo
Muestreo aleatorio simple
Todos los elementos de la población tienen la misma posibilidad de ser seleccionados.
Muestreo sistemático
Se selecciona un elemento cada cierto intervalo.
Ejemplo: revisar una factura de cada veinte emitidas.
Muestreo estratificado
La población se divide en grupos homogéneos y se seleccionan observaciones de cada grupo.
Ejemplo: separar las facturas por cliente, sucursal o rango de monto.
Muestreo por conglomerados
Se seleccionan grupos completos de la población.
Ejemplo: elegir determinadas sucursales y revisar todas sus operaciones.
Muestreo por conveniencia
Se seleccionan los elementos más accesibles. Es rápido, pero puede producir resultados poco representativos.
13. Intervalos de confianza
Un intervalo de confianza entrega un rango de valores plausibles para un parámetro poblacional.
Por ejemplo, en lugar de afirmar que el promedio de días de pago de los clientes es exactamente 32 días, podría estimarse que se encuentra entre 29 y 35 días con un determinado nivel de confianza.
Los niveles más utilizados son:
- 90%.
- 95%.
- 99%.
Un mayor nivel de confianza generalmente produce un intervalo más amplio.
14. Pruebas de hipótesis
Una prueba de hipótesis permite evaluar una afirmación sobre una población a partir de información muestral.
Hipótesis nula
Representa la afirmación inicial que se somete a evaluación:
[H_0]
Hipótesis alternativa
Representa la afirmación contraria o el efecto que se busca demostrar:
[H_1]
Nivel de significancia
Es el riesgo máximo aceptado de rechazar la hipótesis nula cuando esta es verdadera. Frecuentemente se utiliza:
[\alpha=0,05]
Valor p
El valor p mide qué tan compatibles son los datos observados con la hipótesis nula.
Cuando el valor p es inferior al nivel de significancia, normalmente se rechaza la hipótesis nula. Sin embargo, un resultado estadísticamente significativo no implica necesariamente que el efecto sea importante desde el punto de vista económico o práctico.
15. Correlación
La correlación mide la dirección y la intensidad de la relación lineal entre dos variables.
El coeficiente de correlación de Pearson se representa mediante (r) y toma valores entre −1 y 1:
- (r) cercano a 1: relación positiva fuerte.
- (r) cercano a −1: relación negativa fuerte.
- (r) cercano a 0: ausencia de una relación lineal clara.
Una correlación no demuestra por sí sola que una variable sea la causa de la otra.
16. Regresión lineal
La regresión lineal permite modelar la relación entre una variable dependiente y una o más variables independientes.
La forma básica es:
[\hat{y}=a+bx]
Donde:
- (\hat{y}) es el valor estimado.
- (a) es la constante.
- (b) es la pendiente.
- (x) es la variable explicativa.
En una empresa puede utilizarse para estimar ventas según inversión publicitaria, proyectar costos de acuerdo con el nivel de producción o analizar el efecto de los días trabajados sobre las unidades fabricadas.
17. Probabilidad y distribuciones
La probabilidad mide la posibilidad de que ocurra un evento:
[P(A)=\frac{\text{casos favorables}}{\text{casos posibles}}]
La teoría de probabilidades constituye una base esencial de la inferencia estadística, porque permite cuantificar la incertidumbre asociada con las muestras y las estimaciones.
Algunas distribuciones importantes son:
- Distribución normal.
- Distribución binomial.
- Distribución de Poisson.
- Distribución t de Student.
- Distribución chi-cuadrado.
- Distribución F.
18. Aplicaciones de la estadística
La estadística puede utilizarse para:
- Analizar ventas y márgenes.
- Preparar presupuestos y proyecciones.
- Medir tiempos de cobranza.
- Evaluar la morosidad de clientes.
- Identificar gastos anormales.
- Seleccionar muestras de auditoría.
- Revisar remuneraciones y horas extraordinarias.
- Comparar proveedores.
- Controlar inventarios.
- Evaluar productividad.
- Medir satisfacción de clientes.
- Analizar accidentes laborales.
- Detectar tendencias y riesgos.
- Sustentar decisiones financieras y tributarias.
Ejemplos
Ejemplo 1: ventas mensuales
Una empresa presenta las siguientes ventas mensuales, expresadas en millones de pesos:
[10,\ 12,\ 12,\ 14,\ 17]
Media
[\bar{x}=\frac{10+12+12+14+17}{5}]
[\bar{x}=\frac{65}{5}=13]
Mediana
Los datos ya están ordenados:
[10,\ 12,\ 12,\ 14,\ 17]
El valor central es:
[12]
Moda
El valor que más se repite es:
[12]
Rango
[R=17-10=7]
Resultados:
- Venta promedio: $13 millones.
- Mediana: $12 millones.
- Moda: $12 millones.
- Rango: $7 millones.
Ejemplo 2: efecto de un valor atípico
Los días de pago de cinco clientes son:
[15,\ 16,\ 17,\ 18,\ 54]
Media
[\bar{x}=\frac{15+16+17+18+54}{5}]
[\bar{x}=\frac{120}{5}=24]
Mediana
[15,\ 16,\ 17,\ 18,\ 54]
La mediana es:
[17]
Aunque cuatro de los cinco clientes pagan entre 15 y 18 días, la media aumenta a 24 días debido al cliente que pagó a los 54 días.
Interpretación: en este caso, la mediana describe mejor el comportamiento habitual de pago.
Ejemplo 3: promedio ponderado de cobranza
Una empresa posee las siguientes facturas:
| Monto | Días de pago |
|---|---|
| $2.000.000 | 10 días |
| $3.000.000 | 20 días |
| $5.000.000 | 30 días |
El promedio ponderado se calcula considerando el monto de cada factura:
[\bar{x}_p=\frac{(2.000.000\times10)+(3.000.000\times20)+(5.000.000\times30)}{10.000.000}]
[\bar{x}_p=\frac{20.000.000+60.000.000+150.000.000}{10.000.000}]
[\bar{x}_p=23]
Resultado: el período promedio ponderado de cobranza es de 23 días.
Ejemplo 4: proporción de errores
En una muestra de 80 facturas se detectan 12 documentos con errores.
[\hat{p}=\frac{12}{80}]
[\hat{p}=0,15]
[0,15\times100=15%]
Resultado: el 15% de las facturas revisadas presenta errores.
Este resultado corresponde a la muestra. Para proyectarlo a toda la población deben evaluarse la representatividad de la muestra, su tamaño y el margen de error.
Ejemplo 5: tabla de frecuencia de clientes
Una empresa clasifica a 100 clientes según su comportamiento de pago:
| Clasificación | Clientes | Porcentaje |
| Pago oportuno | 60 | 60% |
| Atraso moderado | 25 | 25% |
| Morosidad alta | 15 | 15% |
| Total | 100 | 100% |
Interpretación: el 40% de los clientes presenta algún nivel de atraso y el 15% mantiene una morosidad elevada.
Ejemplo 6: correlación entre publicidad y ventas
Una empresa observa que, durante los meses en que aumentó la inversión publicitaria, también aumentaron las ventas.
Este comportamiento puede mostrar una correlación positiva. Sin embargo, no permite concluir automáticamente que toda la variación de las ventas fue causada por la publicidad.
También podrían influir:
- Cambios de temporada.
- Nuevos productos.
- Variaciones de precios.
- Promociones.
- Entrada o salida de competidores.
- Mayor disponibilidad de inventario.
Ejemplo 7: muestra de auditoría
Una empresa posee 5.000 comprobantes contables. El auditor selecciona aleatoriamente 250 documentos para verificar:
- Existencia del respaldo.
- Autorización.
- Registro contable.
- Fecha de contabilización.
- Correspondencia con la cuenta utilizada.
En este ejemplo:
- Población: 5.000 comprobantes.
- Muestra: 250 comprobantes.
- Unidad estadística: cada comprobante.
- Variables: monto, fecha, cuenta, autorización y existencia de respaldo.
- Objetivo: estimar el nivel de errores o incumplimientos de la población.
Referencias de libros en español
1. Estadística aplicada a los negocios y la economía
Autores: Douglas A. Lind, William G. Marchal y Samuel A. Wathen.
Editorial: McGraw-Hill.
Es especialmente recomendable para estudiantes y profesionales de administración, economía, finanzas y contabilidad. Desarrolla estadística descriptiva, probabilidad, muestreo, inferencia, regresión y análisis aplicado a decisiones empresariales. La 19.ª edición en español figura publicada en 2026.
2. Estadística para administración y economía
Autores: David R. Anderson, Dennis J. Sweeney y Thomas A. Williams.
Editorial: Cengage Learning.
Presenta los conceptos con numerosos ejercicios y casos aplicados a empresas, economía y administración. Es apropiado para avanzar desde estadística descriptiva hasta inferencia y regresión. La edición en español cuenta con distintas versiones disponibles.
3. Estadística elemental
Autor: Mario F. Triola.
Editorial: Pearson.
Es un texto introductorio orientado al aprendizaje progresivo. Incluye abundantes ejemplos, ejercicios, interpretación de resultados y aplicaciones prácticas. Existen ediciones en español y ediciones más recientes en inglés.
4. Fundamentos de estadística
Autor: Daniel Peña.
Editorial: Alianza Editorial.
Es una referencia útil para profundizar en los fundamentos conceptuales y matemáticos de la estadística. Daniel Peña también posee obras especializadas sobre regresión, diseño de experimentos y series temporales.
5. Regresión y diseño de experimentos
Autor: Daniel Peña.
Editorial: Alianza Editorial.
Recomendado para un nivel intermedio o avanzado. Estudia modelos de regresión y métodos destinados a evaluar cómo determinados factores influyen sobre una variable de interés.
References: books in English
1. OpenIntro Statistics
Authors: David Diez, Mine Çetinkaya-Rundel and Christopher Barr.
Es una excelente introducción a la estadística, con ejercicios, conjuntos de datos y materiales complementarios. El texto puede consultarse gratuitamente en formato digital a través de OpenIntro.
2. Introduction to Modern Statistics
Authors: Mine Çetinkaya-Rundel and Johanna Hardin.
Presenta un enfoque moderno basado en visualización, análisis exploratorio, regresión e inferencia mediante simulaciones. Su segunda edición está disponible gratuitamente en línea y cuenta con actividades en R.
3. Introduction to the Practice of Statistics
Authors: David S. Moore, George P. McCabe and Bruce Craig.
Publisher: Macmillan Learning.
Es un texto universitario completo, centrado en el razonamiento estadístico, la interpretación de datos y la aplicación práctica de los métodos. Su décima edición fue publicada en 2021.
4. Statistics for Business & Economics
Authors: David R. Anderson, Dennis J. Sweeney, Thomas A. Williams y otros.
Publisher: Cengage.
Está orientado específicamente a las aplicaciones estadísticas en negocios y economía. Incluye problemas empresariales, análisis de datos y herramientas de apoyo para el aprendizaje.
5. Naked Statistics: Stripping the Dread from the Data
Author: Charles Wheelan.
Publisher: W. W. Norton.
Es una obra de divulgación que explica conceptos estadísticos mediante situaciones cotidianas y un lenguaje menos técnico. Es recomendable como lectura inicial o complementaria antes de estudiar textos con mayor contenido matemático.
6. The Art of Statistics: Learning from Data
Author: David Spiegelhalter.
Publisher: Penguin.
Explica cómo obtener conocimiento a partir de los datos, interpretar evidencias y evaluar críticamente conclusiones estadísticas. Es una lectura apropiada para desarrollar criterio estadístico más allá de la aplicación mecánica de fórmulas.
Orden de lectura recomendado
Para comenzar desde un nivel básico:
- Naked Statistics.
- Estadística elemental.
- OpenIntro Statistics.
- Estadística aplicada a los negocios y la economía.
- Introduction to the Practice of Statistics.
- Regresión y diseño de experimentos.
Para un profesional del área contable, financiera o de auditoría, los textos de Lind, Marchal y Wathen y de Anderson, Sweeney y Williams son especialmente útiles, ya que presentan los métodos estadísticos mediante situaciones vinculadas con empresas, economía y toma de decisiones.
Conclusión
La estadística es una herramienta esencial para convertir datos en información útil. Mediante sus técnicas descriptivas es posible organizar y resumir lo observado, mientras que la estadística inferencial permite estimar comportamientos poblacionales y evaluar hipótesis a partir de muestras.
Su correcta aplicación facilita la toma de decisiones, el análisis de riesgos, la planificación y el control. Sin embargo, los resultados estadísticos deben interpretarse considerando la calidad de los datos, el método de muestreo, la existencia de valores atípicos y las limitaciones propias de cada análisis.
