Solo por tiempo limitado: +15% extra con las Becas DKS CONECTA ¡Solicita tu beca!

Ver temas

Última actualización: 15 · 11 · 2016

¿Hasta dónde se puede llegar en el Data Science sin estadística?

The Signal and the Noise; Why So Many Predictions Fail but Some Don’t es un influyente libro de Nate Silver, que alcanzó la fama por sus predicciones de las elecciones presidenciales de EE.UU. Los datos no son otra cosa: una combinación de señal y de ruido, de categoría y de anécdota, de grano y paja. […]

The Signal and the Noise; Why So Many Predictions Fail but Some Don’t es un influyente libro de Nate Silver, que alcanzó la fama por sus predicciones de las elecciones presidenciales de EE.UU. Los datos no son otra cosa: una combinación de señal y de ruido, de categoría y de anécdota, de grano y paja.

La tarea del científico de datos ahora, igual que la del estadístico desde hace más de un siglo, consiste en separar la una del otro, extraer los patrones repetibles y repetidos sin dejarse engañar por los aleatorios. La estadística, la ciencia de datos, se reducen a eso. Cuando no lo consiga, sus predicciones fallarán.

Ciencia de datos es lo que hace un estadístico que programa, que sabe enfrentarse solventemente los conjuntos de datos a los que nos tiene acostumbrados el siglo XXI. O lo que hace un programador que aprendió la estadística necesaria para ver el bosque y no solo los árboles.

Hace unos pocos días, tenía un conversación por correo electrónico con un un científico de datos, exalumno del Máster de Data Science de DKS, que quería profundizar en los detalles de un algoritmo muy usado en márketing analítico: el del multi armed bandit. Es el algoritmo que, precisamente, subyace a uno de los productos de Google Analytics. Por supuesto que está soportado por la increíble infraestructura de datos de Google. Pero utiliza ideas que se conocen y usan en el mundo de la estadística desde hace dos siglos: la estadística bayesiana.

Las herramientas de Google para medir el impacto causal de, por ejemplo, campañas publicitarias, también está basado en un desarrollo de la misma teoría. ¿Hace falta conocerla para usar esas herramientas? No. Pero sí para adaptarlas a un contexto similar pero no exactamente igual. Aunque, por supuesto, también necesitaremos saber programarlas.

¿Hasta dónde se puede llegar sin estadística en la ciencia de datos? Desgraciadamente, no muy lejos. Los recetarios de técnicas de machine learning incluyen muchos programas y trucos que permiten, incluso, llegar a obtener algún éxito parcial en plataformas como Kaggle. Pero un paseo por sus foros, una discusión con algunos de quienes participan en ellas, revela que muchos se limitan a dar tumbos sin criterio, sin una idea clara de qué quieren conseguir y, muy particularmente, cómo. Revela crueldad, pero cuando pienso en ellos siempre me vienen a la cabeza estas dos palabras: script kiddie.

La teoría, la estadística en este caso, no es nunca un corsé que aprieta sino una guía que orienta. Las herramientas de ciencia de datos, muchas y poderosas, que uno puede encontrar implementadas en Python, R o Spark son genéricas. Valen para todo pero, en el fondo, para nada. Cuando las enseño en DKS, lo reconozco aquí, me cuesta encontrar conjuntos de datos de ejemplo en los que poder aplicarlas tal cual, sin ningún tipo de adaptación específica al caso concreto. Pero después, en la vida real, el valor reside en la capacidad de lidiar con esos impedimentos concretos y específicos del problema en cuestión. Es, como abría el párrafo, la teoría la que orienta.

modulos_previos_datascience_17

El programa del máster de Data Science de DKS dedica algunas sesiones a profundizar en en la estadística. Son, por necesidad, pocas. Pero están pensadas (como, de hecho, gran parte del programa) como una base sobre la que construir y ahondar. Ponen al científico de datos en el camino del proceso de aprendizaje constante.

Si no tienes esta base, desde la propia escuela, se ha preparado un programa previo de estadística para que el alumno pueda aprender toda la base necesaria para poder seguir el ritmo del Máster y aprovecharlo al máximo.

Hoy mismo he visto que el exalumno al que me refería más arriba publicaba en su Twitter una foto de su nueva adquisición: un libro de estadística bayesiana para hackers. Seguro que lo hace mejor programador, mejor estadístico y, necesariamente, mejor científico de datos.

Carlos Gil Bellosta

El artículo ¿Hasta dónde se puede llegar en el Data Science sin estadística? fue escrito el 15 de November de 2016 y guardado bajo la categoría Data Science. Puedes encontrar el post en el que hablamos sobre .

Descrubre nuestros cursos

15 · 04 · 2026

Data Lake: Qué es, Arquitectura y Clave para el Big Data

Las empresas en la actualidad gestionan un gran volumen de datos, lo que hace imprescindible poder comprender cómo lo hacen. Te contamos por qué el Data Lake es un tecnología imprescindible cuando hablamos de estrategia de análisis y cómo se ha convertido en fundamental en la actualidad. Definiendo el data lake: más allá del almacenamiento […]

14 · 04 · 2026

Web Scraping: guía definitiva de extracción de datos web

A la hora de analizar datos es fundamental conocer una serie de técnicas y sobre todo, entender cómo se recopilan los datos en Internet. Te contamos qué es el Web Scraping y por qué motivo esta técnica se ha convertido en una habilidad imprescindible para los analistas de datos. ¿Qué es el web scraping y […]

13 · 04 · 2026

El consultor Business Intelligence: Tu guía completa para una carrera estratégica

Transformar información dispersa en conocimiento y tomar decisiones basadas en datos es fundamental en el contexto empresarial. Para ello, es imprescindible que los gatos que las organizaciones generan cada día de forma masiva, se puedan comprender y servir como base de conocimiento para la toma de decisiones. En este punto es necesaria la intervención del […]

Deep reinforcement learning

13 · 03 · 2026

Deep Reinforcement Learning: La Revolución de la Inteligencia Artificial Autónoma

A través de la Inteligencia Artificial, es posible crear sistemas que sean capaces de aprender a tomar decisiones de forma autónoma, tengan estas la complejidad que tengan. Esto es posible gracias al Deep reinforcement learning. Te contamos cuáles son sus fundamentos, qué algoritmos son fundamentales, qué herramientas son las más usadas y cuáles son sus […]