Relación multivariante cualitativa. TIPOS Y CRITERIOS DE ELECCIÓN. CREACIÓN DE TABLAS DE CONTINGENCIA: CASO PRÁCTICO. Francisco Javier Cervigon Ruckauer

Relación multivariante cualitativa

RELACIÓN MULTIVARIANTE CUALITATIVA: TIPOS Y CRITERIOS DE ELECCIÓN


























CREACIÓN DE TABLAS DE CONTINGENCIA: CASO PRÁCTICO

La siguiente figura muestra una pequeña base de datos de marcas de cosmética de compañías relevantes del mercado:
Figura 9. Base de datos marcas de cosmética.
Se puede elaborar la tabla de contingencia según el número de pedidos entre las distintas compañías y la categoría del producto:
CométicaDermatologíaInfantilLimpiezaNutriciónPerfume
JOHNSON & JOHNSON2.85217.53314.2705.133
NESTLE76.029
PROCTER & GAMBLE28.200
Total general2.85217.53314.27028.20076.0295.133
Se puede elaborar la tabla de contingencia según el número de pedidos entre la categoría del producto y la región de fabricación:
ASIAEEUUUETotal general
Cosmética2.8522.852
Dermatología17.53317.533
Infantil14.27014.270
Limpieza14.31113.88928.200
Nutrición13.10062.92976.029
Perfume5.1335.133
Total general14.31126.989102.717144.017
Se puede elaborar la tabla de contingencia según el número de pedidos entre la empresa y la región de fabricación:
ASIAEEUUUETotal general
JOHNSON & JOHNSON39.78839.788
NESTLE13.10062.92976.029
PROCTER & GAMBLE14.31113.88928.200
Total general14.31126.989102.717144.017
Francisco Javier Cervigon Ruckauer

Análisis multivariante de datos ANÁLISIS MULTIVARIANTE DE DATOS: MÉTODOS DE CLASIFICACIÓN Y REDUCCIÓN DE DATOS. Francisco Javier Cervigon Ruckauer

Análisis multivariante de datos

ANÁLISIS MULTIVARIANTE DE DATOS: MÉTODOS DE CLASIFICACIÓN Y REDUCCIÓN DE DATOS


























CLASIFICACIÓN DE DATOS: CASO PRÁCTICO

La aplicación de clasificación de datos es muy versátil. A continuación se muestran ejemplos de aplicación de los métodos de clasificación.
Análisis de redes sociales
El ser humano es esencialmente un ser social que se relaciona por grupos: familiares, laborales, sentimentales, etc., como consecuencia de un largo proceso en la vida de cada persona. Desde el punto de vista de la sociedad, este proceso se desarrolla a partir de la participación activa de las personas en una red de relaciones sociales. En dicha red, los individuos están interconectados, interactúan y pueden tener más de un tipo de relación entre ellos.
La siguiente red se construye entre los personajes de la novela de Víctor Hugo Les Miserables. Dos personajes están conectados si ellos aparecen en la misma escena. El peso de dicha conexión es el número de apariciones comunes. Dada esta red de personajes, uno de los problemas más estudiados es conocer los grupos/comunidades de esta red (entendiendo por comunidad o grupo como un conjunto de personajes altamente conectados entre ellos y pocos conectados con los demás). Otros problemas interesantes dentro del análisis de redes sociales es detectar líderes, por ejemplo, a partir de diferentes medidas de centralidad.
Figura 15. Detección de comunidades en la relación a los personajes de Los Miserables.
Figura 16. Detección de líderes en la relación a los personajes de Los Miserables.
Clasificación de individuos
Se grupa a los individuos en grupos homogéneos en función de las características que se han medido. Por ejemplo, se pueden clasificar 9 comunidades autónomas según el número de parados en agricultura, industria, construcción, servicios y los que se encuentran buscando empleo.

Figura 17. Clasificación de individuos.

REDUCCIÓN DE DATOS: CASO PRÁCTICO

Análisis factorial
En un estudio sobre el nivel de gastos e ingresos de una familia y el nivel de educación de los miembros de la misma, se han medido las siguientes variables en una muestra de 18 individuos: gasto medio mensual del individuo, ingresos medios mensuales del individuo, número de hijos del individuo, edad del individuo, número de años de escolarización del individuo, número de años de escolarización del padre del individuo y número de años de escolarización de la madre del individuo.
Si se seleccionan dos componentes para reducir el número de variables del estudio, se observa que:
Componente
12
Gasto mensual0,870,45
Ingresos medios mensuales0,7150,594
Número de hijos-0,189-0,86
VariableEdad0,809-0,119
Número de años de escolarización-0,5480,729
Número de años de escolarización del padre-0,8130,477
Número de años de escolarización de la madre-0,5840,166
En la matriz de componentes las variables hijos y edad quedan representadas en una única componente. Pero las variables restantes, al tener puntuaciones parecidas en ambos componentes, no se podrían clasificarlas correctamente.
Análisis de correspondencia
En un estudio sobre 100 madres de recién nacidos en el que se analiza la clase social (alta, media, baja) y el control médico del embarazo (excelente, bueno, malo, nulo), ¿son independientes estas variables o tienen alguna relación?
En la tabla de contingencia se observa una mayor concentración de buenos controles médicos en embarazos de mujeres en clases sociales medias con respecto de las clases sociales baja y alta; un mal control médico concentrado en clases sociales medias y bajas; y un control médico excelente en clases sociales medias y altas.
Control del embarazo
ExcelenteBuenoMaloNulo
Alta8500
Clase socialMedia1226130
Baja09216
El diagrama conjunto de puntos de categoría muestra la proximidad de la clase social alta con un control excelente del embarazo. El medio rural urbano asociado a un mal control del embarazo y una clase social baja, etc.

Figura 18. Análisis de correspondencia. Caso práctico.
Francisco Javier Cervigon Ruckauer

3. Técnicas Econométricas (Modelización y Predicción) Guía de aprendizaje. Francisco Javier Cervigon Ruckauer

3. Técnicas Econométricas (Modelización y Predicción)

Guía de aprendizaje

INTRODUCCIÓN

Este tema está diseñado para que aprendas a interpretar la información estadística sobre las relaciones entre variables. En este apartado, se trata de contextualizar el análisis de datos y la estadística dentro del desarrollo de una investigación.
La herramienta básica que usarás es un modelo econométrico que conjuga los esquemas teóricos sobre el funcionamiento de dichas relaciones con las técnicas estadísticas de análisis de datos. Los modelos son estructuras muy complejas, pero mediante las explicaciones comprenderás el modelo de regresión simple y múltiple.
Por otra parte, este tema tiene un carácter aplicado, por lo que los ejemplos prácticos servirán para introducir los conceptos estadístico-econométricos. Así, una parte importante se dedica a analizar casos prácticos, en los que aprenderás a manejar un software econométrico y a interpretar adecuadamente los resultados obtenidos. El paquete econométrico a utilizar es Gretl, un software de libre uso, fácil de manejar y que tiene acceso a las bases de datos que se estudian en muchos libros de introducción al análisis econométrico.
Finalmente, tendrás instrumental avanzado para trabajar en un marco de variables medidas como series temporales. El tema se basa en el análisis de las propiedades temporales de las variables como paso previo para la modelización de series temporales mediante la metodología Box-Jenkins.

OBJETIVOS

Que conozcas las relaciones lineales entre variables aleatorias que derivan en el modelo de regresión simple y múltiple para su aplicación a las situaciones más habituales. Y que aprendas la herramienta GRETL para que seas capaz de interpretar de forma rigurosa los resultados de su aplicación.
Que analices las principales herramientas para el tratamiento de series temporales para la realización de predicciones. Que te familiarices con el análisis estocástico de series temporales, estudiando sus fundamentos teóricos y algunas de sus principales aplicaciones en diferentes ámbitos. Y que tenga la capacidad de manejar las herramientas necesarias para interpretar y entender los datos de series temporales.

Competencias

Adquirirás las siguientes competencias:
Conocer y aplicar los conceptos de modelos de regresión lineal simple y múltiple.
Conocer las propiedades de las series temporales y realizar actividades dirigidas a la aplicabilidad de los conocimientos teóricos, metodológicos y de técnicas adquiridas a lo largo de la formación.
La capacidad de utilizar herramientas informáticas en empresa.

Resultados de aprendizaje

Ser capaz de realizar pruebas sobre la especificación del modelo econométrico para contrastar su validez y, en caso necesario, abordar la reformulación del mismo.
Saber usar los resultados de un modelo econométrico con fines analíticos, predictivos o de evaluación de diversas situaciones dependiendo del sector.
Ser capaz de realizar pruebas sobre la especificación del modelo econométrico para contrastar su validez y, en caso necesario, abordar la reformulación del mismo.

CONTENIDOS

A continuación enunciamos los diferentes apartados que estudiarás en este tema:

3.1. GRETL, la econometría, modelo de regresión lineal simple.

  • Introducción.
  • Relación entre dos variables.
  • Modelo de regresión lineal simple (modelo, estimación, contrastes, validación).

3.2. Modelo de regresión lineal múltiple.

  • Introducción.
  • Modelo de regresión lineal múltiple (modelo, estimación, contrastes, validación).

3.3. Series Temporales.

  • Introducción. Concepto de serie temporal.
  • Características comunes de las series temporales.
  • Objetivos del análisis de series temporales.
  • Modelos deterministas de series temporales.
  • Otra aproximación.

METODOLOGÍA Y RECURSOS

3.1. GRETL, la econometría, modelo de regresión lineal simple.

Los contenidos de este apartado se llevarán a cabo mediante clases expositivas en las que se revisarán los aspectos conceptuales y teóricos del modelo de regresión simple. A continuación, se realizará un ejercicio práctico de tipo test para aplicar los contenidos teóricos. Se expondrá el software econométrico GRETL, con el que se resolverá un caso práctico interpretando adecuadamente los resultados obtenidos. Finalmente, se hará una evaluación de los conocimientos mediante preguntas de un único resultado correcto.

3.2. Modelo de regresión lineal múltiple.

Los contenidos de este apartado se llevarán a cabo mediante clases expositivas en las que se revisarán los aspectos conceptuales y teóricos del modelo de regresión múltiple. A continuación, se realizará un ejercicio práctico de tipo test para aplicar los contenidos teóricos. Se expondrá el software econométrico GRETL, con el que se resolverá un caso práctico interpretando adecuadamente los resultados obtenidos. Finalmente, se hará una evaluación de los conocimientos mediante preguntas de un único resultado correcto.

3.3. Series Temporales.

Los contenidos de este apartado se llevarán a cabo mediante clases expositivas en las que se revisarán los aspectos conceptuales y teóricos de una serie temporal. A continuación, se realizará un ejercicio práctico de tipo test para aplicar los contenidos teóricos. Se expondrá el software econométrico GRETL, con el que se resolverá un caso práctico interpretando adecuadamente los resultados obtenidos. Finalmente, se hará una evaluación de los conocimientos mediante preguntas de un único resultado correcto.
Francisco Javier Cervigon Ruckauer

GRETL, la Econometría, Modelo de Regresión Lineal Simple. 3.1.3. CASO PRÁCTICO: ANÁLISIS MODELO REGRESIÓN LINEAL SIMPLE. Francisco Javier Cervigon Ruckauer

GRETL, la Econometría, Modelo de Regresión Lineal Simple

LA ECONOMETRÍA: MODELO DE REGRESIÓN LINEAL SIMPLE


























3.1.3. CASO PRÁCTICO: ANÁLISIS MODELO REGRESIÓN LINEAL SIMPLE


























Francisco Javier Cervigon Ruckauer

Modelo de Regresión Lineal Múltiple Francisco Javier Cervigon Ruckauer

Modelo de Regresión Lineal Múltiple

MODELO DE REGRESIÓN LINEAL MÚLTIPLE


























CASO PRÁCTICO: ANÁLISIS MODELO REGRESIÓN LINEAL MÚLTIPLE


























Francisco Javier Cervigon Ruckauer

Series temporales. TÉCNICAS DE PREDICCIÓN ECONÓMICA. SERIES TEMPORALES. CASO PRÁCTICO. Francisco Javier Cervigon Ruckauer

Series temporales

TÉCNICAS DE PREDICCIÓN ECONÓMICA


























SERIES TEMPORALES. CASO PRÁCTICO


























Francisco Javier Cervigon Ruckauer

4. Big Data: Conceptos, Métodos y Tecnologías. Objetivos Francisco Javier Cervigon Ruckauer

4. Big Data: Conceptos, Métodos y Tecnologías

Objetivos

El principal objetivo de este módulo es ofrecer una visión introductoria al análisis de conjuntos de datos masivos y complejos, conocidos hoy día como big data. En particular, se presentarán los conceptos básicos relacionados con el análisis de big data, los métodos computacionales y estadísticos más importantes para llevar a cabo este análisis y las tecnologías más relevantes en este ámbito. En este contexto, se hará especial hincapié en la familia de tecnologías open source más popular para el análisis de big data: el ecosistema Apache Hadoop.
Al concluir el tema, habrás adquirido los siguientes conocimientos y competencias:
  • Conocer los principales factores que definen el big data, así como su importancia hoy día en múltiples sectores de actividad.
  • Conocer los diferentes actores y perfiles de trabajo involucrados en proyectos de análisis de big data, así como el ciclo de desarrollo habitual en estos proyectos.
  • Comprender las diferencias entre datos estructurados, semi-estructurados y no estructurados, así como su papel dentro del análisis de big data.
  • Comprender las diferencias entre el procesado de datos por lotes (batch) y el procesado de flujos de datos (streaming).
  • Conocer y comprender las principales arquitecturas, tecnologías y métodos de análisis empleados para trabajar con big data, especialmente el ecosistema Apache Hadoop.
  • Comprender las diferencias entre el análisis de big data en un entorno tipo laboratorio (prototipos y pruebas) frente al despliegue de soluciones basadas en big data en un entorno en producción.

Contenidos

Los contenidos de este tema son:

1. Conceptos básicos para análisis de big data.

  • 1.1 Introducción al procesado y análisis de big data.
  • 1.2 Ejemplo de análisis de datos con Apache Spark.
  • 1.3 Clasificación de tipos de datos.
  • 1.4 Ciclo de desarrollo de proyectos de big data.

2. Arquitecturas de Análisis de big data.

  • 2.1 Estrategias de procesado de datos.
  • 2.2 Test sobre estrategias de procesado de datos.
  • 2.3 Arquitecturas híbridas para big data.
  • 2.4 Laboratorio de análisis vs. análisis en producción.

3. Tecnologías y herramientas para Análisis de big data.

  • 3.1 Entrevista sobre tecnologías de big data.
  • 3.2 Test sobre tecnologías de big data.
  • 3.4 El ecosistema Apache Hadoop.
  • 3.4 Introducción a bases de datos NoSQL.

Metodología y recursos

Para el desarrollo de este módulo, se va a utilizar una metodología que combina la presentación dinámica de conceptos teóricos y metodológicos junto con ejemplos que ilustran el análisis de big data. Se conmiarán diversos tipos de materiales:
  • Videoclases para presentar de forma detallada los conceptos, métodos, técnicas y herramientas más importantes en análisis de big data.
  • Presentaciones multimedia para focalizar el proceso de aprendizaje sobre herramientas o conceptos de especial relevancia.
  • Pruebas de test a lo largo de todo el tema, para reforzar la asimilación de ideas y conceptos básicos, permitiendo además la autoevaluación y la asimilación de los contenidos.
  • Entrevistas con invitados del sector empresarial para conocer de primera mano cómo se desarrollan los proyectos de análisis de big data en entornos reales.
Todas las herramientas tecnológicas mencionadas en el tema son software libre y se pueden descargar sin coste siguiendo los enlaces que se indicarán en los apartados correspondientes.
Francisco Javier Cervigon Ruckauer