Archivo para la categoría ‘Modelos’

Da comienzo la lectura de “The Elements of Statistical Learning”

Martes, Enero 10th, 2012

Interesante iniciativa de Juanjo Gibaja y Carlos Gil Bellosta consistente en leer el libro “The Elements of Statistical Learning”. La idea es crear un grupo de trabajo que lea de forma coordinada el libro, pero además van a implementar en R los ejercicios y ejemplos. Desde esta bitácora no vamos ...

El sobremuestreo ¿mejora mi estimación?

Domingo, Noviembre 6th, 2011

El sobremuestreo (oversampling) es una técnica de muestreo que se emplea habitualmente cuando tenemos una baja proporción de casos positivos en clasificaciones binomiales. Los modelos pueden “despreciar” los casos positivos por ser muy pocos y nuestro modelo no funcionaría. Para incrementar el número de casos positivos se emplea el sobremuestreo. ...

Árboles de decisión con SAS Base (con R por supuesto)

Martes, Julio 12th, 2011

Con SAS Base podemos hacer árboles de decisión porque tenemos R. Así de sencillo. Vamos a utilizar SAS para gestionar nuestros datos y R será la herramienta que utilicemos para la realización del modelo de árbol de decisión. Posteriormente emplearemos las reglas generadas por el modelo para etiquetar a nuestros ...

Trucos R. Llevar a SAS las reglas de un árbol de decisión

Viernes, Junio 10th, 2011

Vuelvo hoy con el uso de rpart para la creación de árboles de decisión con R. Pero hoy, además de realizar un modelo de árbol con R quiero presentaros una función que nos permite guardar las reglas generadas con nuestro modelo en un fichero de texto para su posterior utilización ...

COMIENZA LA CUENTA ATRAS. III JORNADAS DE USUARIOS DE R

Lunes, Abril 4th, 2011

Por fin están en marcha las III Jornadas de Usuarios de R de España. En este enlace tenéis toda la información disponible. Para esta tercera edición hay que destacar: Serán en Madrid en la Escuela de Organización Industrial Habrá talleres,  bajo mi punto de vista uno de los mayores aciertos Podéis participar, R ...

Muchas variables no implican una mejor predicción

Domingo, Enero 30th, 2011

Me sigo durmiendo con el genio Juan Antonio Cebrián y sus pasajes de la historia, monográficos zona cero o tertulias 4 C. Sus programas de radio me acompañan desde hace muchos años. Estudiando, vigilando instalaciones del ejercito o en el turno de noche de una fábrica Cebrián y su gente ...

Trucos Excel. Área bajo la curva ROC

Jueves, Enero 13th, 2011

  ¿Curva ROC y Excel? ¡Si no tiene nada que ver! No del todo.  En ocasiones tenemos que pintar las curvas ROC y empleamos las herramientas específicas para ello, sin embargo es habitual que nuestros resultados sean presentados en Excel (demasiado habitual). En ese caso creamos nuestros datos para llevarlos a ...

Medir la importancia de las variables con Random Forest

Sábado, Enero 8th, 2011

¿Qué variables son las más importantes para nuestro modelo de clasificación? Yo creo que muchos de vosotros os habréis encontrado con esta problemática. Hay muchas formas de solventarla, habitualmente empleamos aquellas variables que mejor pueden entender nuestras áreas de negocio. Es decir, hacemos segmentaciones en base al sexo y la ...

El modelo multivariante en el sector asegurador. Los modelos por coberturas (V)

Lunes, Diciembre 27th, 2010

Debido a la pobre aceptación había dado de lado esta serie de monográficos sobre la tarifa multivariante en el sector asegurador. Pero tengo una lectora que si los seguía y como yo me debo a mis lectores continúo con la serie. Recapitulemos. Como variables dependientes tenemos la frecuencia siniestral ...

Entrenamiento, validación y test

Miércoles, Julio 28th, 2010

Cuando realizamos modelos hay 3 conjuntos de datos fundamentales: Conjunto de datos de entrenamiento: son los datos que entrenan los modelos Conjunto de datos de validación: selecciona el mejor de los modelos entrenados Conjunto de datos de test: Nos ofrece el error real cometido con el modelo seleccionado Para entender mejor su importancia y ...