Continuando con las idea de la publicación
"Dataminng e Informatica", cabe dar cuenta que en la era actual
existen diversos medios de análisis para distintos problemas, y casi todos los
problemas PUEDEN tener una solución a través de la minería de datos.
Trayendo conceptos como "arboles de decisión",
"redes neuronales", etc... son modelos o formas para poder obtener
una solución o respuesta ante alguna toma de decisión; Cuando una empresa tiene
una cantidad numerosa de clientes, si desea crecer necesariamente debe
enfocarse en las necesidades de sus clientes actuales, ya sea para obtener
nuevos clientes o simplemente para no perderlos, estas son las bases
principales de iniciar una "minería de datos" ante la información que
ya manejan de sus clientes, pero para poder realizar este trabajo se necesita
evaluar “como?” y en “que?” forma se desea abarcar esta información y es donde
aparecen los “algoritmos” para poder manejar aquellos datos almacenados, y
transformarlos en información que pueda ser entendible para el recurso que se
desea implementar.
En la actualidad existen muchos programas que
tienen distintas metodologías para transformar los datos en información
eficiente, solamente se nombraran algunos software más utilizados para bases de
datos y datamining, algunos de los programas mas destacados son:
·
Clementine:
software de datamining donde es posible crear una base de datos de cualquier información
que uno desee y automáticamente puede seccionar esta información para distintos
propósitos.
·
SQL
Server: software de almacenamiento nivel empresas, en que también se
puede implementar propias técnicas de datamining para poder obtener información
de estos datos.
·
WEKA:
un software de libre distribución para realizar datamining.
·
DB
Miner.
·
FD
Miner.
·
IBM
Intelligent Miner.
; estos software son los más destacables en la implementación
de datamining en CUALQUIER tipo de base de datos.
Lo que diferencia principalmente estos software,
y a lo que se desea llegar a dar a entender en esta página, son los distintos
algoritmos que realizan cada uno para poder dar un cuerpo entendible a todos
los datos almacenados.
Los algoritmos más utilizados para manejar estos
datos son:
·
Modelos predictivos.
Este tipo de modelación de los
datos sugiere que a partir de datos iniciales, los datos que se continúen analizando
tendrán cierta característica similar y talvez constante, según su procedencia
o necesidad de análisis.
·
Segmentación.
La segmentación de los datos tan
solo genera “grupos” de datos más congruentes entre si, es decir que dimensiona
los datos en grupos de tal manera que los datos de un mismo grupo tengan una mejor
relación entre si lo que puede dar a entender mejores patrones de información
entre estos mismos, de cada grupo formado.
·
Análisis de Relaciones.
Similar al modelo de segmentación,
pero este modelo sugiere que todos los datos pueden llegar a tener patrones
coincidente entre si, lo que pueden dar a relaciones más minoritarias en
general que se puedan llegar a analizar para todos los datos.
·
Análisis de Desviaciones.
Contrario al modelo de relación,
propone que los datos almacenados pueden tener patrones menos frecuentes o que
posean datos que destaquen por alguna causa en particular, y esos datos son
analizados con mayor énfasis que los datos generales.
Aplicando
algoritmos como los mencionados, se pueden crear los fundamentos para tomar futuras
decisiones, como son:
·
Redes Neuronales:
Concepto de análisis de la información
extraída para poder tomar decisiones de tal manera, que las decisiones a tomar
sean las “posibles soluciones” ante los “posibles problemas” que pueden llegar
a emerger dado los datos recolectados. Esta metodología tiende a utilizar estadísticas
más descriptivas de los datos, por este motivo son menos precisos, pero a la
vez más eficaz ante datos menos congruentes entre sí. Ej. Medir el
comportamiento de un virus ante ciertas características de su ambiente.
·
Arboles de Decisiones:
Este concepto es menos ambiguo
que las redes neuronales y tienen da ser más precisas. La aplicación de este
concepto toma importancia al momento de enfrentarse ante presente problema o
necesidad, y se necesita la respuesta más “eficiente” al caso. Este modelo implementa
las estadísticas probabilísticas, por lo que sigue siendo inexacta, pero mas
precisa. Ej. Aprobar el crédito de un cliente bajo las características que
presenta y que presentaron clientes similares anteriormente.
·
Reglas de Asociación:
Al ver distinta información que
puede haber, se trata de darle alguna relación entre si, así es que este modelo
le da márgenes de asociación a dos valores de un mismo “tema”, pero que no
tienen ninguna relación entre sí. Un ejemplo simple para este tipo de casos, sería
el dicho “norte claro, sur oscuro, aguacero seguro.” , en este tipo de dicho se
trata de asociar condiciones climáticas como son el comportamiento de las nubes
a una futura llovizna.