sábado, 27 de febrero de 2010
martes, 23 de febrero de 2010
La exposición en fotografía digital
Este es un post (muy largo) pero muy instructivo de cómo exponer en fotografía digital:
jueves, 21 de enero de 2010
WordNet en MySQL

Existe una versión de WordNet en tablas de base de datos (concretamente para MySQL).
Se puede descargar en http://wnsqlbuilder.sourceforge.net/
Las tablas más importantes son:
word: tabla de palabras
- wordid: PK
- lemma: la palabra
- synsetid: PK
- pos: part of speech (n nombre, v verbo, a adjetivo, r adverbio, s adjetivo satélite)
- categoryid: FK a categorydef
- definition: definición del concepto
- tagcount: número de veces que aparece este concepto etiquetado en otros conceptos (determina la frecuencia de uso)
- wordid: FK a word
- casedwordid: si existe, FK a la palabra con la primera letra en mayúsculas
- synsetid: FK a synset
- rank: número de orden de este sentido
- categoryid: PK
- name: nombre de la categoría
- pos: part of speech
- sampleid: PK
- synsetid: FK a synset
- sample: ejemplo
linkdef: tipos de relaciones entre conceptos
- linkid: PK
- name: nombre del enlace
- synset1id: FK a synset
- synset2id: FK a synset
- linkid: FK a linkdef
martes, 29 de septiembre de 2009
Precision y Recall en clasificadores
Definiciones:
- True Positives (TP) para la clase C: son instancias pertenecientes a la clase C que se clasifican correctamente en la clase C
- True Negatives (TN) para la clase C: son instancias no pertenecientes a la clase C y que no se clasifican como clase C
- False Positives (FP) para la clase C: son instancias no pertenecientes a la clase C pero que se clasifican como clase C
- False Negatives (FN) para la clase C: son instancias pertenecientes a la clase C pero que no se clasifican como clase C
| Categoría C | Manual | ||
| SÍ | NO | ||
| Automática | SÍ | TP | FP |
| NO | FN | TN | |
- Precision para la clase C: es un valor entre 0 y 1. Su valor aumenta cuando hay pocos falsos positivos. Mide que las instancias clasificadas como clase C sean realmente de la clase C, aunque haya instancias de la clase C que se clasifiquen como otra clase
- Recall para la clase C: es un valor entre 0 y 1. Su valor aumenta cuando hay pocos falsos negativos. Mide que las instancias de la clase C se clasifiquen como clase C, aunque otras instancias también se clasifiquen como clase C sin serlo.
viernes, 18 de septiembre de 2009
Weka para clasificación de textos
Tras haber estudiado y evaluado algunos entornos y librerías de machine learning y procesamiento de lenguaje natural (Weka, Rapid Miner, NLTK), he llegado a las siguientes conclusiones:
- Weka es sencillo de utilizar, está escrito en Java y puede utilizarse en tres modos: GUI para empezar a probar, línea de comandos para ejecutar algoritmos y guardar resultados, y por último como una librería embebida dentro de un programa Java
- RapidMiner, tiene unas características muy similares a Weka (de hecho, incluye todos los algoritmos de Weka y algunos más) e incluye un módulo para procesamiento de texto (que no lo veo útil por lo básico). Sin embargo es bastante complejo de utilizar y está peor documentado que Weka
- NLTK está muy bien para empezar a hacer experimentos, pero no permite muchas facilidades. Y sobre todo, es Python, que aunque no está mal como lenguaje, no me termina de convencer
Me quedo con Weka, por lo menos para empezar. Con unos pocos tutoriales he sido capaz de hacer muchas cosas. Weka está orientado a Data Mining, sin embargo soporta un formato de fichero llamado Sparse ARFF que permite introducirle términos dispersos.
Etiquetas:
machine learning,
text mining,
Weka
jueves, 10 de septiembre de 2009
Suscribirse a:
Entradas (Atom)