La publicación de hoy contiene un caso de uso práctico y sencillo para chatbots multimodales que he querido probar y mostrar aquí desde hace tiempo, pero aún demuestra que estamos lejos de esperar un "razonamiento" fiable de las herramientas LLM al incorporar incluso elementos visuales bastante rudimentarios, como gráficos de series temporales. Desafié a ChatGPT 4o (como comenté en una publicación anterior, o1 en la aplicación web todavía no admite la entrada de imágenes), Gemini y Claude a analizar un gráfico de área apilada que representa visualmente la evolución del patrimonio neto de una persona. Después de varios intentos y evidentes fallos de todos los modelos, comparto los mejores resultados que, como suele ocurrir en la mayoría de las batallas de SCBN publicadas en Talking to…

Leer más →

Hablamos mucho de "artículos" y de la supuesta autenticidad de su contenido cuando leemos investigaciones académicas, en todos los campos, pero cuando tocamos el aprendizaje automático en particular. Irónicamente, el proceso que creó el medio para la difusión de la investigación científica en la era del papel físico no fue tan diferente del proceso que produce el "contenido" en la era gobernada por algoritmos de aprendizaje automático, ya sean clasificadores, motores de búsqueda o algoritmos generativos. : 'destrozar' textos al tokenizarlos y crear incrustaciones, descomponer piezas de arte visual en 'tensores' numéricos, una red neuronal artificial profunda que luego se 'difundirá' en imágenes que atraerán clics para este blog vergonzoso...

Leer más →

Dibujo lineal en blanco y negro generado por el modelo ControlNet Canny que muestra a una mujer con traje de neopreno sosteniendo una tabla de surf en la playa. Un texto de CLIP Interrogator que describe una imagen se superpone al dibujo.

La intensa competencia en el ámbito de los chatbots se refleja en la creciente cantidad de participantes en la clasificación de LMSYS Chatbot Arena, o en mi modesta contribución a las Batallas de Chatbots de SCBN que he presentado en este blog y que completo cuando el tiempo me lo permite. Hoy exploraremos WildVision Arena, un nuevo proyecto de Hugging Face Spaces que reúne modelos de visión y lenguaje para competir. La mecánica de WildVision Arena es similar a la de LMSYS Chatbot Arena. Se trata de una clasificación colaborativa basada en los votos de los usuarios, donde puedes introducir cualquier imagen (además de un texto opcional) y se te presentarán dos respuestas de dos modelos diferentes, manteniendo el nombre del modelo oculto hasta que votes eligiendo la respuesta…

Leer más →