La publicación de hoy contiene un caso de uso práctico y sencillo para chatbots multimodales que he querido probar y mostrar aquí desde hace tiempo, pero aún demuestra que estamos lejos de esperar un "razonamiento" fiable de las herramientas LLM al incorporar incluso elementos visuales bastante rudimentarios, como gráficos de series temporales. Desafié a ChatGPT 4o (como comenté en una publicación anterior, o1 en la aplicación web todavía no admite la entrada de imágenes), Gemini y Claude a analizar un gráfico de área apilada que representa visualmente la evolución del patrimonio neto de una persona. Después de varios intentos y evidentes fallos de todos los modelos, comparto los mejores resultados que, como suele ocurrir en la mayoría de las batallas de SCBN publicadas en Talking to…

Leer más →

Dibujo lineal en blanco y negro generado por el modelo ControlNet Canny que muestra a una mujer con traje de neopreno sosteniendo una tabla de surf en la playa. Un texto de CLIP Interrogator que describe una imagen se superpone al dibujo.

The intense competition in the chatbot space is reflected in the ever-increasing amount of contenders in the LMSYS Chatbot Arena leaderboard, or in my modest contribution with the SCBN Chatbot Battles I’ve introduced in this blog and complete as time allows. Today we’re exploring WildVision Arena, a new project in Hugging Face Spaces that brings vision-language models to contend. The mechanics of WildVision Arena are similar to that of LMSYS Chatbot Arena. It is a crowd-sourced ranking based on people’s votes, where you can enter any image (plus an optional text prompt), and you will be presented with two responses from two different models, keeping the name of the model hidden until you vote by choosing the answer…

Leer más →