Evaluaciones
La plataforma convierte el uso cotidiano en señales comparables: comentarios sobre respuestas, enfrentamientos ciegos con clasificación Elo y conjuntos reutilizables ejecutados como trabajos duraderos. Todo usa tu identidad y credenciales; capturas, comentarios, prompts y salidas se cifran en reposo.
Comentarios de mensajes
Valorar una respuesta ofrece etiquetas (precisión, estilo, incompleta, dañina, formato) y comentario opcional. Libre captura el prompt y la respuesta para conservar el dato tras editar o borrar el chat. Hay una fila por usuario y mensaje; volver a valorar sustituye y limpiar elimina. Tus datos están en Evaluaciones → Comentarios; los administradores pueden consultar el conjunto de la instancia. Las sesiones privadas nunca crean filas.
Arena y clasificación
Una partida envía el prompt a dos modelos y muestra respuestas en orden aleatorio. Sus identidades permanecen ocultas hasta votar: primero, segundo, empate o ambos malos. Cada usuario vota una vez. La clasificación reproduce los votos en orden con Elo determinista (K=32, base 1000); «ambos malos» cuenta participación sin cambiar puntuaciones.
Conjuntos y ejecuciones
Un conjunto contiene hasta 50 prompts. La ejecución contra un modelo es un trabajo duradero: procesa uno a uno con tus credenciales, muestra progreso, registra fallos por elemento y permite cancelar. Al terminar guarda modelo exacto, salidas y latencia por elemento cifrados, y exporta JSON para comparación o seguimiento de regresiones.