Saltar al contenido principal

Evaluaciones

La plataforma convierte el uso cotidiano en señales comparables: comentarios sobre respuestas, enfrentamientos ciegos con clasificación Elo y conjuntos reutilizables ejecutados como trabajos duraderos. Todo usa tu identidad y credenciales; capturas, comentarios, prompts y salidas se cifran en reposo.

Comentarios de mensajes

Valorar una respuesta ofrece etiquetas (precisión, estilo, incompleta, dañina, formato) y comentario opcional. Libre captura el prompt y la respuesta para conservar el dato tras editar o borrar el chat. Hay una fila por usuario y mensaje; volver a valorar sustituye y limpiar elimina. Tus datos están en Evaluaciones → Comentarios; los administradores pueden consultar el conjunto de la instancia. Las sesiones privadas nunca crean filas.

Arena y clasificación

Una partida envía el prompt a dos modelos y muestra respuestas en orden aleatorio. Sus identidades permanecen ocultas hasta votar: primero, segundo, empate o ambos malos. Cada usuario vota una vez. La clasificación reproduce los votos en orden con Elo determinista (K=32, base 1000); «ambos malos» cuenta participación sin cambiar puntuaciones.

Conjuntos y ejecuciones

Un conjunto contiene hasta 50 prompts. La ejecución contra un modelo es un trabajo duradero: procesa uno a uno con tus credenciales, muestra progreso, registra fallos por elemento y permite cancelar. Al terminar guarda modelo exacto, salidas y latencia por elemento cifrados, y exporta JSON para comparación o seguimiento de regresiones.