Forge Agents ← Inicio
Evaluación de IA

Cambiamos un prompt y esperamos que nada se haya roto. Quiero un conjunto de pruebas que nos lo diga.

Casos de prueba tomados del uso real, ejecutados en su sistema en producción, y un informe escrito de qué falla y por qué.

Para quién es

Startups y equipos de producto que lanzan funciones con LLM: asistentes, recuperación y búsqueda, bots de soporte, agentes. Ya tiene usuarios, está cambiando prompts y modelos, y no tiene un conjunto de pruebas en el que confíe.

Lo que recibe

El ejemplo en funcionamiento

Así probamos nuestro propio producto, y los resultados son públicos. Nuestra página de pruebas muestra 9 conjuntos y 310 pruebas, cada una ejecutada 5 veces, todas aprobadas. El modelo de respaldo se muestra aparte con su único fallo. Publicamos el fallo porque un informe que oculta fallos no vale la pena leerlo. Su informe muestra los fallos con la misma claridad.

Cómo funciona

PASO 1

Llamada de alcance

Qué hace la función, cuánto le cuesta una respuesta equivocada y cómo llegamos a su sistema: un endpoint, un entorno de pruebas o un arnés que usted nos dé.

PASO 2

Crear los casos

Redactamos casos a partir del uso real. Usted aprueba el comportamiento esperado de cada uno.

PASO 3

Calibrar el evaluador

Comprobamos el evaluador con respuestas buenas y malas conocidas, incluidas reformulaciones y negativas, antes de confiar en él.

PASO 4

Ejecutar e informar

5 intentos por caso en su sistema en producción, un informe escrito y una llamada para revisarlo juntos. Unas dos semanas en total.

Precio

$2,500Evaluación inicial, precio fijo. Hasta 50 casos, evaluador, ejecución de 5 intentos en su sistema en producción, informe escrito. Unas dos semanas.

Quién hace el trabajo

Dustin Aldridge, fundador de Forge Agents en Saint Paul, Minnesota. Veterano del Ejército con nueve años en informática. Crea y prueba los asistentes de Forge, que se basan en documentos reales, citan su fuente y lo dicen cuando los documentos no cubren una pregunta. Somos un equipo pequeño, y le diremos con claridad qué podemos y qué no podemos probar.

Preguntas

¿Necesitan nuestros datos de producción?

No. Podemos trabajar con un entorno de pruebas y con casos que usted describa. Si comparte ejemplos reales, quite primero los datos personales.

¿Con qué modelos y tecnologías trabajan?

Necesitamos un sistema al que podamos enviar una entrada de prueba y del que podamos leer la respuesta. El evaluador no depende del proveedor de su modelo.

¿Podemos ejecutar las pruebas nosotros mismos después?

Sí. Usted se queda con los casos, el evaluador y las instrucciones para volver a ejecutarlos. El plan mensual existe por si prefiere que lo hagamos nosotros.

Hable con nosotros

Reserve una llamada de 20 minutos o escriba a daldridge@forgeagentsio.com con una breve descripción de su función.

Reserve una llamada de 20 minutos Escriba a daldridge@forgeagentsio.com