Cambiamos un prompt y esperamos que nada se haya roto. Quiero un conjunto de pruebas que nos lo diga.
Casos de prueba tomados del uso real, ejecutados en su sistema en producción, y un informe escrito de qué falla y por qué.
Para quién es
Startups y equipos de producto que lanzan funciones con LLM: asistentes, recuperación y búsqueda, bots de soporte, agentes. Ya tiene usuarios, está cambiando prompts y modelos, y no tiene un conjunto de pruebas en el que confíe.
Lo que recibe
- Hasta 50 casos de prueba tomados del uso real: sus registros, tickets o preguntas reales, más los casos límite que ya preocupan a su equipo.
- Un evaluador que revisa el fondo de la respuesta. Está hecho para aceptar reformulaciones correctas, reconocer una negativa correcta y reprobar una respuesta equivocada dicha con seguridad, y lo calibramos antes de confiar en él.
- Cada caso se ejecuta 5 veces en su sistema en producción, para que salga a la luz el comportamiento inestable.
- Un informe escrito: cada fallo, la causa probable (recuperación, prompt, modelo o contenido faltante) y una lista de soluciones ordenada por prioridad.
- Los archivos del conjunto de pruebas y del evaluador, suyos para conservar y volver a ejecutar.
El ejemplo en funcionamiento
Así probamos nuestro propio producto, y los resultados son públicos. Nuestra página de pruebas muestra 9 conjuntos y 310 pruebas, cada una ejecutada 5 veces, todas aprobadas. El modelo de respaldo se muestra aparte con su único fallo. Publicamos el fallo porque un informe que oculta fallos no vale la pena leerlo. Su informe muestra los fallos con la misma claridad.
Cómo funciona
Llamada de alcance
Qué hace la función, cuánto le cuesta una respuesta equivocada y cómo llegamos a su sistema: un endpoint, un entorno de pruebas o un arnés que usted nos dé.
Crear los casos
Redactamos casos a partir del uso real. Usted aprueba el comportamiento esperado de cada uno.
Calibrar el evaluador
Comprobamos el evaluador con respuestas buenas y malas conocidas, incluidas reformulaciones y negativas, antes de confiar en él.
Ejecutar e informar
5 intentos por caso en su sistema en producción, un informe escrito y una llamada para revisarlo juntos. Unas dos semanas en total.
Precio
- Pruebas de regresión mensuales: $500 al mes. Volvemos a ejecutar el conjunto cada mes y le informamos qué cambió.
- Trabajo a medida: $95 la hora. Más casos, nuevos conjuntos o ayuda para corregir lo que encontró el informe.
Quién hace el trabajo
Dustin Aldridge, fundador de Forge Agents en Saint Paul, Minnesota. Veterano del Ejército con nueve años en informática. Crea y prueba los asistentes de Forge, que se basan en documentos reales, citan su fuente y lo dicen cuando los documentos no cubren una pregunta. Somos un equipo pequeño, y le diremos con claridad qué podemos y qué no podemos probar.
Preguntas
¿Necesitan nuestros datos de producción?
No. Podemos trabajar con un entorno de pruebas y con casos que usted describa. Si comparte ejemplos reales, quite primero los datos personales.
¿Con qué modelos y tecnologías trabajan?
Necesitamos un sistema al que podamos enviar una entrada de prueba y del que podamos leer la respuesta. El evaluador no depende del proveedor de su modelo.
¿Podemos ejecutar las pruebas nosotros mismos después?
Sí. Usted se queda con los casos, el evaluador y las instrucciones para volver a ejecutarlos. El plan mensual existe por si prefiere que lo hagamos nosotros.
Hable con nosotros
Reserve una llamada de 20 minutos o escriba a daldridge@forgeagentsio.com con una breve descripción de su función.