FORGE AGENTS

El fundador

Construí esto porque vi a personas ser defraudadas por respuestas dichas con confianza.

Forge Agents es una persona en Minnesota. Yo escribo el código, yo contesto el correo y yo decido qué hará y qué no hará este software. Esta página es la última porque prefiero que juzgue primero el producto.

Dónde empieza

En el Ejército, una suposición dicha con confianza hacía que la gente saliera lastimada.

Ese es el primer lugar donde aprendí la diferencia entre una respuesta y una garantía. Le enseñan a decir "no lo sé, lo voy a averiguar" — en voz alta, frente a la gente, sin titubear — porque la alternativa cuesta más que su orgullo. Es una frase incómoda las primeras cien veces. Luego se convierte en la más útil que uno tiene.

Llevé eso a la administración de redes, donde el trabajo es casi la misma lección con otra ropa. Cada falla grave en la que he trabajado empezó con alguien que estaba seguro. No malicioso. No flojo. Seguro. Los sistemas que sobreviven son los que hacen fácil decir "eso no está documentado" y difícil inventar algo que suene correcto.

Lo que seguía viendo

La persona en la recepción sostiene todo el edificio.

Entre a cualquier consultorio pequeño y observe la recepción durante una hora. Alguien está al teléfono, otra persona está de pie en el mostrador, y una tercera hace una pregunta que tiene una respuesta documentada en una carpeta a tres metros de distancia. Así que la respuesta sale de la memoria. Casi siempre la memoria acierta. Cuando se equivoca, se equivoca en silencio — y la persona a la que culpan es la que más se esforzaba por ayudar.

Nadie diseña esa falla. Es lo que pasa cuando el conocimiento vive en una carpeta, en un disco compartido y en la cabeza de una persona, y el teléfono no deja de sonar.

La convicción

Un asistente que adivina es peor que ningún asistente.

No igual. Peor. Una persona que no tiene respuesta va y la busca. Una persona a la que le entregan una respuesta equivocada con confianza actúa en consecuencia — y cada salvaguarda posterior ahora trabaja contra algo que parece haber salido de la documentación. Esa es toda la razón por la que este producto se niega a ser ingenioso. Cita sus procedimientos o le dice que no puede.

Cómo se manifiesta

Cada decisión aquí deriva de una sola negativa.

El software verifica sus propias citas contra sus documentos antes de que usted vea la respuesta, y descarta cualquiera que no pueda probar. Le dice cuando no tiene nada en lugar de llenar el silencio. No dará consejos clínicos bajo ninguna presión. El precio está impreso en el sitio web porque obligarlo a pasar por una llamada para conocer un número es una pequeña deshonestidad, y las pequeñas deshonestidades son exactamente de lo que intento alejarme al construir.

Nada de eso es una lista de funciones. Es la misma decisión, tomada una y otra vez, en los lugares donde un atajo habría sido más fácil.

Por qué se mantiene pequeño

Prefiero que unas pocas oficinas confíen en mí a que muchas me conozcan.

Forge es deliberadamente estrecho. Un producto que hace un trabajo para un tipo de oficina, probado antes de venderse en cualquier otro lugar. Si alguna vez crecemos, quiero que sea porque la cosa funcionó, no porque el discurso funcionó.

Si dirige un consultorio y quiere ver si esto es real, pregúntele algo que sus documentos no cubran. Observe qué hace con el silencio. Esa es la parte de la que estoy orgulloso.

Dustin Aldridge Fundador · Forge Agents LLC · Minnesota
Para mis colegas constructores a quienes les importa lo que hay dentro

El rechazo del que acaba de leer no es un prompt de sistema pidiendo por favor. Cada cita se verifica por máquina, textualmente, contra el corpus fuente después de la generación; una respuesta que no sobrevive esa verificación no se entrega, y una afirmación que los documentos no contienen regresa como un rechazo de primera clase con una ruta hacia una persona. La regla de preguntas múltiples se aplica de la misma manera — responder la mitad de una pregunta, marcar la otra mitad como no documentada, y nunca dejar que algo parcial se lea como completo.

Construimos a partir de la literatura, no de intuiciones. La investigación reciente sobre sistemas de agentes está implementada aquí, no resumida: la síntesis de tareas validada por ejecución genera la suite de aceptación de cada cliente desde su propio corpus y la condiciona a la ejecución — fundamentación, vacuidad, verificaciones adversarias de respuestas incorrectas — antes de que nada entre en funcionamiento. Las baterías de trampas de memoria ponen a prueba la integridad del rechazo a lo largo de ataques multi-turno emocionales, de falsa autoridad y entre idiomas; ese trabajo llevó nuestra suite de trampas de casi-aprobada a limpia. La evolución de prompts se ejecuta como operadores de variación bajo un oráculo de pruebas fijo — las pruebas nunca se doblegan ante el modelo.

Las evaluaciones tienen evaluaciones: nuestras suites de pruebas se revisan en busca de construcciones que fallan en falso antes de cualquier corrida del modelo. Los cambios al corpus son solo de inserción, con puertas de procedencia exactas byte por byte, así que los documentos de un cliente se pueden profundizar pero nunca reescribir en silencio. El conector es un servidor sin estado por solicitud detrás de OAuth 2.1 — registro dinámico, PKCE, tokens de actualización rotativos con revocación de la familia ante reutilización — y su capa de autenticación refleja el almacén de identidades en modo de solo lectura: no puede escribir, por construcción, no por política. Los despliegues pasan por una puerta de salud con reversión automática.

El archivo de pruebas es ahora un simulador para el evaluador. Cada ejecución de una suite registra la respuesta de cada intento, sus citas y el veredicto de cada comprobación en un almacén de repetición, de modo que un cambio en una aserción, en una lista de negaciones o en la definición de una prueba se vuelve a puntuar sobre todas las respuestas registradas en segundos, sin costo de modelo, en lugar de una nueva ejecución en vivo por cada corpus. La primera repetición sobre 118 informes históricos volvió a calificar 2.041 respuestas en menos de un tercio de segundo y señaló exactamente cuáles 69 veredictos cambiaría el evaluador de hoy. El ciclo de evolución del prompt nunca ve una aserción de prueba, solo transcripciones, y un commit que pierde una prueba reservada que antes pasaba se revierte. Un revisor basado en modelo lee cada diff antes de una compilación, la consola conmuta entre proveedores dentro de la misma solicitud, y un modelo de respaldo solo puede servir un corpus para el que haya superado una prueba pública.

La versión honesta: las partes que lo hacen negarse se prueban con más rigor que las partes que lo hacen responder. Esa es toda la empresa. Las puntuaciones están publicadas: lo que probamos.

El relato completo de ese aparato es el artículo: Refuse or Cite.