¿Cuánto de su manual puede contener DOKA?
Una base de conocimiento de DOKA está calificada para 250 documentos de procedimientos — unos 463,000 caracteres, aproximadamente 150 páginas de procedimientos escritos, diez veces el tamaño del manual de consultorio que usamos para las pruebas. Ese número está medido, no copiado de una hoja de especificaciones. Esta página muestra la prueba y los resultados en cada tamaño.
Por qué existe un límite
DOKA no busca en su manual unos pocos pasajes probables para leer solo esos. Cada pregunta se responde con la base de conocimiento completa delante del modelo. Así es como cada respuesta puede llevar una cita al documento exacto, y por eso “el manual no cubre eso” es un rechazo real y no una búsqueda fallida.
El costo de ese diseño es un techo. El modelo lee una cantidad fija a la vez, y a medida que el manual crece la pregunta es si las respuestas, los rechazos y las citas se mantienen disciplinados cerca del borde. Así que lo medimos.
Cómo lo medimos
- Empezar con una base de conocimiento real. Los 25 documentos de procedimientos de un consultorio dental en funcionamiento, mantenidos idénticos byte por byte en cada tamaño.
- Hacerla crecer con relleno realista. Procedimientos sintéticos para departamentos y ubicaciones que el manual real no cubre — registros de esterilización, seguimiento de casos de laboratorio, pedidos de insumos, horarios del personal — escritos en el mismo formato, hasta 250 documentos.
- Sembrar casi-aciertos. Uno de cada diez documentos agregados es un distractor deliberado: el mismo tema que un procedimiento real, pero para otra ubicación u otro rol. El horario de los sábados de otra oficina. El teléfono de otra oficina. Otra persona a quien escalar. Existen para atrapar a un asistente que responde desde el documento equivocado.
- Hacer las mismas preguntas en cada tamaño. La suite de control de 38 preguntas que el producto ejecuta antes de cada versión: respuestas fundamentadas, rechazos donde el manual guarda silencio, preguntas trampa que invitan a una suposición plausible, español e intentos de inyección de instrucciones. Más seis sondas de anclaje, cada una pidiendo un hecho real que un distractor contradice para otra ubicación.
- Ejecutarlo con el código de producción. Una copia desechable de la consola — el mismo prompt, el mismo modelo, la misma ruta de código que usan los clientes. Gemini 3.8 Flash, con cada pregunta hecha tres veces en cada tamaño.
Lo que encontramos
| Documentos | Caracteres | Suite de control | Sondas de anclaje | Por pregunta | Veredicto |
|---|---|---|---|---|---|
| 25 | 43,000 | 38 / 38 | 6 / 6 | 1.4 s | Nuestro manual de prueba de 25 documentos. Limpio. |
| 50 | 90,000 | 37 / 38 | 6 / 6 | 1.7 s | Limpio.* |
| 100 | 184,000 | 37 / 38 | 6 / 6 | 1.9 s | Limpio.* |
| 200 | 370,000 | 37 / 38 | 6 / 6 | 1.7 s | Limpio.* |
| 250calificado | 463,000 | 37 / 38 | 6 / 6 | 1.6 s | Limpio.* El tamaño calificado, y el más grande que ejecutamos. |
* El único fallo a partir de 50 documentos es el diseño de casi-aciertos haciendo su trabajo. Al preguntarle por el horario de los sábados, DOKA responde que las tres ubicaciones reales del consultorio cierran los sábados y atribuye el horario de los sábados al anexo sintético que sí lo tiene, en las tres corridas de cada tamaño. La verificación se escribió antes de que el corpus contuviera el horario de sábados de otra ubicación, así que cuenta como fallo una respuesta correcta y correctamente anclada. Lo reportamos en lugar de reescribir la verificación después del hecho.
Dónde está el límite, y por qué calificamos en 250
Con el modelo que sirve todavía no lo hemos alcanzado. Con 250 documentos, el tamaño más grande que ejecutamos, se respondieron las 134 preguntas, todas las preguntas trampa y de límites se sostuvieron en las tres corridas, y cada prueba de anclaje encontró el dato de la ubicación correcta. Una medición anterior con otro modelo, el 7 de septiembre de 2026, se degradó con 250 documentos; por eso el tamaño se mide de nuevo cada vez que cambia el modelo que sirve.
Calificamos en 250, el tamaño más grande medido, no en un borde que no hemos encontrado. Un consultorio cuyo manual es más grande que eso recibe más de una base de conocimiento — recepción, clínica, facturación — cada una con sus propias citas. Nada se resume, se recorta ni se descarta para que quepa.
¿Dónde queda su manual?
Cuente los documentos de su manual y elija la longitud que más se parezca. Traiga el manual real a la auditoría gratuita y lo mediremos con exactitud.
Un documento de procedimientos típico en nuestro manual de prueba tiene entre 1,200 y 2,600 caracteres, aproximadamente una página impresa con encabezados.
Lo que esta página no afirma
- Tres corridas, un día. Cada pregunta se ejecutó tres veces en cada tamaño el 25 de septiembre de 2026. Con 200 y 250 documentos las preguntas se espaciaron unos siete segundos: una pregunta de ese tamaño lleva de 80,000 a 100,000 tokens, y las preguntas seguidas superan el límite de tokens por minuto del proveedor del modelo.
- Medido en la consola. OKA Anywhere — el conector que funciona dentro de Claude o ChatGPT — responde con el mismo modelo, pero su ruta no formó parte de esta medición. No tiene calificación de capacidad hasta que se mida.
- Ligado a un modelo. Cuando el modelo que sirve cambia, la medición se repite antes de que cambie esta calificación. La fecha en la parte superior de esta página es la fecha de la corrida que reporta.
Detalles del método
Los caracteres son la unidad honesta. Los conteos de tokens dependen del tokenizador del modelo; en este texto el modelo que sirve usó unos 0.22 tokens por carácter, así que una pregunta con los 463,000 caracteres calificados lleva aproximadamente 101,000 tokens del manual, más la conversación misma.
Tamaños ejecutados: 25, 50, 100, 200 y 250 documentos, con 134 solicitudes en cada tamaño. El relleno sintético nunca contiene los hechos que las preguntas trampa prohíben — montos de cargos, horarios festivos, productos de financiamiento — así que un rechazo sigue siendo la respuesta correcta en cada tamaño.
“Por pregunta” es la mediana del tiempo de respuesta de las preguntas de control en ese tamaño, incluida la latencia del modelo. Los 25 documentos reales ocupan sus posiciones originales en cada tamaño; el relleno se genera desde una semilla fija, así que cualquier corrida se puede reproducir exactamente.
Empiece con la auditoría
Antes que nada, haremos una auditoría gratuita de las operaciones de su recepción — una revisión breve de dónde tienen lagunas sus procedimientos documentados, entregada como un informe escrito de hallazgos, con su manual medido contra los números de esta página. Sin costo, sin obligación.