Cómo funciona
- Sube documentos a una base de conocimientos: PDF, Word (DOCX), HTML o texto plano.
- La plataforma extrae el texto, lo divide en fragmentos superpuestos (~500 tokens) y calcula los embeddings vectoriales.
- Cada documento avanza por una cadena de estados:
processing → ready(oerrorcon un mensaje). Si actualizas un documento, se reindexa automáticamente. - Adjunta la base de conocimientos a un asistente. Durante las llamadas, el asistente recibe una herramienta
search_knowledgebasey la usa cuando la pregunta lo requiere. - La recuperación es semántica (similitud vectorial), así que quien llama no necesita usar la redacción exacta de tu documento.
Mientras el asistente busca, puede decir una frase breve de relleno (“Déjame comprobarlo…”) para que quien llama nunca escuche silencio muerto. Cada búsqueda queda registrada como un evento de llamada, visible en el detalle de la llamada.
Crear una base de conocimientos
1
Crear
Ve a Bases de conocimiento → Nueva, ponle un nombre y una descripción breve. La descripción se le muestra al asistente: escríbela como una pista: “Precios, horarios de apertura y política de cancelación de Example GmbH.”
2
Sube documentos
Arrastra archivos PDF, DOCX, HTML o de texto. Espera a que cada uno llegue a ready.
3
Prueba la búsqueda
Usa la búsqueda de prueba integrada para lanzar preguntas de ejemplo contra el índice y comprobar qué fragmentos devuelve, antes de que lo haga cualquier persona que llame.
4
Adjúntala a un asistente
En el editor del asistente, selecciona la base de conocimientos. Listo: no hace falta tocar el prompt.
Cómo escribir documentos que se recuperen bien
- Prefiere secciones autocontenidas: un título con los datos justo debajo. Los fragmentos se recuperan de forma individual, así que cada sección debe tener sentido por sí sola.
- Incluye números y condiciones en el texto, no solo en tablas repartidas entre páginas.
- Evita documentos duplicados o contradictorios: la recuperación mostrará ambos.
- Mantén un solo tema por documento cuando sea posible (pricing.pdf, faq.pdf, policy.pdf).
Rastrear un sitio web
En lugar de subir archivos uno a uno, puedes apuntar una base de conocimientos a un sitio web y dejar que el rastreador importe las páginas por ti. Cada página rastreada se convierte en un documento de conocimiento y se indexa igual que si la hubieras subido.1
Añade una fuente de rastreo
En la base de conocimientos, añade una fuente de rastreo con una URL raíz (por ejemplo,
https://example.com/docs). Opcionalmente, restríngela a prefijos de ruta (rutas incluidas, por ejemplo, /docs), excluye secciones con rutas excluidas (por ejemplo, /admin), y define un límite de páginas máximas (1-500, 50 por defecto).2
Ejecútalo
Inicia un rastreo. El rastreador lee
robots.txt, luego descubre páginas a través de sitemap.xml (si no lo encuentra, sigue enlaces del mismo host desde la página raíz), extrae el texto principal de cada página y lo indexa.3
Mantenlo actualizado (opcional)
Activa la sincronización automática y un intervalo de sincronización (en horas). La plataforma vuelve a rastrear el sitio según lo programado. Las páginas cuyo contenido no ha cambiado se omiten automáticamente: sin volver a generar embeddings, sin coste adicional.
El rastreo de sitios web y la sincronización automática son funciones del plan (se habilitan según tu plan) y se facturan como créditos de uso por página rastreada (solo cuentan las páginas nuevas o modificadas). Volver a rastrear un sitio sin cambios es, en la práctica, gratis. Si tu saldo se agota a mitad del rastreo, la ejecución se detiene de forma controlada: las páginas ya obtenidas se conservan y la fuente muestra el estado
error con el mensaje créditos insuficientes.Límites del rastreador
- Solo HTML estático: sin renderizado de JavaScript. Las aplicaciones de una sola página que generan el contenido en el cliente (sin HTML del lado del servidor) devolverán poco o ningún texto.
- Solo el mismo host. No se siguen enlaces a otros dominios.
- Solo páginas de texto: se omiten las respuestas que no sean HTML y las páginas de más de 2 MB. Los archivos enlazados (PDF, etc.) no se descargan durante el rastreo; añádelos en su lugar como URLs de documento.
- Cortesía: como máximo 2 solicitudes en paralelo con una pequeña pausa entre ellas, y se respetan las reglas
Disallowderobots.txt.
Límites y planes
El número de bases de conocimiento por cuenta es un límite del plan (max_knowledgebases). El rastreo de sitios web cobra créditos por página rastreada (consulta la nota anterior).
Cada base de conocimiento tiene además estos topes fijos: