Permisos de datos para LLMs: controles antes del prompt
Diseña permisos para un asistente conectado a datos de empresa. Incluye autorización por usuario, filtros por entidad y un ejemplo de consulta de margen.
Un LLM conectado a datos de empresa debe recibir únicamente la información que el usuario y la tarea pueden consultar. La autorización debe comprobarse en la aplicación y en el acceso a los datos, antes de construir el contexto. Una frase como «no muestres datos de otras empresas» dentro del prompt no sustituye a esos controles.
Ejemplo: consultar el margen de una filial
Una directora de la filial A pregunta por el margen bruto de agosto. La aplicación identifica a la persona, resuelve sus permisos y autoriza la métrica. La consulta aplica el filtro de filial desde una identidad verificada; no acepta sin más el identificador que sugiera el modelo.
El contexto puede contener periodo, moneda, ingresos, coste de ventas y margen calculado. Para responder esa pregunta no necesita nombres de clientes, correos, direcciones ni facturas completas.
| Paso | Control de diseño |
|---|---|
| Identidad | Usuario autenticado y sesión vigente |
| Autorización | Permiso sobre filial, métrica y periodo |
| Consulta | Filtros de entidad y lista de campos permitidos |
| Transformación | Agregados calculados fuera del modelo |
| Respuesta | Fuente, fecha y alcance de la cifra |
Es una arquitectura ilustrativa, no una afirmación sobre controles activados por defecto en un producto.
Qué ocurre si una fuente contiene instrucciones
Un documento recuperado puede incluir texto que intente cambiar el comportamiento del asistente. OWASP describe este riesgo de prompt injection. Trata el contenido recuperado como datos, mantén los permisos fuera del modelo y limita las herramientas disponibles. Ninguna instrucción recuperada debe conceder acceso adicional.
Pruebas antes de habilitar el caso de uso
Comprueba que una persona de la filial A no recibe resultados de B aunque lo pida expresamente. Prueba campos denegados, sesiones caducadas, consultas sin permiso y documentos con instrucciones maliciosas. Repite las comprobaciones en cachés y exportaciones: también pueden filtrar datos si no respetan el alcance del usuario.
Define qué registrar y durante cuánto tiempo. Los logs completos de prompts pueden guardar precisamente la información que intentabas minimizar. Registra identificadores de consulta y decisiones de autorización cuando basten para investigar.
Relación con la capa semántica
La capa semántica aporta definiciones comunes; el sistema de autorización determina quién puede usarlas y sobre qué registros. Son responsabilidades que deben encajar en el diseño. Para reducir contexto, consulta también hashing y minimización y la comparación con warehouse y BI.