Soberanía de datos: por qué tu IA nunca debería salir de tu edificio
Todas las startups de IA en salud hablan de cumplimiento HIPAA. Casi ninguna habla de lo que pasa cuando un gobierno extranjero cita a tu proveedor de nube. Medicus 24/7 corre completamente on-premise. Aquí presento el argumento de ingeniería de por qué el tuyo también debería.
El problema del teatro de cumplimiento
Las empresas de IA en salud aman las certificaciones de cumplimiento. SOC 2 Type II. HIPAA BAA. ISO 27001. Estos marcos son necesarios, pero comparten una limitación fundamental: certifican proceso, no arquitectura. Una certificación SOC 2 te dice que la empresa tiene procedimientos de seguridad documentados. No te dice dónde viven físicamente los datos del paciente cuando el modelo los procesa.
Cuando un médico dicta una nota clínica y tu IA scribe la procesa a través de una API en la nube, los datos de audio atraviesan tu red local, llegan a tu ISP, entran a la red del proveedor de nube, se procesan en una GPU de un centro de datos que nunca has visitado, y el resultado regresa por la misma ruta. En cada salto, los datos están sujetos a las leyes de jurisdicción y vigilancia de la geografía por la que pasan.
El problema de la Ley CLOUD
Para la IA en salud en Latinoamérica, hay un riesgo legal específico y concreto que la mayoría de los proveedores ignora. La Ley CLOUD, aprobada por el Congreso de EE.UU. en 2018, permite a las fuerzas del orden de EE.UU. obligar a divulgar datos almacenados por proveedores de tecnología con sede en EE.UU., sin importar dónde estén ubicados físicamente.
Si tu IA clínica corre en AWS, Azure o Google Cloud — incluso en servidores físicamente ubicados en São Paulo o Querétaro — los datos son legalmente accesibles para agencias federales de EE.UU. mediante orden judicial. Tu marco de cumplimiento NOM mexicano no anula una orden federal de EE.UU. Tu autorización de COFEPRIS no anula la jurisdicción extraterritorial.
Cómo se ve realmente el on-premise
Hardware:
- 1x workstation with NVIDIA RTX 5080 (16GB VRAM)
- Standard NVMe storage for FAISS indices
- UPS for power continuity
Software stack:
- Ollama (model serving)
- Llama 3.x (clinical NLP)
- Qwen 3 14B (structured extraction)
- Whisper (speech-to-text)
- FAISS (vector similarity for RAG)
- Python + JSON Schema (orchestration)
- FHIR R4 (data interchange)
Network requirement:
- None. Zero external API calls for inference.
- The system operates air-gapped if needed.
El costo total del hardware de inferencia es aproximadamente equivalente a 8-10 meses de uso de API en la nube a volumen moderado. Después de eso, la inferencia es efectivamente gratuita. Más importante aún, los datos nunca salen de la máquina.
Soberanía no es nacionalismo
Cuando hablo de soberanía de datos, a veces la gente escucha un argumento político. No lo es. Es un argumento de ingeniería sobre superficies de control. Cada dependencia externa es una superficie que no controlas — donde los datos pueden filtrarse, el servicio puede degradarse, los precios pueden cambiar, o un gobierno puede emitir una citación bajo leyes que no aplican a tus pacientes.
Correr la inferencia localmente elimina toda esta categoría de riesgo. No la mitiga — la elimina.
El argumento de latencia que nadie hace
Una llamada API en la nube para NLP clínico toma de 800ms a 3 segundos. La misma tarea en una RTX 5080 local se completa en 200-400ms. En un flujo de trabajo clínico donde el médico dicta en tiempo real, esa diferencia es la diferencia entre una herramienta y un cuello de botella.
Los médicos no usarán software lento. La inferencia local no solo es más segura. Es más rápida, y más rápida significa adoptada.
La pregunta incómoda
Si tu proveedor de nube recibiera una citación judicial por los datos de tus pacientes mañana, ¿qué pasaría?
Si la respuesta involucra a tu equipo legal, ya perdiste. La respuesta correcta es: no pasaría nada, porque los datos nunca estuvieron ahí.
¿Listo para traer tu inferencia de IA on-premise? Hablemos de tu arquitectura →