Nota de investigación
Arquitectura de inteligencia pública: fuentes abiertas para la rendición de cuentas y la verificación
Un plano fuente por fuente para ingerir de forma privada registros oficiales, datos de compras, sistemas de acceso público, periodismo de libertades civiles y evidencia sobre incidentes de IA.
Conclusión ejecutiva
La inteligencia pública es más creíble cuando facilita la inspección del poder institucional sin facilitar el rastreo de quienes leen. Ese requisito cambia la arquitectura. Una publicación de libertades civiles no debe enviar el navegador de cada lector directamente a todas las API gubernamentales, fuentes de organizaciones, servicios de análisis o archivos documentales. Debe adquirir el material público en el servidor, conservar la ruta de origen, normalizar solo lo necesario y publicar una instantánea local que pueda revisarse de forma independiente.
International Intelligence trata una “fuente” como un canal editorial de entrada, no como una superficie de vigilancia en vivo. El sitio público lee JSON estático y archivos de informes alojados en el mismo dominio. Una tarea PHP programada realiza solicitudes limitadas a interfaces públicas documentadas, registra cuándo se obtuvieron los datos y conserva la última instantánea válida cuando una fuente falla. No se requiere base de datos, cuenta, identificador publicitario, baliza analítica ni solicitud del navegador a terceros.
1. La asimetría que atiende el sistema
Gobiernos, organismos policiales, instituciones de inteligencia, contratistas y corredores de datos suelen poseer información extensa sobre el público mientras revelan sus propios sistemas mediante avisos fragmentados, partidas presupuestarias, compras, expedientes judiciales y respuestas tardías a solicitudes de registros. El problema no suele ser una ausencia total de documentos. Los hechos relevantes están divididos entre sistemas con identificadores, ritmos, formatos y vocabularios jurídicos distintos.
Un escritorio de inteligencia pública puede reducir esa asimetría al enlazar cuatro clases de evidencia: la autoridad que permitió el sistema, el dinero que lo compró, los registros que describen su funcionamiento y el periodismo que revela sus efectos. El producto no es un servicio operativo ni una base de objetivos. Es un mapa documentado del poder público para investigación, periodismo, supervisión, petición y acceso legal a registros.
2. Ingesta que preserva la privacidad
El modelo separa la adquisición de la lectura. La capa de adquisición se ejecuta solo en el servidor o mediante un programador de comandos confiable. Contacta fuentes aprobadas con agente identificado, tiempo de espera breve, límite de tamaño y resultados pequeños. La capa de publicación lee únicamente archivos locales. JavaScript puede filtrar u ordenar esos archivos, pero no solicita datos remotos.
| Etapa | Función | Control de privacidad e integridad |
|---|---|---|
| Adquirir | Solicitar una API, RSS, Atom, XML o CSV documentada. | Solo desde el servidor; HTTPS; consultas limitadas; ninguna URL remota suministrada por el lector. |
| Normalizar | Mapear campos a un esquema común y pequeño. | Conservar URL canónica, identificador, fecha de publicación, fecha de recuperación e idioma. |
| Clasificar | Asignar tema, nivel de evidencia y confianza. | La etiqueta describe el elemento específico, no la reputación general de la fuente. |
| Minimizar | Eliminar datos personales irrelevantes y marcado inseguro. | Sin credenciales, domicilios privados, datos médicos ni identificadores ajenos. |
| Publicar | Escribir una instantánea JSON local de forma atómica. | El lector contacta solo InternationalIntelligence.org; un fallo conserva la última caché válida. |
El diseño prefiere datos conocidos aunque no sean los más recientes antes que una página rota o una respuesta parcial sin revisar. Cada actualización construye un archivo temporal y reemplaza la caché pública solo después de producir JSON válido. Un bloqueo impide tareas simultáneas. El estado distingue entre fuente deshabilitada, nunca intentada, último éxito y último intento fallido.
3. Esquema común de registros
Los sistemas públicos no deben aplanarse hasta perder su significado. El esquema común es deliberadamente modesto: fuente, clave, identificador, título, resumen, URL canónica, publicación, recuperación, idioma original, país, temas, nivel de evidencia, confianza y algunos campos opcionales como agencia, destinatario, monto, autor o tipo documental.
Así se permite descubrir conexiones sin fingir que un aviso del Registro Federal, una adjudicación y un artículo de libertades civiles son equivalentes. La interfaz conserva visualmente el nivel de evidencia. Se puede buscar en todo el escritorio y seguir viendo si el elemento es un registro oficial, periodismo acreditado o análisis del proyecto.
4. Autoridad oficial y reglamentación
Federal Register
El Registro Federal es el primer conector oficial admitido. Publica reglas, propuestas, avisos, documentos presidenciales y material de inspección pública. Los monitores por palabras pueden revelar novedades sobre IA, ciberseguridad, privacidad, vigilancia, conservación de datos, intercambio de información o autoridades de seguridad nacional. El conector conserva el número del documento, la página canónica y las agencias nombradas.
Un resultado demuestra que un documento fue publicado en el sistema. No prueba por sí solo que un programa se haya desplegado, que una interpretación sobreviva a litigios o que la versión web informativa sea la edición jurídicamente controlante. Para una dependencia legal importante se debe revisar la edición oficial y, cuando corresponda, el expediente completo.
GovInfo
GovInfo complementa ese material con publicaciones gubernamentales autenticadas, documentos legislativos, leyes, informes y paquetes históricos. Su conector figura en el registro, pero viene deshabilitado hasta que el operador agregue una clave y defina colecciones acotadas. Deben usarse recuperaciones desde la última modificación, conservar identificadores y respetar instrucciones de reintento sin insinuar respaldo gubernamental.
5. Seguir el dinero
USAspending.gov
Los registros de compra suelen revelar un sistema con más claridad que la publicidad o el código fuente. Un contrato puede identificar comprador, destinatario, monto, alcance, fechas, modificaciones y ruta financiera. USAspending.gov se usa con combinaciones acotadas de términos como vigilancia, reconocimiento facial, inteligencia artificial y análisis de datos dentro de una ventana temporal limitada.
Una adjudicación es evidencia fuerte de que se reportó un premio. No demuestra que cada capacidad descrita se entregara, que la tecnología se usara contra una persona específica o que el despliegue fuera legal. Esas preguntas requieren la solicitud de propuestas, declaración de trabajo, facturas, evaluación de privacidad, pruebas, aceptación, registros de acceso y reglas de eliminación.
El flujo más útil combina fuentes: la adjudicación identifica agencia y número; una solicitud de registros pide entonces la licitación, oferta, contrato, enmiendas, entregables, validaciones, intercambio de datos, revisiones de seguridad y disposiciones de terminación. Así una preocupación amplia se convierte en una ruta documental precisa.
6. Infraestructura de acceso a registros
FOIA.gov
FOIA.gov ofrece información oficial sobre componentes federales e informes anuales. El conector está deshabilitado de forma predeterminada porque requiere una clave aportada por el operador. Al habilitarlo, debe recopilar metadatos acotados o informes seleccionados, no duplicar el servicio. Las métricas útiles incluyen atrasos, tiempos de trámite, disposiciones y estructura de la oficina responsable.
MuckRock y DocumentCloud
MuckRock y DocumentCloud son ecosistemas valiosos para descubrir solicitudes, respuestas y documentos. Los registros públicos pueden revelar redacción previa, patrones de respuesta, exenciones y archivos divulgados. DocumentCloud puede convertir escaneos en texto buscable. Antes de cualquier automatización deben revisarse términos, controles, límites, permisos y derechos de autor. Esta versión no habilita conectores automáticos para esos servicios.
Una solicitud técnicamente informada puede pedir no solo los documentos finales, sino también instrucciones de búsqueda, custodios, registros de exportación y redacción, deduplicación y documentación del software usado. Esos registros ayudan a evaluar si la búsqueda institucional fue adecuada.
7. Inteligencia narrativa sin rastreo conductual
Los registros oficiales suelen llegar después del inicio del debate. Las fuentes narrativas ayudan a identificar qué merece una investigación documental. La versión inicial admite RSS o Atom oficiales de Electronic Frontier Foundation y Electronic Privacy Information Center. Sus elementos se clasifican como periodismo acreditado o análisis experto, no como registros oficiales. Su valor está en el descubrimiento, contexto jurídico y enlaces a documentos más fuertes.
El servidor conserva título, resumen, fecha, autor cuando exista, idioma y enlace canónico. Elimina marcado activo y no incrusta la página externa. La interfaz en español puede ofrecer orientación redactada por el proyecto para elementos internos, pero los títulos externos permanecen en su idioma de origen salvo que se agregue una traducción revisada por una persona.
8. Corredores de datos e incidentes de IA
Registros estatales de corredores, páginas de cumplimiento, evaluaciones de privacidad, inventarios algorítmicos, auditorías y repositorios de incidentes pueden revelar partes distintas del mismo sistema. Un registro establece inscripción o prácticas autodeclaradas. Una acción de cumplimiento establece una alegación, acuerdo u orden. Una base de incidentes identifica patrones y pistas, pero debe seguirse hasta el periodismo, expediente, auditoría o registro original.
Los conectores futuros deben preferir descargas estáticas o deltas pequeños. Comparar jurisdicciones puede ser útil, pero la ausencia de una empresa en una lista no demuestra automáticamente incumplimiento. Cambian definiciones, excepciones, fechas, nombres corporativos y modelos de negocio. Una conclusión sobre registro faltante debe etiquetarse como inferencia hasta confirmar la obligación legal y la identidad de la entidad.
El aprendizaje automático puede ayudar internamente con clasificación, borradores de traducción, detección de duplicados y comparaciones. Nunca debe convertirse en autoridad citada. La revisión humana conserva la responsabilidad final de la ruta de fuentes.
9. Integración epistemológica
El escritorio usa una Escalera de Evidencia de ocho niveles. Fuentes primarias y registros oficiales ocupan los puestos más fuertes. Registros desclasificados y expedientes judiciales siguen siendo sólidos, pero sus redacciones, fecha, alcance, postura adversarial y estado procesal deben permanecer visibles. El periodismo y análisis experto aportan contexto. Los relatos directos requieren cuidado y corroboración. Las afirmaciones no verificadas pueden orientar investigación interna, pero no se publican como hechos.
La confianza se registra por separado. Un registro oficial puede estar desactualizado, incompleto o disputado. Un análisis puede quedar corroborado por varios documentos. Todo hallazgo debe responder: qué establece la evidencia, qué no establece y qué nuevo registro cambiaría la conclusión.
10. Plano de despliegue en alojamiento PHP
El paquete está diseñado para PHP 8.1 o posterior. No usa base de datos ni gestor de paquetes en ejecución. La raíz contiene páginas PHP, CSS y JavaScript locales, informes, una fuente semilla y directorios de caché y registros con permiso de escritura. Una tarea ejecuta php cron/refresh.php. Los hosts sin cron de comandos pueden habilitar una invocación web protegida por token en la configuración local, aunque la ejecución por comandos es más segura.
Los secretos se guardan en includes/config.local.php, excluido inicialmente y bloqueado para acceso web. Las API públicas exponen solo la fuente local normalizada y estado no sensible. La Política de Seguridad de Contenido permite recursos únicamente del mismo origen y bloquea marcos, complementos, fuentes externas y conexiones del navegador a terceros.
11. Norma editorial
- Usar interfaces públicas documentadas y respetar límites y términos.
- Conservar identidad de fuente, fechas, enlaces y transformaciones.
- Clasificar el documento subyacente, no solo la página que lo menciona.
- Minimizar datos de terceros antes de publicar.
- Separar hecho, inferencia, disputa e incertidumbre.
- No usar el interés público para justificar acceso no autorizado, evasión, suplantación, doxxing o acoso.
- Mantener una ruta de corrección y derecho de respuesta.
Interfaces seleccionadas
La documentación debe volver a revisarse antes de modificar conectores: Federal Register API; USAspending API; FOIA.gov; GovInfo; fuentes EFF; fuente EPIC.