Microsoft Foundry ahora ofrece un catálogo seleccionado de modelos de Hugging Face, desplegables en Managed Compute con seguridad, gobernanza y observabilidad de nivel empresarial. La colección se actualiza semanalmente y los modelos se pueden implementar con un solo clic en Foundry Managed Compute. Los pesos están prealmacenados en Azure, los entornos de ejecución son creados y escaneados por Microsoft, y cada modelo de la colección tiene la misma seguridad empresarial, gobernanza, observabilidad y facturación que se aplica a cualquier otro modelo en Foundry.

Microsoft Foundry y Managed Compute

Microsoft Foundry es una plataforma para construir y operar aplicaciones de IA agéntica. Ofrece la selección de modelos más amplia en cualquier nube: modelos de Microsoft, OpenAI, Anthropic, Meta, Mistral, DeepSeek, Hugging Face y otros, todos accesibles a través de un único endpoint y SDK en Python, C#, JavaScript y Java.

Sobre esos modelos se encuentra el Servicio de Agentes de Foundry: orquestación multiagente con memoria integrada, anclaje de conocimiento a través de Foundry IQ y un catálogo de herramientas conectables. Foundry proporciona trazado de extremo a extremo, monitoreo en tiempo real, evaluaciones continuas y un optimizador de prompts que mejora el comportamiento del agente basado en los resultados de la evaluación.

Los desarrolladores también obtienen acceso a:

  • Filtros de seguridad de contenido

  • Guardarraíles de adherencia a tareas

  • Un Agente de Red Teaming de IA para pruebas adversariales

  • RBAC unificado

  • Redes privadas

  • Integración con Azure Policy directamente dentro de la plataforma

Foundry Managed Compute es la tercera opción de despliegue, junto con pago por token y rendimiento aprovisionado. Es una plataforma como servicio de GPU gestionada para modelos de código abierto y personalizados. Despliegas una instancia de modelo descrita por número de parámetros, longitud de contexto y optimización de latencia o rendimiento, y Foundry maneja la topología de GPU subyacente. Microsoft se encarga de las actualizaciones de contenedores, las mejoras del entorno de ejecución y los parches de seguridad automáticamente en los entornos de ejecución compatibles (vLLM, SGLang, TensorRT-LLM, NIM, TEI, llama.cpp) sin necesidad de redeployar tu modelo.

Pago por token, rendimiento aprovisionado y Managed Compute comparten un único endpoint, los mismos SDK, la misma autenticación, la misma observabilidad y una sola factura. Los modelos de código abierto se integran con Foundry Agents de la misma manera que los modelos frontera. Managed Compute ofrece despliegues globales para la mayor capacidad y los mejores precios, y despliegues en Zonas de Datos para residencia y soberanía de datos.

Por qué Hugging Face

Hugging Face es la plaza pública de la IA abierta: 15 millones de desarrolladores, 400,000 organizaciones y más de 3 millones de modelos abiertos publicados. Nuevas capacidades frontera — codificación agéntica, segmentación de video, voz, embeddings — llegan cada semana. Los modelos abiertos han cerrado la brecha con los modelos propietarios en benchmark tras benchmark, y desbloquean capacidades que los endpoints propietarios no pueden:

  • El estado del arte ahora es abierto. Los principales modelos de pesos abiertos compiten con los mejores modelos frontera cerrados en benchmarks ampliamente utilizados.

  • Personalización profunda. Los pesos completos permiten fine-tuning, destilación, cuantización y adaptación LoRA.

  • Tu modelo, tu alojamiento. Los pesos se ejecutan en tu tenant sobre infraestructura que controlas.

  • Control de costos. Pagas por aceleradores por hora, escala a cero cuando está inactivo y dimensionas las GPU correctamente.

  • Control de versiones. Fija una versión específica del modelo, evalúa, despliega y revierte en tu propio ritmo de lanzamiento.

El problema siempre ha sido la capa operativa: descubrimiento, revisión de licencias, cribado de seguridad, selección del entorno de ejecución, dimensionamiento de GPU, construcción de imágenes, parches de CVE y poner el modelo en funcionamiento detrás de un endpoint de nivel empresarial. Hugging Face por sí solo no es una plataforma de servicio empresarial.

Los modelos de Hugging Face en Foundry son esa capa operativa, gestionada por Microsoft.

Modelos de Hugging Face en Foundry

La Colección Hugging Face trae un subconjunto seleccionado de modelos directamente al Catálogo de Modelos de Foundry:

  • Actualizada semanalmente — se añaden modelos populares continuamente a medida que la comunidad los publica.

  • Todas las modalidades — texto, visión, audio y multimodal: LLMs, VLMs, ASR, traducción de voz, embeddings, segmentación, generación de imágenes.

  • Solo SafeTensors, sin código no confiable — cada modelo es examinado por seguridad y se distribuye en formato de pesos SafeTensors, sin rutas de ejecución trust_remote_code a menos que se revisen rigurosamente.

  • El entorno de ejecución adecuado para el modelo — vLLM y SGLang para LLMs, TensorRT-LLM y NIM cuando corresponda, TEI para embeddings, llama.cpp para CPU.

Desde tu lado, un modelo de pesos abiertos en la Colección Hugging Face se ve y se comporta como cualquier otro modelo en el Catálogo de Modelos de Foundry. Cada modelo pasa por un pipeline de publicación de varias etapas antes de aparecer allí.

El Pipeline de Curación

Hugging Face y Microsoft trabajan juntos para llevar los modelos de pesos abiertos más populares a Microsoft Foundry, listos para producción en entornos empresariales, a través de un proceso de curación sistemático:

  • Identificar modelos populares en el ecosistema de Hugging Face basándose en señales de la comunidad, solicitudes de socios y demanda de clientes.

  • Examinar cumplimiento y seguridad — las licencias de los modelos se revisan según la política de distribución empresarial de Microsoft, y los repositorios se inspeccionan en busca de patrones trust_remote_code y código ejecutable personalizado.

  • Construir, escanear y publicar entornos de ejecución — Microsoft construye imágenes de contenedor de inferencia en entornos de ejecución compatibles, las escanea en busca de vulnerabilidades y las publica como ofertas listas para implementar.

Este pipeline garantiza que cada modelo en la Colección Hugging Face cumpla con los estándares empresariales de seguridad, licencias y rendimiento. A medida que el ecosistema de IA de código abierto continúa evolucionando, Microsoft y Hugging Face mantendrán la colección actualizada con las últimas innovaciones de la comunidad, brindando a los desarrolladores un camino confiable desde la experimentación hasta la producción.