A Microsoft Foundry agora oferece um catálogo selecionado de modelos do Hugging Face, implantáveis no Managed Compute com segurança, governança e observabilidade de nível empresarial. A coleção é atualizada semanalmente, e os modelos podem ser implantados com um clique no Foundry Managed Compute. Os pesos são pré-armazenados no Azure, os runtimes são construídos e verificados pela Microsoft, e cada modelo da coleção carrega a mesma segurança empresarial, governança, observabilidade e faturamento que se aplica a qualquer outro modelo no Foundry.
Microsoft Foundry e Managed Compute
O Microsoft Foundry é uma plataforma para construir e operar aplicações de IA agentivas. Oferece a mais ampla seleção de modelos em qualquer nuvem — modelos da Microsoft, OpenAI, Anthropic, Meta, Mistral, DeepSeek, Hugging Face e outros — todos acessíveis por meio de um único endpoint e SDKs em Python, C#, JavaScript e Java.
Sobre esses modelos está o Foundry Agent Service: orquestração multiagente com memória integrada, fundamentação de conhecimento através do Foundry IQ e um catálogo de ferramentas conectáveis. O Foundry fornece rastreamento de ponta a ponta, monitoramento em tempo real, avaliações contínuas e um otimizador de prompts que melhora o comportamento do agente com base nos resultados das avaliações.
Os desenvolvedores também têm acesso a:
Filtros de segurança de conteúdo
Guardrails de adesão a tarefas
Um AI Red Teaming Agent para testes adversariais
RBAC unificado
Rede privada
Integração com Azure Policy diretamente na plataforma
O Foundry Managed Compute é a terceira opção de implantação, ao lado de pagamento por token e throughput provisionado. É uma plataforma gerenciada de GPU como serviço para modelos open-source e personalizados. Você implanta uma instância de modelo descrita por número de parâmetros, comprimento de contexto e otimização de latência ou throughput, e o Foundry lida com a topologia de GPU subjacente. A Microsoft cuida das atualizações de contêiner, upgrades de runtime e patches de segurança automaticamente em runtimes suportados — vLLM, SGLang, TensorRT-LLM, NIM, TEI, llama.cpp — sem precisar reimplantar seu modelo.
Pagamento por token, throughput provisionado e Managed Compute compartilham um único endpoint, os mesmos SDKs, a mesma autenticação, a mesma observabilidade e uma única fatura. Modelos open-source integram-se com o Foundry Agents da mesma forma que os modelos de fronteira. O Managed Compute oferece implantações globais para maior capacidade e melhores preços, e implantações em Data Zone para residência e soberania de dados.
Por que Hugging Face
O Hugging Face é a praça pública da IA aberta: 15 milhões de construtores, 400.000 organizações e mais de 3 milhões de modelos abertos publicados. Novas capacidades de fronteira — codificação agentiva, segmentação de vídeo, fala, embeddings — chegam semanalmente. Modelos abertos reduziram a diferença com modelos proprietários em benchmark após benchmark, e desbloqueiam capacidades que endpoints proprietários não conseguem:
Estado da arte agora é aberto. Modelos de peso aberto líderes são competitivos com os melhores modelos fechados de fronteira em benchmarks amplamente utilizados.
Personalização profunda. Pesos completos permitem fine-tuning, destilação, quantização e adaptação LoRA.
Seu modelo, sua hospedagem. Os pesos rodam em seu tenant na infraestrutura que você controla.
Modelagem de custos. Pague por aceleradores por hora, reduza a zero quando ocioso e dimensione GPUs corretamente.
Controle de versão. Fixe uma versão específica do modelo, avalie, implante e reverta em seu próprio ritmo de lançamento.
A desvantagem sempre foi a camada operacional: descoberta, revisão de licença, triagem de segurança, seleção de runtime, dimensionamento de GPU, construção de imagem, correção de CVEs e colocar o modelo em funcionamento por trás de um endpoint de nível empresarial. O Hugging Face por si só não é uma plataforma de serviço empresarial.
Modelos Hugging Face no Foundry é essa camada operacional, gerenciada pela Microsoft.
Modelos Hugging Face no Foundry
A Hugging Face Collection traz um subconjunto selecionado de modelos diretamente para o Foundry Model Catalog:
Atualizada semanalmente — modelos em tendência são adicionados continuamente à medida que a comunidade os publica.
Todas as modalidades — texto, visão, áudio e multimodal: LLMs, VLMs, ASR, tradução de fala, embeddings, segmentação, geração de imagens.
Apenas Safetensors, sem código não confiável — cada modelo passa por triagem de segurança e é enviado no formato de peso SafeTensors, sem caminhos de execução trust_remote_code, a menos que rigorosamente revisados.
O runtime certo para o modelo — vLLM e SGLang para LLMs, TensorRT-LLM e NIM quando aplicável, TEI para embeddings, llama.cpp para CPU.
Do seu lado, um modelo de peso aberto na Hugging Face Collection se parece e se comporta como qualquer outro modelo no Foundry Model Catalog. Cada modelo passa por um pipeline de publicação em várias etapas antes de aparecer lá.
O Pipeline de Curadoria
Hugging Face e Microsoft trabalham juntos para trazer os modelos de peso aberto mais populares para o Microsoft Foundry — prontos para produção em ambientes empresariais — por meio de um processo sistemático de curadoria:
Identificar modelos em tendência no ecossistema Hugging Face com base em sinais da comunidade, solicitações de parceiros e demanda dos clientes.
Triagem de conformidade e segurança — as licenças dos modelos são revisadas de acordo com a política de distribuição empresarial da Microsoft, e os repositórios são inspecionados quanto a padrões trust_remote_code e código executável personalizado.
Construir, verificar e publicar runtimes — a Microsoft constrói imagens de contêiner de inferência em runtimes suportados, verifica vulnerabilidades e as publica como ofertas prontas para implantação.
Este pipeline garante que cada modelo na Hugging Face Collection atenda aos padrões empresariais de segurança, licenciamento e desempenho. À medida que o ecossistema de IA de código aberto continua a evoluir, a Microsoft e o Hugging Face manterão a coleção atualizada com as mais recentes inovações da comunidade, oferecendo aos desenvolvedores um caminho confiável da experimentação à produção.



