Microsoft Foundry nyní nabízí kurátorský katalog modelů z Hugging Face, které lze nasadit na Managed Compute s podnikovou úrovní zabezpečení, správy a monitorování. Kolekce se aktualizuje týdně a modely lze nasadit jedním kliknutím na Foundry Managed Compute. Váhy jsou předem uloženy v Azure, runtime jsou sestaveny a prověřeny Microsoftem a každý model v kolekci nese stejné podnikové zabezpečení, správu, monitorování a fakturaci, která platí pro všechny ostatní modely na Foundry.

Microsoft Foundry a Managed Compute

Microsoft Foundry je platforma pro vytváření a provoz agentických AI aplikací. Nabízí nejširší výběr modelů na jakémkoli cloudu – modely od Microsoftu, OpenAI, Anthropic, Meta, Mistral, DeepSeek, Hugging Face a dalších – všechny přístupné přes jediný koncový bod a SDK v Pythonu, C#, JavaScriptu a Javě.

Na těchto modelech stojí Foundry Agent Service: multiagentová orchestrace s vestavěnou pamětí, znalostním ukotvením přes Foundry IQ a katalogem připojitelných nástrojů. Foundry poskytuje end-to-end trasování, monitorování v reálném čase, průběžné vyhodnocování a optimalizátor promptů, který zlepšuje chování agenta na základě výsledků vyhodnocení.

Vývojáři také získávají přístup k:

  • Bezpečnostním filtrům obsahu

  • Ochranám pro dodržování úkolů

  • AI Red Teaming Agentu pro adversariální testování

  • Jednotnému RBAC

  • Soukromému síťování

  • Integraci Azure Policy přímo v rámci platformy

Foundry Managed Compute je třetí možnost nasazení, vedle pay-per-token a provisioned throughput. Jedná se o spravovanou GPU platformu jako službu pro open-source a vlastní modely. Nasadíte instanci modelu popsanou počtem parametrů, délkou kontextu a optimalizací latence nebo propustnosti a Foundry se postará o GPU topologii pod kapotou. Microsoft se stará o aktualizace kontejnerů, upgrade runtime a bezpečnostní záplaty automaticky na podporovaných runtime – vLLM, SGLang, TensorRT-LLM, NIM, TEI, llama.cpp – bez nutnosti znovu nasazovat model.

Pay-per-token, provisioned throughput a Managed Compute sdílejí jediný koncový bod, stejná SDK, stejné ověřování, stejné monitorování a jedinou fakturu. Open-source modely se integrují s Foundry Agents stejně jako modely na hranici možností. Managed Compute nabízí globální nasazení pro nejširší kapacitu a nejlepší ceny a nasazení v Data Zone pro datovou rezidenci a suverenitu.

Proč Hugging Face

Hugging Face je veřejné náměstí otevřené AI: 15 milionů vývojářů, 400 000 organizací a přes 3 miliony publikovaných otevřených modelů. Nové schopnosti na hranici možností – agentické kódování, segmentace videa, řeč, embeddingy – přicházejí týdně. Otevřené modely uzavřely mezeru s proprietárními modely v benchmarku za benchmarkem a odemykají schopnosti, které proprietární koncové body nemohou:

  • Nejnovější technologie je nyní otevřená. Přední modely s otevřenými váhami jsou konkurenceschopné s nejlepšími uzavřenými modely na široce používaných benchmarcích.

  • Hluboká customizace. Plné váhy umožňují fine-tuning, destilaci, kvantizaci a adaptaci LoRA.

  • Váš model, váš hosting. Váhy běží ve vašem tenantovi na infrastruktuře, kterou ovládáte.

  • Tvarování nákladů. Platíte za akcelerátory po hodině, škálujete na nulu při nečinnosti a správně dimenzujete GPU.

  • Správa verzí. Uzamknete konkrétní verzi modelu, vyhodnotíte, nasadíte a vrátíte se zpět podle vlastního plánu vydávání.

Kamenem úrazu byla vždy provozní vrstva: objevování, kontrola licencí, bezpečnostní prověřování, výběr runtime, dimenzování GPU, sestavování obrazů, opravy CVE a postavení modelu za podnikový koncový bod. Hugging Face sám o sobě není podniková servírovací platforma.

Hugging Face modely na Foundry jsou právě tou provozní vrstvou, kterou provozuje Microsoft.

Hugging Face modely na Foundry

Hugging Face Collection přináší kurátorskou podmnožinu modelů přímo do Foundry Model Catalog:

  • Týdně aktualizováno – trendy modely jsou průběžně přidávány, jak je komunita publikuje.

  • Všechny modality – text, vidění, audio a multimodální: LLM, VLM, ASR, překlad řeči, embeddingy, segmentace, generování obrazu.

  • Pouze SafeTensors, žádný nedůvěryhodný kód – každý model je bezpečnostně prověřen a dodáván ve formátu vah SafeTensors, bez cest trust_remote_code, pokud nejsou důkladně prověřeny.

  • Správný runtime pro model – vLLM a SGLang pro LLM, TensorRT-LLM a NIM tam, kde je to vhodné, TEI pro embeddingy, llama.cpp pro CPU.

Z vaší strany vypadá a chová se model s otevřenými váhami v Hugging Face Collection jako jakýkoli jiný model v Foundry Model Catalog. Každý model prošel vícestupňovým publikačním pipeline, než se tam vůbec objeví.

Kurátorský pipeline

Hugging Face a Microsoft spolupracují na tom, aby přinesli nejoblíbenější modely s otevřenými váhami do Microsoft Foundry – připravené k produkčnímu nasazení v podnikovém prostředí – prostřednictvím systematického kurátorského procesu:

  • Identifikace trendových modelů v ekosystému Hugging Face na základě signálů komunity, požadavků partnerů a poptávky zákazníků.

  • Prověření shody a bezpečnosti – licence modelů jsou přezkoumány podle podnikové distribuční politiky Microsoftu a repozitáře jsou kontrolovány na vzory trust_remote_code a vlastní spustitelný kód.

  • Sestavení, prověření a publikování runtime – Microsoft sestavuje kontejnerové obrazy pro inferenci na podporovaných runtime, prověřuje je na zranitelnosti a publikuje je jako připravené k nasazení.

Tento pipeline zajišťuje, že každý model v Hugging Face Collection splňuje podnikové standardy pro bezpečnost, licencování a výkon. Jak se open-source AI ekosystém dále vyvíjí, Microsoft a Hugging Face budou kolekci aktualizovat o nejnovější komunitní inovace, což vývojářům poskytne důvěryhodnou cestu od experimentování k produkci.