Microsoft Foundry oferuje teraz wyselekcjonowany katalog modeli Hugging Face, które można wdrożyć na Managed Compute z bezpieczeństwem, zarządzaniem i obserwowalnością na poziomie korporacyjnym. Kolekcja jest odświeżana co tydzień, a modele można wdrożyć jednym kliknięciem na Foundry Managed Compute. Wagi są wstępnie umieszczone na platformie Azure, środowiska uruchomieniowe są budowane i skanowane przez Microsoft, a każdy model w kolekcji ma takie samo bezpieczeństwo, zarządzanie, obserwowalność i rozliczenia, jak każdy inny model na Foundry.

Microsoft Foundry i Managed Compute

Microsoft Foundry to platforma do budowania i uruchamiania agentowych aplikacji AI. Oferuje najszerszy wybór modeli w chmurze — modele od Microsoft, OpenAI, Anthropic, Meta, Mistral, DeepSeek, Hugging Face i innych — wszystkie dostępne przez jeden punkt końcowy i zestawy SDK w Pythonie, C#, JavaScript i Javie.

Na tych modelach opiera się Foundry Agent Service: wieloagentowa orkiestracja z wbudowaną pamięcią, ugruntowaniem wiedzy przez Foundry IQ oraz katalogiem narzędzi do podłączania. Foundry zapewnia kompleksowe śledzenie, monitorowanie w czasie rzeczywistym, ciągłe oceny i optymalizator promptów, który poprawia zachowanie agenta na podstawie wyników ocen.

Deweloperzy mają również dostęp do:

  • Filtrów bezpieczeństwa treści

  • Barier zgodności z zadaniami

  • Agenta AI Red Teaming do testów adversarialnych

  • Ujednoliconego RBAC

  • Prywatnej sieci

  • Integracji Azure Policy bezpośrednio w platformie

Foundry Managed Compute to trzecia opcja wdrożenia, obok płatności za token i przepustowości z rezerwacją. To zarządzana platforma GPU jako usługa dla modeli open-source i niestandardowych. Wdrażasz instancję modelu opisaną przez liczbę parametrów, długość kontekstu oraz optymalizację opóźnienia lub przepustowości, a Foundry zarządza topologią GPU pod spodem. Microsoft zajmuje się aktualizacjami kontenerów, uaktualnieniami środowiska uruchomieniowego i łatkami bezpieczeństwa automatycznie dla obsługiwanych środowisk — vLLM, SGLang, TensorRT-LLM, NIM, TEI, llama.cpp — bez ponownego wdrażania modelu.

Płatność za token, przepustowość z rezerwacją i Managed Compute współdzielą jeden punkt końcowy, te same zestawy SDK, to samo uwierzytelnianie, tę samą obserwowalność i jeden rachunek. Modele open-source integrują się z Foundry Agents w taki sam sposób, jak modele graniczne. Managed Compute oferuje globalne wdrożenia dla najszerszej pojemności i najlepszych cen oraz wdrożenia w strefach danych dla rezydencji i suwerenności danych.

Dlaczego Hugging Face

Hugging Face to publiczny plac otwartej AI: 15 milionów twórców, 400 000 organizacji i ponad 3 miliony opublikowanych otwartych modeli. Co tydzień pojawiają się nowe możliwości graniczne — kodowanie agentowe, segmentacja wideo, mowa, osadzenia. Otwarte modele zamknęły lukę w stosunku do zastrzeżonych modeli w kolejnych benchmarkach i odblokowują możliwości, których zastrzeżone punkty końcowe nie mogą zapewnić:

  • Najnowocześniejsze jest teraz otwarte. Wiodące modele z otwartymi wagami konkurują z najlepszymi zamkniętymi modelami granicznymi w powszechnie używanych benchmarkach.

  • Głęboka personalizacja. Pełne wagi umożliwiają dostrajanie, destylację, kwantyzację i adaptację LoRA.

  • Twój model, Twój hosting. Wagi działają w Twojej dzierżawie na infrastrukturze, którą kontrolujesz.

  • Kształtowanie kosztów. Płać za akceleratory za godzinę, skaluj do zera, gdy są bezczynne, i dobieraj odpowiednie GPU.

  • Kontrola wersji. Przypnij konkretną wersję modelu, oceń, wdróż i wycofaj we własnym tempie wydań.

Haczyk zawsze leżał w warstwie operacyjnej: odkrywanie, przegląd licencji, kontrola bezpieczeństwa, wybór środowiska uruchomieniowego, dobór GPU, budowanie obrazów, łatanie CVE i uruchomienie modelu za korporacyjnym punktem końcowym. Sam Hugging Face nie jest korporacyjną platformą serwującą.

Modele Hugging Face na Foundry to ta warstwa operacyjna, zarządzana przez Microsoft.

Modele Hugging Face na Foundry

Kolekcja Hugging Face wprowadza wyselekcjonowany podzbiór modeli bezpośrednio do katalogu modeli Foundry:

  • Odświeżana co tydzień — popularne modele są dodawane na bieżąco, gdy społeczność je publikuje.

  • Każda modalność — tekst, obraz, dźwięk i multimodalne: LLM, VLM, ASR, tłumaczenie mowy, osadzenia, segmentacja, generowanie obrazów.

  • Tylko Safetensors, bez niezaufanego kodu — każdy model jest sprawdzany pod kątem bezpieczeństwa i dostarczany w formacie wag SafeTensors, bez ścieżek wykonania trust_remote_code, chyba że zostały rygorystycznie przejrzane.

  • Odpowiednie środowisko uruchomieniowe dla modelu — vLLM i SGLang dla LLM, TensorRT-LLM i NIM tam, gdzie to stosowne, TEI dla osadzeń, llama.cpp dla CPU.

Z Twojej strony model z otwartymi wagami w kolekcji Hugging Face wygląda i zachowuje się jak każdy inny model w katalogu modeli Foundry. Każdy model przechodzi wieloetapowy proces publikacji, zanim się tam pojawi.

Proces selekcji

Hugging Face i Microsoft współpracują, aby dostarczyć najpopularniejsze modele z otwartymi wagami do Microsoft Foundry — gotowe do produkcji w środowiskach korporacyjnych — poprzez systematyczny proces selekcji:

  • Identyfikacja popularnych modeli w ekosystemie Hugging Face na podstawie sygnałów społeczności, próśb partnerów i zapotrzebowania klientów.

  • Sprawdzanie zgodności i bezpieczeństwa — licencje modeli są przeglądane pod kątem polityki dystrybucji korporacyjnej Microsoft, a repozytoria są sprawdzane pod kątem wzorców trust_remote_code i niestandardowego kodu wykonywalnego.

  • Budowanie, skanowanie i publikowanie środowisk uruchomieniowych — Microsoft buduje obrazy kontenerów inferencyjnych na obsługiwanych środowiskach, skanuje je pod kątem podatności i publikuje jako gotowe do wdrożenia oferty.

Ten proces zapewnia, że każdy model w kolekcji Hugging Face spełnia korporacyjne standardy bezpieczeństwa, licencjonowania i wydajności. W miarę ewolucji ekosystemu open-source AI, Microsoft i Hugging Face będą aktualizować kolekcję o najnowsze innowacje społeczności, dając deweloperom zaufaną ścieżkę od eksperymentów do produkcji.