Infrastruktura AI i LLMOps

LLMOps

Model językowy na produkcji jest zależnością, której Państwo nie kontrolują, rozliczaną za użycie i zmieniającą zachowanie poza Państwa cyklem wydań. Budujemy wdrażanie, ewaluację, monitorowanie i kontrolę kosztów, które czynią to zarządzalnym.

Problem biznesowy

Jakość dryfuje, a nikt nie patrzy

Klasyczne monitorowanie odpowiada na pytanie, czy usługa odpowiedziała, a nie czy odpowiedź była dobra. Jakość pogarsza się więc niewidocznie: dostawca aktualizuje model, zmiana instrukcji ma efekt uboczny, wyszukiwanie się dezaktualizuje. Pierwszym sygnałem jest zwykle skarga klienta. Koszt zawodzi tak samo, przychodząc jako zaskakująca faktura bez przypisania do funkcji, która go wywołała.

Czym się zajmujemy

Traktować jakość i koszt jako pełnoprawne sygnały

Umieszczamy zestaw ewaluacyjny w procesie wdrożeniowym, więc zmiana instrukcji lub modelu jest oceniana przed wdrożeniem i stale po nim. Instrukcje są wersjonowane jak kod. Ślady rejestrują wejścia, pobrany kontekst, wywołania narzędzi i wyniki, więc każdą odpowiedź da się odtworzyć. Koszt jest przypisywany do funkcji i zespołu, a routing kieruje rutynowy ruch do tańszych modeli i eskaluje tylko to, co tego wymaga.

LLMOps

Kompetencje

  • Wdrażanie LLM

  • Monitorowanie LLM

  • Potoki ewaluacyjne

  • Zarządzanie instrukcjami

  • Obserwowalność

  • Routing

  • Monitorowanie kosztów

Typowe zastosowania

Typowe zastosowania

  • Dodanie bramek ewaluacyjnych, aby zmiana instrukcji nie mogła trafić na produkcję bez oceny.
  • Przypisanie wydatków na wnioskowanie do funkcji i zespołu, które je powodują.
  • Wykrycie regresji jakości po aktualizacji modelu przez dostawcę.
  • Obniżenie kosztów przez kierowanie rutynowego ruchu do mniejszego modelu z eskalacją.

Jak realizujemy projekty

Jak realizujemy projekty

  1. Ocena

    Ustalenie ograniczeń: rezydencji danych, opóźnień, budżetu i tego, co już działa.

  2. Architektura

    Zaprojektowanie bramy, routingu, pamięci podręcznej i przełączania awaryjnego tak, aby wybór dostawcy pozostał odwracalny.

  3. Oprzyrządowanie

    Obserwowalność, ewaluacja i przypisanie kosztów podłączone, zanim pojawi się ruch.

  4. Eksploatacja

    Praca zgodnie z uzgodnionymi poziomami usług, z cyklicznym przeglądem wydajności i wydatków.

Technologia

Technologia

  • Kubernetes
  • Terraform
  • vLLM
  • Ollama
  • LiteLLM
  • OpenTelemetry
  • Prometheus
  • Grafana
  • AWS
  • Microsoft Azure

Bezpieczeństwo i nadzór

Bezpieczeństwo i ład

To, gdzie dane mogą być przetwarzane, jest kwestią konfiguracji, a nie założenia: modele mogą działać we własnej dzierżawie chmurowej lub na Państwa własnym sprzęcie, jeśli wymaga tego rezydencja lub izolacja. Ruch przechodzący przez bramę jest uwierzytelniany, przypisywany do zespołu i rejestrowany, co umożliwia zarówno ścieżkę audytu, jak i model kosztowy.

Modele współpracy

Modele współpracy

Projekt AI

Bierzemy odpowiedzialność za zaprojektowanie i dostarczenie określonego rozwiązania AI.

Dedykowany zespół AI

Długoterminowe, dedykowane zasoby inżynierskie zbudowane wokół Państwa technologii i modelu dostarczania.

Zarządzana AI

Prowadzimy, monitorujemy i stale ulepszamy produkcyjne systemy AI.

Dlaczego TeamExtension.ai

Traktujemy ewaluację jako bramkę wydania

Większość zespołów ocenia raz przed startem, a potem polega na skargach. Ciągła ewaluacja na oznaczonym zbiorze to różnica między wiedzą o jakości a nadzieją. To także jedyny sposób, by aktualizacja modelu stała się rutyną, a nie powodem do obaw.

Wybrani klienci

Najczęstsze pytania

Najczęstsze pytania

Jak ocenić coś, co nie ma jednej poprawnej odpowiedzi?
Kryteriami, a nie dokładnym dopasowaniem: czy było osadzone w pobranym źródle, czy odpowiadało na zadane pytanie, czy uniknęło twierdzeń bez pokrycia. Ocenia to model według rubryki, z wyrywkowym przeglądem ludzkim, aby oceniający pozostał uczciwy.
Ile kosztuje ta obserwowalność?
Zauważalnie mniej niż wydatki, których pozwala uniknąć. Samo przypisanie kosztów zwykle znajduje w pierwszym miesiącu dwucyfrowy procent marnotrawstwa, najczęściej z instrukcji przesyłających więcej kontekstu, niż trzeba.
Czy da się to dołożyć do systemów już działających?
Tak i jest to typowy przypadek. Najpierw wchodzi oprzyrządowanie, które zwykle ujawnia obraz jakości i kosztów, jakiego nikt nie miał, a potem dochodzi ewaluacja i routing.
Jakich narzędzi używacie?
OpenTelemetry do śledzenia, aby dane pozostały Państwa, z Państwa obecnym stosem obserwowalności jako miejscem docelowym. Unikamy platform, które przetrzymują Państwa ślady u siebie.

Omów swoją inicjatywę AI

Wdrażanie, monitorowanie, ewaluacja i kontrola kosztów modeli językowych, gdy obsługują już realny ruch.