Infraestrutura de IA e LLMOps

LLMOps

Um modelo de linguagem em produção é uma dependência que não controla, tarifada ao uso, cujo comportamento muda à margem do seu ciclo de lançamento. Construímos a implementação, a avaliação, a vigilância e o controlo de custo que tornam isso gerível.

O problema de negócio

A qualidade desvia-se e ninguém está a olhar

A vigilância tradicional responde se o serviço respondeu, não se a resposta prestava. Por isso a qualidade degrada-se de forma invisível: um fornecedor atualiza um modelo, uma alteração de prompt tem um efeito lateral, a recuperação fica desatualizada. O primeiro sinal costuma ser uma reclamação de um cliente. Com o custo passa-se o mesmo: chega como uma fatura surpresa, sem atribuição à funcionalidade que o causou.

O que fazemos

Instrumentar qualidade e custo como sinais de primeira ordem

Colocamos um conjunto de avaliação na cadeia de implementação, de modo que uma alteração de prompt ou de modelo seja pontuada antes de entrar e de forma contínua depois. Os prompts são versionados como código. Os rastos capturam entradas, contexto recuperado, chamadas a ferramentas e saídas, para que qualquer resposta possa ser reconstruída. O custo é atribuído por funcionalidade e por equipa, com encaminhamento que envia o tráfego corrente para modelos mais baratos e só escala o que precisa.

LLMOps

Competências

  • Implementação de LLM

  • Vigilância de LLM

  • Cadeias de avaliação

  • Gestão de prompts

  • Observabilidade

  • Encaminhamento

  • Vigilância de custos

Casos de uso comuns

Casos de uso comuns

  • Acrescentar pontos de avaliação para que uma alteração de prompt não possa entrar sem ser pontuada.
  • Atribuir a despesa de inferência à funcionalidade e à equipa que a causam.
  • Detetar uma regressão de qualidade depois de um fornecedor atualizar um modelo.
  • Reduzir custo encaminhando o tráfego corrente para um modelo mais pequeno, com escalada.

Como trabalhamos

Como trabalhamos

  1. Analisar

    Estabelecer as restrições: residência, latência, despesa e o que já está em funcionamento.

  2. Desenhar

    Desenhar gateway, encaminhamento, cache e comutação para que a escolha de fornecedor continue reversível.

  3. Instrumentar

    Observabilidade, avaliação e atribuição de custo ligadas antes de o tráfego chegar.

  4. Operar

    Explorá-lo com níveis de serviço acordados, revendo capacidade e despesa de forma periódica.

Tecnologia

Tecnologia

  • Kubernetes
  • Terraform
  • vLLM
  • Ollama
  • LiteLLM
  • OpenTelemetry
  • Prometheus
  • Grafana
  • AWS
  • Microsoft Azure

Segurança e governação

Segurança e governação

Onde os dados podem ser tratados é uma configuração, não um pressuposto: os modelos podem correr no seu próprio ambiente cloud ou no seu próprio hardware quando a residência ou o isolamento o exigem. O tráfego que passa pelo gateway é autenticado, atribuído a uma equipa e registado, que é o que torna possíveis tanto o rasto de auditoria como o modelo de custo.

Modelos de colaboração

Modelos de colaboração

Projeto de IA

Assumimos a responsabilidade de desenhar e entregar uma solução de IA definida.

Equipa de IA dedicada

Capacidade de engenharia dedicada a longo prazo, construída em torno da sua tecnologia e do seu modelo de entrega.

IA gerida

Operamos, monitorizamos e melhoramos continuamente os sistemas de IA em produção.

Porquê a TeamExtension.ai

Tratamos a avaliação como o controlo de lançamento

A maioria das equipas avalia uma vez antes do lançamento e depois confia nas reclamações. A avaliação contínua contra um conjunto anotado é a diferença entre conhecer a qualidade e esperar por ela. É também a única forma de uma mudança de modelo se tornar rotina em vez de motivo de receio.

Clientes selecionados

Perguntas frequentes

Perguntas frequentes

Como se avalia algo sem uma única resposta certa?
Com critérios e não com correspondência exata: se estava ancorada na fonte recuperada, se respondeu ao que foi perguntado, se evitou afirmar coisas sem suporte. É pontuado por um modelo contra uma grelha, com revisão humana numa amostra para manter honesto o avaliador.
Quanto custa a observabilidade?
Bastante menos do que a despesa que permite evitar. Só a atribuição de custos costuma encontrar no primeiro mês uma percentagem de dois dígitos de desperdício, quase sempre por prompts que enviam mais contexto do que o necessário.
Podem acrescentar isto a sistemas já em funcionamento?
Sim, e é o caso comum. Primeiro entra a instrumentação, que costuma revelar o retrato de qualidade e custo que ninguém tinha, e depois seguem-se a avaliação e o encaminhamento.
Que ferramentas usam?
OpenTelemetry para o rastreio, para que os dados continuem a ser seus, com a sua pilha de observabilidade atual como destino. Evitamos plataformas que retenham os seus rastos como reféns.

Falar sobre a sua iniciativa de IA

Implemente, vigie, avalie e controle o custo dos modelos de linguagem depois de estarem a suportar tráfego real.