Dati e modelli AI

Model engineering

La maggior parte dei casi d'uso aziendali è servita meglio da un buon modello generalista con un recupero efficace. Alcuni no: domini stretti, volumi elevati, latenza rigida o dati che non possono uscire dal vostro perimetro. Di quelli ci occupiamo noi.

Il problema di business

Si ricorre troppo presto al fine-tuning

I team ricorrono al fine-tuning per risolvere problemi che erano di recupero o di prompt, e si ritrovano proprietari di un modello da mantenere, valutare e ritarare ogni volta che il modello di base si muove. Quel costo è ricorrente e raramente messo a budget. Nel frattempo passano inosservati i motivi veri per personalizzare: costo sui volumi, latenza, funzionamento offline e linguaggio di dominio che un modello generalista gestisce male.

Cosa facciamo

Stabilire se è giustificato, poi farlo come si deve

Verifichiamo prima se recupero, prompting o un diverso modello di base risolvano il problema, perché di solito costa meno costruirlo e possederlo. Dove la personalizzazione è davvero giustificata, costruiamo il dataset, eseguiamo l'addestramento e valutiamo su un insieme trattenuto dai vostri casi. Il servizio è progettato sulla vostra soglia di latenza e costo, con versionamento e rollback, perché un modello in produzione è un artefatto da cui si deve poter tornare indietro.

Model engineering

Competenze

  • Fine-Tuning

  • Model Customization

  • Embeddings

  • Model Optimization

  • Model Serving

  • Open-Source Models

Casi d'uso comuni

Casi d'uso comuni

  • Ridurre il costo di inferenza sui volumi spostando gran parte del traffico su un modello specializzato più piccolo.
  • Gestire un linguaggio di dominio che un modello generalista sbaglia sistematicamente.
  • Funzionare interamente entro il vostro perimetro, dove i dati non possono raggiungere un'API di terzi.
  • Soddisfare un requisito di latenza che un modello di frontiera ospitato non riesce a rispettare.

Il nostro approccio

Il nostro approccio

  1. Auditare

    Stabilire quali dati esistono, chi li possiede e in che condizione sono davvero.

  2. Pipeline

    Costruire ingestion, trasformazione e controlli di qualità da cui dipendono i modelli.

  3. Confrontare

    Confrontare gli approcci sui vostri dati, non su una classifica pubblica.

  4. Servire

    Distribuire dietro un'interfaccia stabile con versioning, monitoraggio e rollback.

Tecnologie

Tecnologie

  • Python
  • dbt
  • Apache Airflow
  • Snowflake
  • Databricks
  • PostgreSQL
  • pgvector
  • PyTorch
  • Hugging Face

Sicurezza e governance

Sicurezza e governance

La tracciabilità dei dati è registrata end to end: è sempre possibile dire da dove viene un valore e quale versione del modello abbia prodotto un dato output. I dati personali sono minimizzati, classificati e conservati secondo una policy esplicita anziché per impostazione predefinita. Gli insiemi di addestramento e valutazione sono versionati insieme al codice che li usa.

Modelli di collaborazione

Modelli di collaborazione

Progetto AI

Ci assumiamo la responsabilità di progettare e realizzare una soluzione AI definita.

Team AI dedicato

Capacità ingegneristica dedicata di lungo periodo, costruita sul vostro stack e modello di delivery.

Managed AI

Gestiamo, monitoriamo e miglioriamo continuamente i sistemi AI in produzione.

Perché TeamExtension.ai

Di norma vi dissuadiamo dal farlo

La personalizzazione è giustificata meno spesso di quanto venga proposta, e preferiamo dirlo piuttosto che venderla. Quando lo è, il lavoro è poco spettacolare: costruzione del dataset, valutazione onesta e un percorso di servizio che sappiate gestire. È quella parte a decidere se regge.

Clienti selezionati

Domande frequenti

Domande frequenti

Quanti dati servono per un fine-tuning?
Per stile e formato molti meno di quanto si creda, spesso qualche centinaio di esempi ben scelti. Insegnare conoscenza davvero nuova è un problema diverso, di solito risolto meglio con il recupero.
Un modello messo a punto batte un modello di frontiera?
Su un compito stretto a volte sì, e di solito a costo e latenza molto minori. Sul ragionamento generale no. Lo schema realistico è un modello più piccolo per il grosso del traffico, con escalation per i casi difficili.
Che cosa succede quando il modello di base viene aggiornato?
Il vostro modello messo a punto non si sposta con esso, quindi si rivaluta e spesso si riaddestra. Quel costo ricorrente fa parte della decisione, e lo rendiamo esplicito prima che vi impegniate.
Possiamo gestire noi stessi modelli open source?
Sì, e per residenza dei dati o isolamento è spesso il motivo per farlo. Comporta gestire infrastruttura di inferenza, che ha un costo reale, quindi dovrebbe essere una scelta deliberata e non un'impostazione predefinita.

Parliamo della vostra iniziativa AI

Fine-tuning, embedding, ottimizzazione e serving, inclusi modelli open-source e self-hosted.