Hạ tầng AI và LLMOps

Kiến trúc AI

Không có kiến trúc tham chiếu, mỗi nhóm lại tự chọn một mô hình, một kho vector, một cách điều phối và một cách quản lý bí mật. Chúng tôi xác định kiến trúc dùng chung khiến hệ thống AI thứ hai và thứ năm rẻ hơn cái đầu tiên.

Bài toán kinh doanh

Không có gì tích lũy lại

Hệ thống AI đầu tiên đắt vì mọi thứ đều mới. Cái thứ năm lẽ ra phải rẻ nhưng thường thì không, vì mỗi nhóm giải cùng những bài toán đó theo cách khác nhau. Giờ có năm cách gọi mô hình, năm hướng đánh giá, năm kho bí mật và không có khả năng chuyển lưu lượng giữa các nhà cung cấp. Chi phí bị trả hai lần: một lần cho phần xây trùng lặp, và một lần nữa khi có thứ cần thay đổi ở khắp nơi cùng lúc.

Chúng tôi làm gì

Xác định lớp dùng chung và ranh giới của nó

Chúng tôi thiết kế lớp lẽ ra phải dùng chung, gồm truy cập mô hình, truy xuất, điều phối, đánh giá, khả năng quan sát và bí mật, đồng thời nói rõ không kém phần nào nên để lại cho ứng dụng, vì tập trung quá mức sẽ tạo ra nút thắt. Kiến trúc được viết sao cho lựa chọn nhà cung cấp luôn đảo ngược được, để quyết định về mô hình không trở thành cam kết kiến trúc. Chúng tôi kiểm chứng nó trên hai ba use case thật thay vì bàn giao một sơ đồ.

Kiến trúc AI

Năng lực

  • Kiến trúc AI doanh nghiệp

  • Kiến trúc mô hình ngôn ngữ

  • Kiến trúc RAG

  • Kiến trúc tác tử

  • Kiến trúc nền tảng AI

  • Kiến trúc AI trên đám mây

  • AI lai

  • Kiến trúc AI riêng tư

Các tình huống sử dụng phổ biến

Các tình huống sử dụng phổ biến

  • Thiết lập kiến trúc tham chiếu trước khi một loạt dự án AI khởi động song song.
  • Hợp nhất các cách triển khai khác nhau của nhiều nhóm về một hạ tầng dùng chung.
  • Thiết kế cho một yêu cầu về vùng tài phán hoặc cách ly khiến đường đám mây mặc định không dùng được.
  • Rà soát một kiến trúc đang tỏ ra tốn kém khi cần thay đổi.

Cách chúng tôi triển khai

Cách chúng tôi triển khai

  1. Đánh giá

    Xác định các ràng buộc: nơi lưu trữ, độ trễ, chi tiêu và những gì đang chạy sẵn.

  2. Thiết kế kiến trúc

    Thiết kế cổng vào, định tuyến, bộ nhớ đệm và chuyển dự phòng để lựa chọn nhà cung cấp luôn đảo ngược được.

  3. Gắn đo đạc

    Đấu nối khả năng quan sát, đánh giá và quy chi phí trước khi lưu lượng đổ về.

  4. Vận hành

    Chạy theo mức dịch vụ đã thỏa thuận, rà soát công suất và chi tiêu theo chu kỳ.

Công nghệ

Công nghệ

  • Kubernetes
  • Terraform
  • vLLM
  • Ollama
  • LiteLLM
  • OpenTelemetry
  • Prometheus
  • Grafana
  • AWS
  • Microsoft Azure

Bảo mật và quản trị

An ninh và quản trị

Nơi dữ liệu được phép xử lý là một cấu hình, không phải một giả định: mô hình có thể chạy trong chính tenant đám mây của bạn hoặc trên phần cứng của bạn khi yêu cầu về nơi lưu trữ hay cách ly đòi hỏi như vậy. Lưu lượng đi qua cổng vào đều được xác thực, quy về một nhóm cụ thể và ghi nhật ký, và đó chính là thứ khiến cả dấu vết kiểm toán lẫn mô hình chi phí trở nên khả thi.

Mô hình hợp tác

Mô hình hợp tác

Dự án AI

Chúng tôi chịu trách nhiệm thiết kế và bàn giao một giải pháp AI đã được xác định.

Đội AI chuyên trách

Năng lực kỹ thuật chuyên trách dài hạn, xây dựng quanh nền tảng công nghệ và mô hình bàn giao của bạn.

AI vận hành trọn gói

Chúng tôi vận hành, giám sát và liên tục cải tiến các hệ thống AI đang chạy thật.

Vì sao chọn TeamExtension.ai

Chúng tôi kiểm chứng kiến trúc bằng cách xây trên nó

Một kiến trúc chưa từng gánh tải thật thì chỉ là một giả thuyết. Chúng tôi thử thiết kế trên các use case thực ngay trong dự án, và điều đó làm lộ ra những giả định sai khi sửa chúng vẫn còn rẻ. Nó cũng giữ cho tài liệu trung thực về cái gì thực sự dùng chung và cái gì chỉ trông có vẻ dùng chung trên sơ đồ.

Khách hàng tiêu biểu

Câu hỏi thường gặp

Câu hỏi thường gặp

Chúng tôi nên xây một nền tảng hay để các nhóm tự chọn?
Ở đâu đó giữa hai thái cực, và chỗ vạch ranh giới quan trọng hơn chính lựa chọn đó. Hãy tập trung phần truy cập mô hình, đánh giá, khả năng quan sát và bí mật, vì chúng được lợi từ tính nhất quán. Hãy để logic ứng dụng và trải nghiệm người dùng cho các nhóm, vì tập trung những phần đó chỉ tạo ra hàng chờ.
Làm sao tránh bị khóa vào một nhà cung cấp?
Bằng cách định tuyến các lệnh gọi mô hình qua một cổng vào với giao diện nội bộ ổn định, để lựa chọn nhà cung cấp chỉ còn là cấu hình. Không thể chuyển đổi hoàn toàn vì hành vi mô hình khác nhau, nhưng chi phí chuyển đổi có thể rút xuống một tuần thay vì một quý.
Chúng tôi có cần một cơ sở dữ liệu vector riêng không?
Thường thì không. pgvector trong PostgreSQL sẵn có phục vụ được nhiều tải doanh nghiệp mà không phải vận hành thêm hạ tầng mới. Một kho riêng chỉ xứng đáng ở quy mô lớn hoặc cho các tính năng cụ thể, chứ không phải theo mặc định.
Việc này mất bao lâu?
Sáu đến mười tuần, bao gồm cả phần kiểm chứng trên các use case thật. Dự án ngắn hơn thì cho ra một tài liệu; chính phần kiểm chứng mới biến nó thành một kiến trúc.

Trao đổi về sáng kiến AI của bạn

Thiết kế kiến trúc tham chiếu mà các hệ thống AI của bạn dùng chung: mô hình, truy xuất, điều phối, dữ liệu và kiểm soát.