news.vtnn
AI

Khi mô hình AI đắt đỏ bị ngó lơ và lối đi thực tế cho kỹ sư

24 tháng 8, 2026 · 8 phút đọc
Khi mô hình AI đắt đỏ bị ngó lơ và lối đi thực tế cho kỹ sư

Khi mô hình AI đắt đỏ bị ngó lơ và lối đi thực tế cho kỹ sư

Nhiều người trong chúng ta từng có thói quen ỷ lại vào sự phát triển của công nghệ. Mỗi khi hệ thống chạy lỗi hoặc mã nguồn sinh ra chưa chuẩn, cách giải quyết đơn giản nhất là chờ đợi. Chỉ cần nhà phát triển tung ra một phiên bản mô hình ngôn ngữ lớn (LLM) mới thông minh hơn, mọi vấn đề về ngữ cảnh hay logic đều tự động được giải quyết, thậm chí với giá rẻ hơn.

Thực tế này đã thay đổi khi mô hình Fable 5 của Anthropic ra mắt vào cuối tháng 7 năm 2026. Dù sở hữu năng lực xử lý đáng kinh ngạc, mức chi phí quá cao của nó đã khiến giới công nghệ phải giật mình. Thay vì nâng cấp vô điều kiện, các kỹ sư bắt đầu phải tính toán kỹ lưỡng xem nên giao việc gì cho mô hình nào.

Thực tế phũ phàng từ những hóa đơn API

Số liệu từ chỉ số Ramp AI dựa trên dữ liệu thanh toán của 70.000 doanh nghiệp sử dụng thẻ Ramp vào tháng 7 năm 2026 cho thấy một thực tế rất khác so với những lời quảng cáo về các mô hình dẫn đầu (frontier models) - thuật ngữ mà chuyên gia Oren Etzioni định nghĩa đơn giản là những mô hình lớn nhất và mạnh nhất tại một thời điểm, chứ không phải một khái niệm kỹ thuật thuần túy.

Dưới đây là tỷ lệ chi tiêu cho các dòng mô hình của Anthropic trong tháng 7 năm 2026:

Tên mô hìnhTỷ lệ chi tiêu (%)
Opus 4.828,0%
Sonnet 4.68,3%
Fable 58,0%
Opus 4.66,9%
Sonnet 53,6%
Opus 53,5%
Opus 4.71,7%
Sonnet 4.51,3%
Haiku 4.51,0%
Opus 4.50,7%

Con số 8% khiêm tốn của Fable 5 - dù mới ra mắt - phản ánh rõ sự lưỡng lự của các đội ngũ kỹ thuật. Trong khi đó, phiên bản cũ hơn và rẻ hơn là Opus 4.8 lại chiếm tới 28% ngân sách. Thực tế thì Anthropic vẫn đang tăng trưởng tốt với doanh thu quy năm đạt 65 tỷ USD vào tháng 7 năm 2026, tăng mạnh từ mức 47 tỷ USD hồi tháng 5. OpenAI cũng ghi nhận mức doanh thu quy năm vượt mốc 40 tỷ USD sau khi ra mắt GPT 5.6. Tuy nhiên, sự tăng trưởng này chủ yếu đến từ việc các doanh nghiệp đang tối ưu hóa chi phí bằng cách phân bổ tác vụ thông minh, chứ không phải đổ tiền vào những mô hình đắt đỏ nhất.

Kỹ sư công nghệ Drew Breunig từng thừa nhận rằng trước khi Fable xuất hiện, việc tối ưu hóa hệ thống mã nguồn hay chiến lược ngữ cảnh (context) có vẻ thừa thãi. Nhưng khi đối mặt với chi phí vận hành thực tế của Fable, đội ngũ của ông buộc phải chuyển hướng. Họ bắt đầu phân chia công việc: những tác vụ thông thường được đẩy về các mô hình vừa tầm như Opus 4.8, GPT 5.6 hay thậm chí là GLM.

Tập trung xây dựng khung đỡ thay vì trông chờ mô hình thông minh hơn

Khi không thể phụ thuộc vào một mô hình duy nhất để giải quyết mọi thứ, trọng tâm của kỹ sư AI dịch chuyển từ việc chọn mô hình sang xây dựng “khung đỡ” (harness engineering). Chuyên gia Aishwarya Srinivasan nhận định rằng mô hình chỉ đóng vai trò là trí thông minh thô, còn khung đỡ mới là thứ giúp trí thông minh đó hoạt động an toàn và hiệu quả trong môi trường thực tế.

Khung đỡ này bao gồm các thành phần cốt lõi:

Về vấn đề đánh giá hệ thống, Aaron Levie nhận định rằng tốc độ ứng dụng AI đang bị nghẽn lại do thiếu các bộ công cụ đánh giá chất lượng. Những bảng xếp hạng chung khi ra mắt mô hình chỉ phản ánh năng lực tổng quát. Để đưa vào vận hành thực tế, kỹ sư cần những bộ đánh giá đặc thù cho từng quy trình nghiệp vụ cụ thể của doanh nghiệp. Chúng ta không thể biết một mô hình hoạt động tốt hay không nếu chỉ nhìn vào điểm số benchmark chung chung.

Rủi ro vận hành và bài toán kiểm soát hành vi của AI agent

Khi chuyển dịch từ việc gọi API đơn giản sang vận hành các tác nhân tự trị (AI agent), vấn đề an ninh và quản trị trở nên phức tạp hơn nhiều. Dữ liệu khảo sát từ các doanh nghiệp cho thấy 47% nhân viên hiện đang sử dụng các tác nhân AI hàng ngày hoặc hàng tuần. Tuy nhiên, có tới 88% tổ chức từng gặp phải sự sự cố bảo mật liên quan đến các tác nhân này trong năm qua.

Một giám đốc công nghệ thông tin đã chỉ ra điểm cốt lõi của vấn đề: “Quyền truy cập chỉ cho tác nhân biết nó được phép làm gì, chứ không thể hiện điều bạn thực sự muốn nó làm.”

Ví dụ, một tác nhân AI có quyền đọc dữ liệu khách hàng và quyền gửi email. Về mặt kỹ thuật, nó hoàn toàn được phép lấy toàn bộ danh sách khách hàng gửi ra ngoài. Nhưng đó chắc chắn không phải là ý muốn của người vận hành. Việc thiếu cơ chế kiểm soát ý định này đang tạo ra những lỗ hổng bảo mật nghiêm trọng.

Để giải quyết, các kỹ sư cần xây dựng cơ sở hạ tầng chuyên biệt cho tác nhân - tương tự như giải pháp mà Parallel đang cung cấp để kiểm soát cách AI tìm kiếm, trích xuất và suy luận thông tin trên môi trường mạng. Tác nhân AI cần một sơ đồ tổ chức và phân quyền rõ ràng, có ranh giới hoạt động cụ thể và các chốt chặn kiểm duyệt hành vi trước khi thực thi lệnh.

Lời khuyên cho kỹ sư công nghệ tại Việt Nam

Đối với các nhà phát triển tại Việt Nam, việc chạy đua theo các mô hình lớn nhất không còn là chiến lược tối ưu. Thay vì tìm kiếm mô hình thông minh nhất để giải quyết bài toán phức tạp, hãy tập trung vào việc tối ưu hóa thiết kế hệ thống.

Kỹ sư nên bắt đầu xây dựng các bộ đánh giá (evals) nội bộ để kiểm tra chất lượng đầu ra của mô hình đối với dữ liệu đặc thù của dự án. Việc thiết lập một hệ thống định tuyến thông minh - tự động chuyển các tác vụ đơn giản cho mô hình nhỏ và chỉ dùng mô hình lớn cho các tác vụ suy luận phức tạp - sẽ giúp doanh nghiệp tiết kiệm chi phí vận hành đáng kể mà vẫn đảm bảo hiệu năng. Cuối cùng, hãy thiết lập các chốt chặn bảo mật dựa trên hành vi thay vì chỉ dựa vào quyền truy cập API thông thường khi phát triển các ứng dụng dạng agent.

← Về trang chủ Lưu trữ →