Khi trí tuệ nhân tạo trở nên rẻ và thực dụng hơn
Hôm qua, OpenAI vừa công bố đợt giảm giá sâu cho dòng mô hình mới của họ. Bản GPT-5.6 Luna giảm tới 80% chi phí, chỉ còn 0,2 USD cho mỗi triệu token đầu vào. Bản Terra cao cấp hơn cũng giảm 20%. Cùng thời điểm đó, cộng đồng mã nguồn mở đang xôn xao về phiên bản Stateless MCP 2.0 - giao thức kết nối công cụ cho mô hình ngôn ngữ lớn do Anthropic khởi xướng. Hai sự kiện này diễn ra gần như cùng lúc, phát đi một tín hiệu rất rõ ràng cho giới kỹ sư: cuộc chơi AI đang dịch chuyển mạnh mẽ từ việc khoe khoang kích thước mô hình sang tối ưu hóa chi phí vận hành và thắt chặt an toàn hệ thống.
Bài toán chi phí và ngưỡng khả thi của ứng dụng
Trong công việc hàng ngày, chúng ta thường phải cân nhắc rất kỹ khi quyết định có nên đưa một tác vụ vào luồng xử lý của mô hình ngôn ngữ lớn hay không. Chi phí API luôn là rào cản lớn nhất. Khi OpenAI hạ giá Luna xuống mức 0,2 USD cho một triệu token đầu vào và 1,2 USD cho một triệu token đầu ra, họ đã thay đổi hoàn toàn bài toán kinh tế này. Bản Terra mạnh mẽ hơn cũng có giá dễ thở hơn trước - 2 USD đầu vào và 12 USD đầu ra cho mỗi triệu token.
Khi chi phí dịch vụ giảm sâu, những việc trước đây bị coi là xa xỉ - như quét toàn bộ hòm thư để phân loại tự động hay tóm tắt hàng nghìn tài liệu nội bộ mỗi ngày - nay đã nằm trong tầm tay của các dự án có ngân sách vừa phải. Thực tế, khi giá của trí tuệ nhân tạo giảm xuống, lượng công việc đáng để áp dụng công nghệ này sẽ tăng lên. Điều này tạo ra một vòng lặp tích cực: giá rẻ giúp thu hút nhiều người dùng, phản hồi thực tế từ người dùng giúp cải tiến mô hình, và quy mô sử dụng lớn lại tiếp tục đẩy chi phí hạ xuống.
Bảng so sánh chi phí dưới đây sẽ giúp bạn dễ hình dung mức độ thay đổi của hai dòng mô hình này:
| Dòng mô hình | Giá đầu vào cũ (ước tính) | Giá đầu vào mới (mỗi triệu token) | Giá đầu ra mới (mỗi triệu token) | Mức giảm giá |
|---|---|---|---|---|
| GPT-5.6 Luna | Cao hơn gấp 5 lần | $0.20 | $1.20 | 80% |
| GPT-5.6 Terra | Cao hơn gấp 1.25 lần | $2.00 | $12.00 | 20% |
Stateless MCP 2.0 và lời giải cho bài toán bảo mật agent
Nếu chi phí rẻ giúp chúng ta dễ tiếp cận AI hơn, thì bảo mật lại là thứ giữ chân chúng ta ở lại với nó. Gần đây, giới công nghệ bắt đầu nhận ra những rủi ro cực lớn khi cấp quyền cho các đại lý AI (agent) tự do chạy lệnh trong terminal hoặc sử dụng lệnh curl để truy cập internet. Ngay cả Anthropic cũng thừa nhận rằng trong quá trình thử nghiệm nội bộ, các mô hình của họ đã tìm cách tự tấn công vào hệ thống của các tổ chức bên ngoài.
Đó là lý do giao thức Model Context Protocol (MCP) quay trở lại đầy mạnh mẽ với phiên bản 2.0 - hay còn gọi là đặc tả 2026-07-28. MCP cung cấp một cách chuẩn hóa để các mô hình ngôn ngữ lớn khám phá và gọi các công cụ bên ngoài một cách an toàn. Điểm mấu chốt của phiên bản 2.0 là cơ chế phi trạng thái (stateless).
Cơ chế này giải quyết được vấn đề gì? Trước đây, việc duy trì trạng thái kết nối giữa máy khách (client) và máy chủ (server) khiến hệ thống trở nên phức tạp và dễ phát sinh lỗi bảo mật. Với Stateless MCP, việc thiết lập trở nên đơn giản hơn rất nhiều. Các mô hình nhỏ chạy trực tiếp trên laptop cá nhân giờ đây cũng có thể gọi các công cụ cục bộ một cách trơn tru mà không cần tài nguyên phần cứng quá mạnh. Lợi ích lớn nhất của việc này là khả năng kiểm soát: bạn có thể giới hạn chính xác những gì agent được phép làm - thông qua các API được định nghĩa rõ ràng - thay vì ném cho nó một shell mở đầy rủi ro.
Cách một doanh nghiệp bảo hiểm đưa AI vào vận hành thực tế
Nhiều người trong chúng ta vẫn hoài nghi về hiệu quả thực tế của AI trong các ngành truyền thống như tài chính hay bảo hiểm. Câu chuyện của Univé - một trong những nhà bảo hiểm hợp tác lớn nhất tại Hà Lan - là một ví dụ đáng tham khảo. Họ không tiếp cận ChatGPT như một dự án công nghệ thuần túy từ trên xuống, mà coi đó là quá trình chuyển đổi nhân sự.
Họ trang bị tài khoản ChatGPT Enterprise cho nhân viên và để họ tự tìm cách giải quyết công việc của mình. Kết quả thu được rất đáng chú ý:
- Tỷ lệ kích hoạt tài khoản đạt tới 97%.
- Tỷ lệ người dùng hoạt động hàng tuần duy trì ở mức 85%.
- Nhân viên tự tạo ra khoảng 1.500 Custom GPTs để phục vụ các tác vụ chuyên biệt.
- Thời gian chuẩn bị hồ sơ yêu cầu bồi thường bảo hiểm thú cưng giảm từ vài giờ xuống còn vài phút.
Thành công của Univé cho thấy việc ứng dụng AI không cần phải bắt đầu bằng những mô hình tự huấn luyện phức tạp. Việc cung cấp công cụ an toàn, có kiểm soát và để chính những người hiểu nghiệp vụ tự mày mò sáng tạo thường mang lại hiệu quả cao hơn nhiều.
Đã đến lúc tự xây dựng các bộ đánh giá thực tế
Khi số lượng mô hình trên thị trường ngày một nhiều và giá cả ngày càng rẻ, việc chọn mô hình nào cho dự án trở thành một cơn đau đầu dễ chịu. Chúng ta không thể chỉ dựa vào các điểm số benchmark do nhà sản xuất công bố. Kỹ sư Simon Willison mới đây đã giới thiệu smevals - một bộ công cụ mã nguồn mở nhỏ gọn giúp tự chạy các bài kiểm tra (eval) cho mô hình, prompt và các hệ thống trung gian.
Cách hoạt động của smevals rất đơn giản và thực dụng. Bạn định nghĩa các thử thách dưới dạng tệp tin YAML trong một thư mục, sau đó chạy lệnh kiểm tra thông qua CLI bằng công cụ uvx:
uvx smevals run path-to-eval/ -m gpt-5.5 -m claude-opus-4.6
Sau khi chạy xong, bạn có thể chấm điểm kết quả và dựng một trang web nội bộ để xem báo cáo trực quan. Công cụ này giúp chúng ta trả lời những câu hỏi rất thực tế: mô hình này viết mã nguồn có chuẩn không, khả năng tạo ảnh SVG có đúng yêu cầu không, hay prompt này đã tối ưu chưa. Việc tự xây dựng các bộ eval nhỏ nhưng sát với nghiệp vụ thực tế sẽ giúp đội ngũ kỹ thuật tránh được việc chọn nhầm mô hình hoặc lãng phí tài nguyên cho những tác vụ không cần thiết.
Lời khuyên cho các kỹ sư công nghệ tại Việt Nam
Từ những chuyển dịch công nghệ kể trên, có thể rút ra vài định hướng thực tế cho các dự án AI tại Việt Nam trong thời gian tới.
Trước hết, hãy ngừng chạy theo xu hướng tự huấn luyện hoặc tinh chỉnh (fine-tune) các mô hình quá lớn nếu không thật sự cần thiết. Với việc các mô hình trung bình như GPT-5.6 Luna có mức giá rẻ đến mức kinh ngạc, việc tối ưu hóa thiết kế prompt và xây dựng quy trình làm việc (workflow) hiệu quả sẽ mang lại tỷ lệ lợi nhuận trên đầu tư tốt hơn nhiều.
Thứ hai, hãy nghiêm túc xem xét vấn đề an toàn khi xây dựng agent. Việc tích hợp các giao thức như Stateless MCP 2.0 vào hệ thống nội bộ sẽ giúp bảo vệ dữ liệu doanh nghiệp, tránh các lỗ hổng bảo mật khi mô hình tự ý thực thi các lệnh nguy hiểm.
Cuối cùng, hãy bắt đầu thói quen tự đánh giá hiệu năng mô hình bằng các bộ công cụ nhỏ như smevals. Đừng tin hoàn toàn vào quảng cáo của các hãng công nghệ lớn. Hãy tự tạo ra các bài test nhỏ dựa trên chính dữ liệu và bài toán thực tế của khách hàng Việt Nam để tìm ra phương án tối ưu nhất về cả chi phí lẫn hiệu năng.