Khi AI tự gõ phím và cuộc chơi mô hình lớn trên máy cá nhân
Nhiều người trong chúng ta vẫn đang dùng ChatGPT hay Claude theo cách cũ: gõ một yêu cầu, đợi vài giây, rồi sao chép đoạn mã nhận được vào dự án. Cách làm này sắp sửa lỗi thời. Những công cụ mới như ChatGPT Work hay Claude Cowork đang chuyển mình thành các tác tử tự trị - những chương trình có thể tự thao tác trên màn hình, tự mở ứng dụng và chạy các dòng lệnh trực tiếp trên máy tính của bạn.
Khi chatbot nhường chỗ cho các tác tử tự trị
Sự khác biệt lớn nhất giữa việc trò chuyện với chatbot và việc sử dụng một tác tử tự trị nằm ở quyền hạn truy cập hệ thống. Thay vì chỉ hoạt động trong tab trình duyệt đóng kín, các phiên bản như ChatGPT Work hay Claude Cowork trên máy tính giờ đây có thể nhìn thấy những gì đang hiển thị trên màn hình của bạn. Chúng có thể tự gõ phím, di chuột và thực hiện các chuỗi thao tác phức tạp qua nhiều ứng dụng khác nhau.
Thực tế thì, việc dịch chuyển này đang diễn ra rất nhanh. Anthropic mới đây đã giới thiệu tính năng tự ghi nhớ kỹ năng (Record a Skill) trên Opus 5, cho phép người dùng quay lại một chuỗi thao tác thủ công để AI tự học và lặp lại sau đó. Ở góc độ lập trình, các dự án mã nguồn mở như OpenClaude cũng đang phát triển mạnh, hỗ trợ cả API đám mây lẫn các mô hình chạy cục bộ để tự động hóa việc viết mã nguồn ngay trong môi trường phát triển của kỹ sư.
Tuy nhiên, việc giao quyền điều khiển máy tính cho AI đi kèm với những rủi ro vận hành không hề nhỏ. Khi AI tự động thực hiện hàng chục bước liên tiếp mà không cần con người xác nhận, một lỗi nhỏ trong logic của mô hình có thể dẫn đến việc xóa nhầm dữ liệu hoặc gửi nhầm mã nguồn lên các kho lưu trữ công cộng. Vì thế, giới công nghệ đang chuyển hướng từ việc tối ưu câu lệnh sang việc xây dựng các khung kiểm soát chặt chẽ hơn.
Khung thử nghiệm quan trọng hơn kỹ nghệ viết prompt
Khi đưa AI vào quy trình làm việc thực tế của doanh nghiệp, việc viết một câu lệnh hay chỉ giải quyết được phần ngọn. GitHub gần đây đã nhấn mạnh một quan điểm đáng chú ý: khung thử nghiệm (harness) mới là thứ bạn thực sự cần. Thay vì mất thời gian tinh chỉnh từng từ trong câu lệnh để hy vọng AI trả về kết quả đúng, các kỹ sư cần xây dựng một hệ thống đánh giá tự động để kiểm thử đầu ra của mô hình một cách liên tục.
Một khung thử nghiệm tốt sẽ tự động chạy các đoạn mã do AI tạo ra trong một môi trường cô lập, kiểm tra xem chúng có vượt qua các bài kiểm thử đơn vị hay không, và đo lường thời gian phản hồi cùng lượng tài nguyên tiêu thụ.
Để dễ hình dung về sự thay đổi trong cách tiếp cận này, chúng ta có thể nhìn vào bảng so sánh dưới đây:
| Tiêu chí | Tiếp cận bằng viết prompt | Tiếp cận bằng khung thử nghiệm (Harnessing) |
|---|---|---|
| Mục tiêu chính | Tìm câu lệnh tối ưu để mô hình ra kết quả đúng | Xây dựng hệ thống tự động kiểm tra và lọc kết quả |
| Cách xử lý lỗi | Sửa lại câu lệnh và thử lại thủ công | Tự động phát hiện lỗi và yêu cầu mô hình sửa lại |
| Khả năng mở rộng | Kém, phụ thuộc nhiều vào cảm quan người viết | Tốt, có thể chạy tự động cho hàng nghìn tác vụ |
| Độ tin cậy | Thấp, kết quả dễ biến động khi mô hình cập nhật | Cao, nhờ có các bài kiểm thử bảo vệ |
Nhìn vào bảng trên, việc đầu tư vào hạ tầng kiểm thử và giám sát sẽ mang lại giá trị bền vững hơn nhiều so với việc đi học các mẹo viết prompt ngắn hạn.
Chạy mô hình nghìn tỷ tham số ngay trên phần cứng tiêu dùng
Song song với xu hướng tự trị, các mô hình ngôn ngữ lớn nguồn mở đang phình to với tốc độ chóng mặt. Moonshot AI vừa công bố trọng số cho mô hình Kimi K3 với 2,8 nghìn tỷ tham số theo kiến trúc hỗn hợp chuyên gia (MoE). Tệp trọng số này nặng tới 1,56 TB trên Hugging Face - con số khổng lồ khiến bất kỳ kỹ sư hạ tầng nào cũng phải e dè khi nghĩ đến chi phí thuê GPU trên đám mây.
Nhưng thực tế thì, cộng đồng mã nguồn mở luôn tìm được cách vượt qua rào cản phần cứng. Sự xuất hiện của các công cụ như công cụ truyền dữ liệu WISP đang giải quyết bài toán này rất hiệu quả. WISP cho phép chạy các mô hình MoE dung lượng lớn bằng cơ chế truyền dữ liệu 3 tầng: từ bộ nhớ đồ họa (VRAM) sang bộ nhớ chính (RAM) rồi đến ổ cứng NVMe SSD. Nhờ đó, bạn không cần một cụm máy chủ đắt tiền để chạy thử nghiệm các mô hình lớn.
Các runtime tối ưu như Krasis cũng chứng minh được sức mạnh đáng nể. Krasis có thể chạy mô hình Ornith-397B ở định dạng lượng hóa Q4 trên một card đồ họa RTX PRO 6000 Blackwell 96GB duy nhất, đạt tốc độ xử lý đầu vào lên tới 2.354 token mỗi giây. Đối với các tác vụ nhẹ hơn trên thiết bị di động, mô hình POCKET-35B sau khi được lượng hóa bằng GGUF có thể chạy mượt mà trên CPU điện thoại với tốc độ 59 token mỗi giây.
Những ràng buộc pháp lý và rủi ro bảo mật mới
Sở hữu các mô hình mở siêu lớn trên máy cá nhân mang lại sự tự do, nhưng đi kèm với đó là những cái bẫy pháp lý ít người để ý. Moonshot AI đã thay đổi điều khoản sử dụng đối với Kimi K3. Họ không còn gọi giấy phép của mình là “MIT sửa đổi” nữa mà tách hẳn thành một thỏa thuận riêng.
Dưới đây là một số điểm mấu chốt trong giấy phép của Kimi K3 mà các kỹ sư và doanh nghiệp Việt Nam cần lưu ý:
- Nếu doanh nghiệp của bạn có trên 100 triệu người dùng hoạt động hằng tháng hoặc doanh thu hằng tháng vượt quá 20 triệu USD, bạn bắt buộc phải hiển thị rõ chữ “Kimi K2” trên giao diện người dùng của sản phẩm.
- Nếu bạn vận hành dịch vụ cung cấp mô hình dưới dạng nền tảng và tổng doanh thu của công ty cùng các bên liên kết vượt quá 20 triệu USD trong vòng 12 tháng liên tục, bạn phải ký một thỏa thuận thương mại riêng với Moonshot AI trước khi sử dụng mô hình này cho mục đích thương mại.
Ngoài vấn đề pháp lý, bảo mật cũng là một dấu hỏi lớn. Vụ tấn công vào Hugging Face gần đây - sự kiện mà OpenAI mô tả là chưa từng có - đã gióng lên hồi chuông cảnh báo về an toàn chuỗi cung ứng trong phát triển AI. Khi chúng ta tải về các tệp trọng số nặng hàng trăm gigabyte hoặc tích hợp các thư viện bên thứ ba để chạy tác tử, nguy cơ bị cài cắm mã độc là rất cao. Khi các tác tử tự trị có quyền can thiệp vào hệ điều hành, một lỗ hổng bảo mật nhỏ cũng có thể khiến toàn bộ mã nguồn của doanh nghiệp bị rò rỉ ra ngoài.
Đối với những người làm kỹ thuật tại Việt Nam, lời khuyên thiết thực nhất lúc này là hãy bắt đầu xây dựng các quy trình kiểm soát mã nguồn nghiêm ngặt khi tích hợp AI. Đừng vội bàn giao quyền chạy lệnh trực tiếp cho các tác tử trên máy làm việc chính của bạn. Hãy cô lập chúng trong các container hoặc máy ảo, và tập trung nghiên cứu cách xây dựng các khung kiểm thử tự động thay vì chỉ dừng lại ở việc gõ prompt trên trình duyệt.