Gần đây mình nghe một câu than quen thuộc: “Dùng AI mệt lắm. Output không như ý, review mãi vẫn phải sửa, rốt cuộc tự làm còn nhanh hơn.”
Dùng AI kiểu “trợ lý”, thì chỉ nhận được đúng kiểu trợ lý
Nếu mình dùng AI theo lối AI-assisted, tức là mình nghĩ, mình quyết, AI chỉ gõ hộ, thì rõ ràng nó không giúp được bao nhiêu. Nó làm sai gì làm đó, vì thiếu ngữ cảnh. Nó không biết vì sao mình cần việc này, ràng buộc nào là cứng, quyết định nào đã chốt từ tuần trước. Nó cũng không có cách nào tự kiểm chứng việc mình vừa làm, nên “xong” chỉ có nghĩa là “chạy được rồi”.
Trong bản trình bày về AI-DLC, mình có gọi tên kiểu làm việc này là prompt-and-pray (nhắn xong rồi cầu may). Yêu cầu nằm trong lịch sử chat, agent âm thầm tự quyết phạm vi, test viết sau cho đủ qua, và “xong” nghĩa là “build không lỗi”. Cuối cùng không ai truy lại được vì sao nó ra như vậy. Review trong bối cảnh đó rất mệt, vì người review phải tự dựng lại toàn bộ ngữ cảnh trong đầu.
Nhồi thêm rules, thêm checklist có giúp không?
Phản xạ thường gặp là nhồi thật nhiều rules và checklist vào prompt, mong AI làm đúng ý và đúng quy trình. Kết quả thường vẫn đâu vào đấy, chỉ khác là prompt dài hơn và khó bảo trì hơn.
Có một chuyện mình thấy khá thú vị. Trước khi có AI, hầu như không ai quan tâm tới checklist cho human review. Checklist vẫn nằm đó trong tài liệu quy trình, nhưng mọi người review bằng cảm tính và kinh nghiệm, và vẫn chạy ổn. Khi AI vào cuộc, mọi thứ đổi hẳn. Bỗng dưng ai cũng muốn kiểm soát, ai cũng đòi checklist, quy trình, rule thật chi tiết. Mình hiểu được quan liêu là gì là từ đây.
Mình hiểu tâm lý đó: output của AI nhiều, nhanh và mình không tin được nó. Nhưng nghĩ kỹ thì có điều lạ ở đây. Chúng ta muốn kiểm soát chặt, nhưng lại không trao quyền, không trao đủ thông tin, và không cấp đủ ngân sách (token) để AI có đủ khả năng suy nghĩ và tự vận hành. Vừa siết vừa bỏ đói thì khó mà có kết quả tốt.
Rốt cuộc nhiều nơi vẫn dừng ở mức prompt engineering. Có đóng gói lại thành “skill” và đặt cho cái tên mĩ miều hơn, thì bản chất vẫn là một đoạn prompt dài được dán sẵn.
AI-DLC nhìn vấn đề này khác thế nào
Điểm khác của AI-DLC, theo mình, không phải là bỏ prompt engineering. Prompt, context, harness, loop, graph vẫn còn đó, vì cái nào cũng cần. Điểm khác là tất cả được xây quanh agent, thay vì xây để kìm agent lại. Trong deck, mình mô tả đây là một chiếc thang năm bậc, và mỗi bậc chứa bậc bên dưới:
- Prompt engineering (đóng gói). Viết một lần, ở thượng nguồn, vào skill, file vai trò và hướng dẫn. Không ai phải gõ lại trong khung chat.
- Context engineering. Cả repository là ngữ cảnh. Mọi thứ nằm trong một chỗ, và đồ thị tài liệu cho biết mỗi tác vụ cần nạp những gì.
- Harness engineering. Những thứ ta dựng xung quanh model: mỗi vai trò có “ghế” riêng, có cổng kiểm (gate), có rào chắn. Mọi output đều có chủ, được kiểm tra và giải thích được.
- Loop engineering. Người ở vị trí “on the loop”: agent chạy, còn người trả lời những câu hỏi cần quyết định, qua một bảng chung.
- Graph engineering. Đi theo đồ thị tài liệu: một thay đổi tự quyết định vòng lặp nào chạy tiếp.
Nhìn lại ba bậc giữa, bạn sẽ thấy đó chính là thứ mà người “ôm” quá nhiều rules đang mong có, nhưng họ lại đặt vào sai chỗ. Rule không nằm trong một cái prompt dài. Nó nằm ở cấu trúc: ai được viết cái gì, “xong” cần bằng chứng gì, và chuỗi từ yêu cầu đến test đến kết quả có truy lại được không.
Cách phân chia này cũng giải quyết chuyện kiểm soát mà chúng ta lo. Ở AI-DLC, agent đề xuất, một người có tên cụ thể quyết định. Cổng chỉ qua khi có bằng chứng. Mọi artifact đều có người viết, người duyệt, và có thể truy ngược. Kiểm soát vẫn còn, nhưng nó nằm ở các điểm quyết định có ý nghĩa, thay vì rải rác trên từng dòng output.
Làm việc với AI cũng cần kỹ năng… của người
Mình nghĩ chuyện này giống hệt đời thực. Nếu bạn coi đồng nghiệp hay cấp dưới như tay sai: giao việc không nói bối cảnh, không cho họ quyền quyết định, không cung cấp đủ thông tin và công cụ, rồi soi từng dòng, thì chuyện bạn phải trả giá, review mãi và phát cáu là bình thường. Đồng nghiệp có thể nể mà làm, hoặc làm đối phó. AI thì làm đúng những gì bạn đưa, nghĩa là nếu bạn đưa thiếu thì nó làm thiếu.
Còn nếu bạn giao việc như với một đồng nghiệp giỏi: nói rõ mục tiêu và bối cảnh, thống nhất cách kiểm tra “xong”, cho họ đủ thông tin và nguồn lực, để họ hỏi lại khi chưa rõ, và chỉ can thiệp ở những chỗ quan trọng, thì kết quả thường khác hẳn. Những kỹ năng này, hiểu bối cảnh, giao quyền, đặt tiêu chí, phản hồi, hỏi lại, đều là kỹ năng người. Không có kỹ năng nào trong số đó là “kỹ thuật prompt”.
Mình không nói AI là đồng nghiệp theo nghĩa đầy đủ, và cũng không nói cứ trao quyền hết là xong. Mình chỉ muốn nói rằng nếu mình đối xử với AI như một cái robot nhận lệnh, thì phần lớn mình sẽ nhận lại một cái robot nhận lệnh.
Lời cuối
Nếu bạn đang phát ngán vì review, mình nghĩ đó là một tín hiệu đáng nghe chứ không phải đáng tránh. Nó cho thấy cách làm việc hiện tại đang có chỗ chưa ổn, và chỗ đó thường không nằm ở câu prompt. Có thể nó nằm ở việc mình chưa trao đủ ngữ cảnh, quyền và tiêu chí để AI làm việc tốt.
Làm việc tốt với người hay với AI, đều cần cùng một thứ là sự rõ ràng, sự tin tưởng có kiểm chứng, và biết đặt người quyết định đúng chỗ.