Mời bạn đọc theo dõi "Featured Post":

Trói, Tàn, và Cháy: Ba Lời Việt Phạm Duy Trên Nhạc Pháp

10.09.2026

"Thời Ấy Đã Qua": Bằng Chứng Nói Gì Về Việc AI Thay Đổi Nghề Viết Mã

Written by: Claude Sonnet AI.

Curator/Editor: Học Trò.


Ngày 25 tháng 2 năm 2026, Andrej Karpathy viết rằng thật "khó diễn tả lập trình đã thay đổi đến mức nào vì AI trong hai tháng vừa qua." Theo ông, các tác tử viết mã (coding agent) "gần như không chạy được trước tháng Mười Hai, và gần như chạy được kể từ đó." Tôi đọc bài ấy với tư cách một người đã viết phần mềm cả đời theo lối cũ, và nay có GitHub Copilot trên máy ở sở làm. Tôi đã quyết định thôi bắt đầu từ một tập tin trắng, để tác tử làm lượt đầu. Nhưng trước khi làm, tôi muốn biết bằng chứng nói gì: không phải một ngày cuối tuần của một kỹ sư nổi tiếng, mà là các thử nghiệm ngẫu nhiên có đối chứng, các cuộc khảo sát lớn, các cuộc kiểm tra bảo mật và số liệu thị trường lao động. Bài này đặt những lời tuyên bố mạnh nhất cạnh những phép đo tốt nhất. Nói gọn: thay đổi là có thật, nhưng không đều; nó cảm thấy lớn hơn mức đo được; và người trả giá nhiều nhất là người mới vào nghề.


1. Một Dự Án Cuối Tuần Xong Trong Ba Mươi Phút

Bài của Karpathy mở bằng một cảnh, và cảnh ấy nói được nhiều hơn mọi con số. Cuối tuần, ông muốn có một bảng điều khiển (dashboard) phân tích video từ mấy camera quanh nhà. Ông gõ cho tác tử đúng một đoạn: đây là địa chỉ IP nội bộ, tên đăng nhập và mật khẩu của máy DGX Spark; hãy đăng nhập, cài khóa SSH, cài vLLM, tải và chạy thử Qwen3-VL, dựng một điểm cuối (endpoint) để suy luận trên video, làm một giao diện web đơn giản, thử nghiệm mọi thứ, cài nó chạy dưới systemd, tự ghi chú lại để nhớ, và viết cho tôi một bản báo cáo.

Tác tử đi làm khoảng ba mươi phút. Nó gặp vài trục trặc, tự lên mạng tìm cách giải, sửa từng cái một, viết mã, thử và gỡ lỗi, dựng các dịch vụ, rồi quay về với bản báo cáo. "Tôi không động tay vào thứ gì," Karpathy viết. Ba tháng trước, việc này dễ chiếm trọn một cuối tuần; bây giờ, theo ông, nó là thứ "bấm cho chạy rồi quên đi ba mươi phút."

Từ đó ông rút ra một kết luận lớn: "Bạn không còn gõ mã vào trình soạn thảo theo cái cách đã có từ khi máy tính ra đời, thời ấy đã qua." Công việc mới, theo lời ông, là "khởi động các tác tử AI, giao việc cho chúng bằng tiếng Anh, rồi điều phối và duyệt lại việc chúng làm, song song."

Người viết mã chuyên nghiệp nên đọc nốt phần còn lại của bài, vì Karpathy không hề nói công cụ là phép màu. "Nó chưa hoàn hảo," ông viết. Nó cần "định hướng ở tầm cao, óc phán đoán, khiếu thẩm mỹ, sự giám sát, làm đi làm lại, gợi ý và ý tưởng." Nó chạy tốt hơn hẳn trong một số trường hợp, "nhất là với những việc được mô tả rõ ràng, và kiểm chứng/thử nghiệm được." Cái tài, theo ông, là tập được trực giác để "chia nhỏ công việc cho thật đúng," giao những phần máy làm được và tự mình lo phần mép rìa.

Vậy là trong một bài có hai lời khẳng định. Một: nghề này thay đổi đột ngột và trọn vẹn. Hai: nó thay đổi nhiều nhất ở chỗ công việc mô tả được và kiểm chứng được. Một ngày cuối tuần của một chuyên gia không đủ để phân xử lời nào. Phần còn lại của bài này xem báo chí và giới học thuật thực sự đã đo được gì.

2. Ba Thời Kỳ Trong Năm Năm

Từ năm 2021, cụm "AI viết mã" đã chỉ ba hoạt động khác nhau, và phần lớn nghiên cứu ban đầu chỉ đo hoạt động thứ nhất. Phải nắm đúng mốc thời gian thì mới đọc đúng các con số.

Gợi ý tự động (khoảng 2021–2023). Người gõ; công cụ gợi ý dòng hoặc khối mã kế tiếp bằng chữ xám; người bấm Tab hoặc gõ tiếp. GitHub Copilot đưa lối này thành phổ biến. Người vẫn là người viết chương trình; công cụ chỉ đoán trước vài phím sắp gõ.

Trò chuyện (khoảng 2023–2024). Người dán một hàm vào cửa sổ chat, đặt câu hỏi, rồi chép câu trả lời về. Công cụ giờ biết giải thích và viết nháp, nhưng không nhìn thấy cả dự án, không chạy được gì, và cần người chuyển chữ qua lại.

Tác tử (từ 2025). Người mô tả việc cần làm bằng tiếng Anh. Công cụ đọc kho mã, sửa tập tin, chạy lệnh và chạy thử, đọc lỗi, rồi thử lại cho đến khi xong hoặc bí. Đây là điều Karpathy mô tả.

Ngôn ngữ đổi nhanh không kém công cụ. Tháng 2 năm 2025, Karpathy đặt ra cụm từ "vibe coding" (tạm dịch: viết mã theo cảm hứng) cho một lối lập trình trong đó mình thôi đọc mã, chỉ mô tả điều mình muốn, và nhận bất cứ thứ gì AI làm ra miễn là nó có vẻ chạy. Đến tháng Mười Một, từ điển Collins chọn vibe coding làm Từ của Năm, định nghĩa là lối phát triển phần mềm "biến ngôn ngữ tự nhiên thành mã máy tính nhờ AI." Một bài đăng nửa đùa nửa thật trở thành mục từ trong từ điển chỉ sau chín tháng.

Công cụ tôi đang có cũng đi đúng con đường ấy. GitHub đưa "coding agent" của Copilot ra thử nghiệm công khai vào tháng 5 năm 2025, và ngày 25 tháng 9 năm 2025 thì tuyên bố chính thức phát hành cho mọi người dùng Copilot trả phí: mình giao việc, nó "mở một pull request nháp và làm việc ngầm trong môi trường phát triển riêng của nó," xong thì nhờ mình duyệt. Ngày 25 tháng 2 năm 2026, đúng hôm Karpathy đăng bài, GitHub chính thức phát hành Copilot CLI cho các gói Pro, Pro+, Business và Enterprise. Đó là một tác tử chạy trong cửa sổ dòng lệnh, có chế độ lập kế hoạch (plan mode) biết hỏi lại và soạn kế hoạch trước khi viết mã, chế độ "lái tự động" (autopilot) chạy lệnh không cần chờ duyệt từng bước, các tác tử phụ chạy song song, cách chuyển việc lên tác tử trên mây, và bộ nhớ giữ lại quy ước của kho mã từ phiên này sang phiên khác. Với gói Business và Enterprise, người quản trị phải bật nó lên trước.

Các công ty lớn kể cùng câu chuyện bằng con số, nhưng phải đọc cho cẩn thận. Tháng 4 năm 2026, tổng giám đốc Google Sundar Pichai nói rằng 75% mã mới của công ty là do AI tạo ra, tăng từ khoảng một phần tư năm 2024 và khoảng một nửa vào mùa thu trước đó, và mô tả quy trình là "thực sự theo lối tác tử," với kỹ sư giám sát những đội tác tử AI. Một năm trước đó, Satya Nadella của Microsoft nói "có lẽ 20%, 30%" mã trong các kho của Microsoft là do phần mềm viết. Không công ty nào nói rõ họ đếm cái gì là "do AI tạo ra": số dòng, số gợi ý được chấp nhận, hay số lần commit. Semafor ghi nhận rằng có những lời của Pichai rất khó kiểm chứng. Các con số này cho thấy hướng đi, chứ không phải phép đo, và hai con số ấy thậm chí không đo cùng một thứ.

3. Các Thử Nghiệm Có Đối Chứng Tìm Thấy Gì

Muốn biết AI có làm lập trình viên nhanh hơn không, bằng chứng tốt nhất là thử nghiệm ngẫu nhiên: bốc thăm cho một số người dùng công cụ, số khác không, rồi so sánh. Đến nay đã có đủ những thử nghiệm như thế để kể thành chuyện, và câu chuyện thú vị hơn cả "nhanh hơn" lẫn "chậm hơn." Tôi kể theo thứ tự thời gian.

Năm 2023: một bài tập trong phòng thí nghiệm, nhanh hơn 55,8%. Sida Peng, Eirini Kalliamvakou, Peter Cihon và Mert Demirer yêu cầu các lập trình viên được tuyển viết một máy chủ HTTP bằng JavaScript nhanh nhất có thể. Nhóm có GitHub Copilot "hoàn thành nhanh hơn nhóm đối chứng 55,8%." Đây là con số đã đi vào cả ngàn bản thuyết trình. Nó cũng là một loại việc rất đặc biệt: nhỏ, khép kín, làm mới từ đầu, và biết rõ thế nào là xong. Đó đúng là loại việc mà sau này Karpathy nói tác tử làm giỏi nhất.

Năm 2022–2024: công ty thật, hoàn thành nhiều hơn khoảng 26% đầu việc. Các nhà kinh tế Cui, Demirer, Jaffe, Musolff, Peng và Salz phân tích ba đợt triển khai Copilot ngẫu nhiên mà Microsoft, Accenture và một hãng điện tử ẩn danh trong danh sách Fortune 100 đã tiến hành trong công việc thường ngày. Gộp 4.867 lập trình viên, họ ước tính số đầu việc hoàn thành tăng 26,08% ở nhóm có công cụ. Sai số chuẩn khá lớn (10,3 điểm phần trăm), và từng thử nghiệm riêng lẻ thì nhiễu. Có một phát hiện nổi bật: người ít kinh nghiệm dùng công cụ nhiều hơn và được lợi nhiều hơn. Bài này nay đã đăng trên tạp chí Management Science, và bản tóm tắt của MIT Sloan là lối vào dễ nhất cho người đọc phổ thông.

Đầu năm 2025: chuyên gia trong mã của chính mình, chậm hơn 19%. Rồi đến nghiên cứu lên báo vì lý do ngược lại. Nhóm nghiên cứu METR tuyển 16 lập trình viên mã nguồn mở nhiều kinh nghiệm, làm việc trên những kho mã lớn, nổi tiếng (trung bình hơn 22.000 sao trên GitHub và hơn một triệu dòng mã) mà họ đã đóng góp nhiều năm. Mỗi việc trong số 246 việc thật được bốc thăm: hoặc cho dùng AI, hoặc cấm. Khi được dùng AI, các việc mất thời gian lâu hơn 19%.

Chỗ chậm lại chưa phải con số thú vị nhất. Trước nghiên cứu, các lập trình viên đoán AI sẽ giúp họ nhanh hơn 24%. Sau nghiên cứu, dù vừa bị đo là chậm hơn, họ vẫn tin AI đã giúp họ nhanh hơn khoảng 20%. Theo tôi, khoảng cách giữa điều người ta cảm thấy và điều đo được này là phát hiện có ích nhất trong cả lĩnh vực, và tôi sẽ còn trở lại với nó.

Cuối năm 2025: thử nghiệm không làm nổi. METR làm lại nghiên cứu với công cụ mới hơn, bắt đầu từ tháng 8 năm 2025, và ngày 24 tháng 2 năm 2026, một ngày trước bài của Karpathy, công bố chuyện gì đã xảy ra. Ước tính điểm giờ nghiêng về phía ngược lại: nhanh hơn khoảng 18% với những người tham gia lần trước (khoảng tin cậy từ nhanh hơn 38% đến chậm hơn 9%) và nhanh hơn khoảng 4% với người mới tuyển (từ nhanh hơn 15% đến chậm hơn 9%). Nhưng METR không chịu đứng sau những con số ấy. Lý do chính là "số lập trình viên từ chối tham gia tăng đáng kể vì họ không muốn làm việc mà không có AI." Có người giữ lại những việc họ không muốn làm bằng tay. Có người chạy nhiều tác tử cùng lúc, khiến thời gian làm việc của họ khó đo. METR nói họ tin lập trình viên bây giờ được tăng tốc nhiều hơn đầu năm 2025, nhưng dữ liệu của họ "chỉ là bằng chứng rất yếu về độ lớn của mức tăng ấy." Trang công bố nghiên cứu năm 2025 nay có thêm ghi chú rằng kết quả đã lỗi thời.

Nói cách khác, chính chuyện không đo được đã trở thành một phát hiện. Khi người đi làm chuyên nghiệp không chịu bỏ công cụ vài tuần, kể cả có được trả tiền, thì khó mà lập được nhóm đối chứng. Điều đó nói lên công cụ đã ăn sâu đến mức nào, dù nó không nói được công cụ giúp được bao nhiêu.

Giữa năm 2026: METR tự tóm tắt. Trong Báo cáo Rủi ro Tuyến đầu tháng 2–3 năm 2026, METR xếp kết quả thử nghiệm cuối 2025 là "lợi ích năng suất nhỏ (khoảng 4–20%)," nhiều khả năng còn thấp hơn thực tế. Cũng trong báo cáo ấy, METR ghi nhận khi chỉ hỏi lập trình viên thì mức họ tự báo cáo dao động từ khoảng 1,6 lần đến 4 lần tùy cách đặt câu hỏi, và rằng tự báo cáo từng thổi phồng lợi ích trước đây. Một cuộc khảo sát riêng của METR với 349 người làm kỹ thuật thấy mức trung vị tự báo cáo là giá trị công việc tăng 1,4 đến 2 lần, tốc độ tăng 3 lần. Chính METR liệt kê lý do để nghi cả hai, bắt đầu từ phát hiện trước đó của họ rằng lập trình viên đã đoán sai tác động của AI lên thời gian của mình khoảng 40 điểm phần trăm.

Đặt năm kết quả cạnh nhau, ta rút ra được ba bài học.

Một, lợi ích phụ thuộc rất nhiều vào loại việc. Nó lớn nhất ở những việc nhỏ, mới, mô tả rõ, và nhỏ nhất ở chuyên gia làm trong kho mã lớn họ đã thuộc lòng. Điều này không trái với Karpathy; nó chính là lời dè dặt của ông, được đo ra.

Hai, cảm thấy nhanh hơn không phải là bằng chứng của nhanh hơn. Năm 2025, những lập trình viên nhiều kinh nghiệm đoán sai cả chiều của tác động, không chỉ độ lớn. Mọi cảm nhận riêng, kể cả của tôi, đều phải được đối chiếu với cái đồng hồ.

Ba, lĩnh vực này chạy nhanh hơn dụng cụ đo của nó. Công cụ đã đổi ngay giữa lúc một nghiên cứu đang chạy. Nhóm nghiên cứu cẩn thận nhất trong ngành thành thật nói họ chưa biết tác động hiện nay lớn cỡ nào. Đó là câu trả lời tốt hơn một con số quả quyết.

4. Đường Cong Năng Lực Đằng Sau Cảm Giác "Tháng Mười Hai"

Nếu mức tăng tốc đo được chỉ khiêm tốn, sao Karpathy lại thấy một bước ngoặt gắt như vậy vào tháng Mười Hai? Một phần câu trả lời là một đường cong mà METR theo dõi từ năm 2019.

Ý tưởng đơn giản. Lấy một bộ việc phần mềm, đo xem người giỏi mất bao lâu để làm mỗi việc, rồi tìm độ dài việc mà một mô hình AI làm thành công một nửa số lần. Gọi đó là "tầm thời gian" (time horizon) của mô hình. Trong một bài công bố lần đầu tháng 3 năm 2025, Thomas Kwa và cộng sự thấy tầm thời gian của các mô hình hàng đầu đã tăng gấp đôi khoảng mỗi bảy tháng kể từ 2019, có lẽ còn nhanh hơn trong năm 2024. Lúc đó, mô hình giỏi nhất có tầm khoảng năm mươi phút. Ước tính của METR cho các mô hình công khai giỏi nhất vào tháng 2–3 năm 2026 là khoảng mười hai giờ, với khoảng bất định rộng, từ năm đến sáu mươi mốt giờ.

Một đường cong gấp đôi giải thích vì sao thay đổi có thể cảm thấy đột ngột. Mỗi bước tăng cùng một tỉ lệ, nhưng đến một lúc các bước ấy vượt qua độ dài của những công việc thật. Một mô hình làm chắc được việc bốn mươi phút là một người phụ. Một mô hình làm được việc vài tiếng là thứ mình giao cả buổi tối rồi đi chỗ khác, đúng như Karpathy đã làm.

METR nhấn mạnh hai lời cảnh báo, và cả hai đều quan trọng với ai sắp bắt đầu làm theo lối này. Thứ nhất, tầm thời gian 50% bằng X giờ không có nghĩa là mình giao được mọi việc ngắn hơn X giờ. Một nửa số lần không phải là hầu hết số lần.

Cảnh báo thứ hai sắc hơn. Tháng 3 năm 2026, METR nhờ chính những người bảo trì (maintainer) của scikit-learn, Sphinx và pytest duyệt 296 pull request do AI viết, vốn đã qua được các bài kiểm tra tự động của bộ chuẩn SWE-bench Verified. Khoảng một nửa số PR đã qua kiểm tra ấy sẽ không được nhận vào. Lý do đi từ văn phong và không theo quy ước của dự án, qua làm hỏng mã khác, đến nặng nhất: vấn đề thật ra chưa được giải quyết. (Để so sánh, người bảo trì cũng chỉ nhận khoảng 68% bản sửa gốc do người viết, nên ngay cả bản vá của người cũng không tự nhiên được nhận.) Các tác giả lưu ý đây không phải giới hạn cứng, vì tác tử không được hưởng vòng duyệt-rồi-sửa như người đóng góp. Nhưng nó cho thấy qua được bài kiểm tra và là mã tốt là hai chuyện khác nhau. Lời dè dặt về "giám sát" của Karpathy không phải chuyện lấy lệ.

5. Lập Trình Viên Nói Gì

Thử nghiệm có đối chứng thì nhỏ. Khảo sát thì lớn. Chúng đo những thứ khác nhau: khảo sát cho biết người ta làm gì và tin gì, chứ không cho biết sản phẩm của họ thực sự ra sao. Với lưu ý đó, hai cuộc khảo sát lớn nhất cùng vẽ một bức tranh. Gần như ai cũng dùng, nhưng không phải ai cũng tin.

Chương trình nghiên cứu DORA của Google khảo sát giới làm phần mềm hằng năm. Báo cáo 2024, với hơn 39.000 người trả lời, thấy một điều khó chịu: ở những nơi đã áp dụng AI, năng suất giao phần mềm (throughput) giảm khoảng 1,5% và độ ổn định giảm khoảng 7,2%, và 39% người trả lời nói họ tin ít hoặc không tin mã do AI tạo ra.

Báo cáo 2025, đổi tên thành Hiện trạng phát triển phần mềm có AI hỗ trợ và dựa trên gần 5.000 người, thấy 90% đã dùng AI trong công việc, tăng 14 điểm, trung vị khoảng hai giờ mỗi ngày. Hơn 80% nói AI làm họ năng suất hơn, 59% nói chất lượng mã tốt lên. Việc áp dụng AI nay gắn với năng suất giao phần mềm cao hơn, đảo ngược kết quả năm trước, dù DORA ghi nhận bảo đảm phần mềm chạy đúng ý trước khi phát hành vẫn còn là thách thức. Lòng tin vẫn thấp: chỉ 24% tin AI "nhiều" hoặc "rất nhiều," trong khi 30% tin "chút ít" hoặc "không tin." DORA gọi đây là nghịch lý lòng tin: người ta dựa vào một công cụ mình không hoàn toàn tin.

Kết luận chính của báo cáo là điều tôi thấy có ích nhất. AI, theo báo cáo, là "một tấm gương và một cấp số nhân." Ở một tổ chức vận hành tốt, nó nhân cái mạnh lên; ở một tổ chức rời rạc, nó phơi cái yếu ra. DORA chia các nhóm làm bảy kiểu và đề xuất bảy năng lực tổ chức quyết định AI có giúp được hay không. Ý chính là công cụ không tạo ra lối làm kỹ thuật tốt. Nó chỉ phóng to cái lối làm sẵn có.

Khảo sát Lập trình viên 2026 của Stack Overflow, công bố ngày 6 tháng 10 với hơn 30.000 người trả lời, cho thấy thời tác tử đã lan rộng đến đâu. Trong số người dùng AI, 66% dùng tác tử viết mã, 63% dùng chatbot. Hai tác tử được dùng nhiều nhất là Claude Code (66%) và GitHub Copilot (59%). Trong những người dùng trợ lý hay tác tử viết mã, 73% dùng hằng ngày, và khoảng một phần ba người dùng hằng ngày ngồi với chúng từ bốn tiếng trở lên. Nhìn chung, 62% có cái nhìn ít nhiều tích cực về AI, và 93% nói cần thấy nguồn mới tin câu trả lời của AI.

Khảo sát còn cho thấy chỗ nào lập trình viên dùng tác tử, và đây là điều tôi muốn chỉ ra. Hai việc dùng nhiều nhất là viết mã trong mảng mình đã quen (67%) và gỡ lỗi (61%). Chỉ 20% dùng AI để triển khai, vận hành hay xử lý sự cố hệ thống đang chạy thật (production). Lập trình viên đã tự mình tìm ra quy tắc của Karpathy: dùng tác tử ở chỗ mình tự kiểm được kết quả, và để nó tránh xa những nơi một lỗi sai tốn kém nhất.

6. Hóa Đơn: Chất Lượng Và Bảo Mật

Nếu tốc độ là cái được, thì chất lượng và bảo mật là cái giá, và cái giá ấy được ghi chép kỹ hơn nhiều người hâm mộ chịu nhận. Các nghiên cứu đến từ nhiều nơi khác nhau, nhưng cùng chỉ về một cơ chế: sự tự tin tăng nhanh hơn sự đúng đắn.

Bằng chứng học thuật rõ nhất đến từ Stanford. Neil Perry, Megha Srivastava, Deepak Kumar và Dan Boneh làm một nghiên cứu người dùng, trình bày tại Hội nghị ACM về An ninh Máy tính và Truyền thông năm 2023, trong đó người tham gia làm các bài lập trình liên quan đến bảo mật, có hoặc không có một trợ lý AI xây trên Codex của OpenAI. Nhóm có trợ lý viết mã kém an toàn hơn rõ rệt, và lại dễ tin rằng mã mình an toàn hơn. Những người ít tin AI hơn, chịu khó đặt và chỉnh câu lệnh (prompt) hơn, thì viết ra mã ít lỗ hổng hơn. Công cụ đã tiến bộ nhiều kể từ đó, nhưng phía con người của phát hiện này chưa mất đi: được giúp làm ta thấy an toàn hơn mức nó thực sự làm ta an toàn.

Các nghiên cứu của giới công nghiệp chỉ cùng hướng, dù phải đọc đúng như bản chất của chúng. Công ty bảo mật Veracode thử hơn 100 mô hình ngôn ngữ trên 80 bài lập trình dựng quanh các loại điểm yếu đã biết, và thấy mã được tạo ra có lỗi bảo mật trong 45% trường hợp. Java tệ nhất, hỏng hơn 70%. Các mô hình không chặn được tấn công cross-site scripting trong 86% trường hợp liên quan và log injection trong 88%. "Các mô hình ngày càng viết mã chính xác hơn nhưng không giỏi hơn về bảo mật," ông Jens Wessling của Veracode nói. Veracode bán dịch vụ quét bảo mật, và các bài thử được dựng cho chính bộ phân tích của họ, nên đây là thước đo của một công ty, không phải một cuộc kiểm kê trung lập. Nhưng hướng đi khớp với Stanford.

GitClear, một công ty bán công cụ phân tích mã, nghiên cứu 211 triệu dòng mã thay đổi từ 2020 đến 2024. Họ thấy các khối từ năm dòng trùng lặp trở lên tăng tám lần trong năm 2024, số dòng "di chuyển", dấu hiệu thường thấy của việc tái cấu trúc (refactoring), giảm khoảng 40%, và 2024 là năm đầu tiên số dòng chép-dán vượt số dòng di chuyển. Lý do có lẽ đơn giản: trợ lý dán một khối mới thì dễ hơn đi tìm và dùng lại một hàm sẵn có mà nó không nhìn thấy. Một lần nữa, dữ liệu phần lớn đến từ khách hàng của chính GitClear, và công ty có quyền lợi trong kết quả.

Phiên bản gọn nhất của cả mục này là nghiên cứu về PR của METR ở mục 4. Mã qua được bài kiểm tra vẫn có thể là mã mà những người chịu trách nhiệm về dự án không chịu nhận. Bài kiểm tra chỉ kiểm những gì có người đã nghĩ ra để kiểm. Tính dễ bảo trì, bảo mật và sự hợp với quy ước của dự án là do con người phán xét, và sự phán xét ấy chính là phần Karpathy nói vẫn cần con người.

7. Ai Trả Giá: Tay Nghề Và Lớp Người Mới

Những phát hiện học thuật sắc nhất năm 2026 không nói về tốc độ. Chúng nói về việc học, và về chuyện ai được tuyển.

Tháng 1 năm 2026, Anthropic công bố một thử nghiệm ngẫu nhiên có đối chứng của Judy Hanwen Shen và Alex Tamkin về việc trợ giúp của AI ảnh hưởng ra sao đến sự hình thành tay nghề viết mã (toàn văn trên arXiv). Năm mươi hai kỹ sư, phần lớn còn non nghề, học Trio, một thư viện Python cho lập trình bất đồng bộ mà chưa ai từng dùng, bằng cách làm hai tính năng. Một nửa được dùng trợ lý AI. Sau đó mọi người làm bài kiểm tra. Nhóm dùng AI được khoảng 50%; nhóm tự viết tay được khoảng 67%. Chênh lệch có ý nghĩa thống kê, và khoảng cách lớn nhất nằm ở các câu hỏi về gỡ lỗi. Nhóm dùng AI cũng không nhanh hơn đáng kể: khoảng hai phút, và có người mất đến mười một phút chỉ để soạn câu hỏi cho AI.

Điều làm nghiên cứu này có ích, chứ không chỉ đáng lo, là những gì nó thấy về cách người ta dùng trợ lý. Những ai giao hết việc viết mã cho AI, hoặc dần dần dựa hẳn vào nó, hoặc dùng nó để gỡ lỗi thay vì để hiểu, trung bình dưới 40%. Những ai chỉ hỏi về khái niệm và tự sửa lỗi của mình, hoặc xin mã kèm lời giải thích, hoặc cho AI viết mã rồi hỏi tiếp về đoạn mã ấy, thì đạt từ 65% trở lên. Nhóm chỉ hỏi khái niệm lại còn nhanh thứ nhì. Câu tóm tắt của các tác giả đáng chép lại: "Nỗ lực trí óc, và cả việc bị bí đến khổ sở, nhiều khả năng là điều quan trọng để đạt đến sự thành thạo." Họ cẩn thận nói rằng các kiểu dùng này chỉ là tương quan từ một mẫu nhỏ, và bài kiểm tra đo mức hiểu ngay sau khi làm, chứ không đo việc nhớ lâu.

Số liệu lao động là phần mà ai cũng nên lo, không riêng người mới. Erik Brynjolfsson, Bharat Chandar và Ruyu Chen ở Phòng nghiên cứu Kinh tế Số của Stanford theo dõi dữ liệu bảng lương của ADP, phủ hàng triệu người lao động Mỹ. Bản mới nhất của bài "Những con chim hoàng yến trong mỏ than?", đề tháng 8 năm 2026 với dữ liệu đến tháng 6 năm 2026, nêu sáu sự kiện. Không có dấu hiệu mất việc trên toàn nền kinh tế. Nhưng việc làm của người 22 đến 25 tuổi trong những nghề chịu tác động AI nhiều nhất "nay thấp hơn 19% so với mức lẽ ra phải có nếu theo kịp những người cùng lứa ít chịu tác động hơn," trong khi người có kinh nghiệm không có khoảng cách như vậy. Khoảng cách này rộng dần đều đặn kể từ khi các tác giả báo cáo lần đầu vào tháng 8 năm 2025. Nó diễn ra chủ yếu qua việc tuyển ít đi người trẻ, chứ không phải sa thải nhiều hơn. Nó tập trung ở những nghề mà AI chủ yếu thay thế công việc của người, còn ở những nghề AI chủ yếu bổ trợ người làm, nhất là người có kinh nghiệm, thì việc làm đứng yên hoặc tăng. Lập trình viên phần mềm là một trong những nghề được bài xem xét kỹ. Tác động vẫn còn khi loại các công ty công nghệ và các nghề máy tính ra. Các tác giả gọi đây là "những chỉ báo sớm, mang tính mô tả," chứ không phải bằng chứng nhân quả, và tự liệt kê các điểm cần dè dặt.

Đặt ba phát hiện cạnh nhau, ta thấy một mâu thuẫn ngay giữa lòng vấn đề. Các thử nghiệm Copilot ở công ty thấy người mới được lợi nhiều nhất về sản lượng. Thử nghiệm của Anthropic thấy người mới có thể học được ít hơn khi dùng AI, tùy cách dùng. Số liệu của Stanford thấy người mới được tuyển ít đi ở những nghề chịu tác động nhiều nhất. Công cụ giúp người mới làm ra sản phẩm, có thể làm chậm sự trưởng thành của họ, và khiến chủ thuê ít muốn tuyển họ ngay từ đầu. Kỹ sư lâu năm nào cũng từng là người mới bị bí đến khổ sở. Nếu nghề này thôi tuyển và thôi đào tạo người mới, thì thế hệ kế tiếp của những người làm phần "giám sát" mà Karpathy nói đến sẽ từ đâu ra?

8. Công Việc Biến Thành Gì

Nếu việc gõ phím chuyển sang máy, lập trình viên còn lại gì? Câu trả lời của Karpathy là công việc dời lên một tầng: "Phần thưởng lớn nhất là tìm ra cách cứ tiếp tục leo lên các tầng trừu tượng," dựng những tác tử điều phối chạy dài hạn "với đủ công cụ, bộ nhớ và chỉ dẫn đúng" để quản lý nhiều tác tử viết mã cùng lúc.

Có bằng chứng cho thấy sự dịch chuyển này đang diễn ra, chứ không chỉ là lời dự đoán. Tháng 4 năm 2025, Chỉ số Kinh tế của Anthropic xem nửa triệu lượt tương tác, chia giữa giao diện chat và công cụ tác tử, và thấy 79% cuộc trao đổi trong Claude Code, công cụ tác tử của họ, là "tự động hóa", tức AI làm thẳng công việc, so với 49% ở giao diện chat thông thường. Việc của các công ty khởi nghiệp chiếm phần lớn hơn việc của doanh nghiệp lớn trong số lần dùng tác tử (khoảng 33% so với 24%), một dấu hiệu về ai đi trước. Đó là ảnh chụp đầu năm 2025, trước bước ngoặt tháng Mười Hai. Lời Pichai về kỹ sư Google giám sát những đội AI tự hành là một dấu hiệu khác, và một chi tiết nhỏ trong thử nghiệm của METR cũng vậy: lập trình viên chạy nhiều tác tử song song đến mức thời gian làm việc của họ không còn đo gọn được nữa.

Phần ở lại với con người nay rõ hơn hai năm trước. Phải có người viết đặc tả và quyết định thế nào là "xong." Phải có người chia việc thành những phần tác tử làm được và người kiểm được. Phải có người đọc bản thay đổi (diff), phán xét thiết kế, chịu trách nhiệm bảo mật, và biết nói "không." Câu "tấm gương và cấp số nhân" của DORA thuộc về chỗ này. Một tác tử thả vào một nhóm có bài kiểm tra tốt, quy ước rõ và khâu duyệt cẩn thận sẽ nhân tất cả những thứ đó lên. Thả vào một nhóm thiếu những thứ ấy, nó nhân cái thiếu lên.

9. Cả Hai Câu Chuyện Đều Đúng

Karpathy kết bài bằng câu: đây "hoàn toàn không phải lúc 'mọi việc vẫn như thường' trong ngành phần mềm." Bằng chứng đồng ý với ông về hướng đi. Gần như mọi lập trình viên chuyên nghiệp nay đều dùng AI. Tác tử làm được những việc ngày càng dài, theo một đường cong đã đứng vững nhiều năm. Các công ty báo rằng phần lớn mã mới của họ do máy viết, và nghề này đang chuyển từ gõ phím sang đặc tả, chia việc và duyệt lại.

Bằng chứng không đồng ý với sự hào hứng về độ lớn và cái giá. Những thử nghiệm có đối chứng tốt nhất cho thấy lợi ích đi từ lớn ở những việc nhỏ, mới, đến khiêm tốn, thậm chí âm, ở chuyên gia làm trong mã họ đã thuộc, và người trong các thử nghiệm ấy đoán sai tốc độ của chính mình. Mã qua được bài kiểm tra vẫn bị người bảo trì từ chối một nửa số lần. Lỗi bảo mật còn phổ biến, và sự trợ giúp khiến người ta tự tin quá mức. Người mới học được ít hơn khi chỉ giao việc, và ít người mới được tuyển hơn.

Ba điều sẽ cho thấy câu chuyện nào thắng trong khoảng một năm tới, và điều nào cũng kiểm được. Một, liệu các nghiên cứu thiết kế lại của METR có cho ra một ước tính tăng tốc mà họ dám đứng sau hay không. Hai, liệu khoảng cách của người lao động trẻ trong số liệu Stanford còn tiếp tục rộng ra hay bắt đầu thu hẹp. Ba, liệu tỉ lệ pull request do tác tử viết được người bảo trì thật sự nhận có đuổi kịp tỉ lệ qua được bài kiểm tra hay không.

Tôi cứ trở lại với ba mươi phút ấy. Tác tử làm việc, và Karpathy không động tay vào gì. Nhưng ông biết phải đòi cái gì, theo thứ tự nào, kết quả xong phải trông ra sao, và biết đọc bản báo cáo nó đưa về. Thời gõ phím có thể đã qua. Thời phải biết thì chưa.


Nguồn tham khảo

  1. Andrej Karpathy, bài đăng trên X, 25/2/2026; bản lưu của Simon Willison, 26/2/2026.
  2. AFP qua The Korea Times, 'Vibe coding' được Collins chọn là Từ của Năm, 6/11/2025.
  3. GitHub Changelog, Copilot coding agent chính thức phát hành, 25/9/2025.
  4. GitHub Changelog, GitHub Copilot CLI chính thức phát hành, 25/2/2026.
  5. Semafor, Tổng giám đốc Google nói 75% mã mới của công ty do AI tạo ra, 24/4/2026.
  6. TechRepublic, Nadella: 20% đến 30% mã của Microsoft do AI viết, 4/2025.
  7. Peng, Kalliamvakou, Cihon, Demirer, The Impact of AI on Developer Productivity: Evidence from GitHub Copilot, arXiv, 2023.
  8. Cui, Demirer, Jaffe, Musolff, Peng, Salz, The Effects of Generative AI on High-Skilled Work, Management Science; tóm tắt của MIT Sloan.
  9. METR, Đo tác động của AI đầu 2025 lên năng suất lập trình viên mã nguồn mở nhiều kinh nghiệm, 10/7/2025.
  10. METR, Thay đổi thiết kế thử nghiệm năng suất lập trình viên, 24/2/2026.
  11. METR, Báo cáo Rủi ro Tuyến đầu (tháng 2–3/2026), 19/5/2026.
  12. METR, Khảo sát tự báo cáo về tác động của AI đầu 2026, 11/5/2026.
  13. Kwa và cộng sự, Measuring AI Ability to Complete Long Software Tasks, arXiv, 2025.
  14. METR, Làm rõ giới hạn của tầm thời gian, 22/1/2026.
  15. Whitfill, Wu, Becker, Rush (METR), Nhiều PR qua SWE-bench sẽ không được nhận vào nhánh chính, 10/3/2026.
  16. InfoQ, về báo cáo DORA 2024, 28/11/2024.
  17. Google, Bên trong báo cáo DORA 2025, 23/9/2025.
  18. Stack Overflow, Kết quả Khảo sát Lập trình viên 2026, 6/10/2026.
  19. Perry, Srivastava, Kumar, Boneh, Do Users Write More Insecure Code with AI Assistants?, ACM CCS 2023.
  20. Veracode, Mã do AI tạo ra mang rủi ro bảo mật lớn trong gần một nửa số việc, 30/7/2025.
  21. DevClass, AI đang làm xói mòn chất lượng mã (GitClear), 20/2/2025.
  22. Shen, Tamkin (Anthropic), Trợ giúp của AI ảnh hưởng thế nào đến sự hình thành tay nghề viết mã, 29/1/2026; toàn văn trên arXiv.
  23. Brynjolfsson, Chandar, Chen, Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence, Stanford Digital Economy Lab, bản tháng 8/2026.
  24. Anthropic, Chỉ số Kinh tế Anthropic: tác động của AI lên phát triển phần mềm, 28/4/2025.

Written by: Claude AI.

Curator/Editor: Học Trò.

Mọi trích dẫn đều phải ghi chú với dòng trên và nói rõ bài khảo luận được lấy từ trang https://hoctroviet.blogspot.com/

No comments: