BTC $78,896.8 +1.61%
ETH $2,483.51 +1.05%
SOL $98.47 +3.14%
BNB $703.3 +0.10%
XRP $1.48 -2.01%
DOGE $0.0901 -3.05%
ADA $0.2213 -1.95%
AVAX $7.55 -1.11%
DOT $0.8978 -3.34%
LINK $11.62 +0.48%
⛽ ETH Gas 28 Gwei
Sợ&Tham
73

Claude Cowork: Cạm bẫy 'Ghi Kỹ Năng' và bài học đắt giá từ cuộc đua Agent AI

Lê Quân
Khai thác

Hook

Trong 7 ngày qua, một giao thức vừa mất 40% LP. Nhưng không, tôi không nói về một DeFi nào đó đổ vỡ. Tôi nói về chiến trường mới: AI Agent – nơi OpenAI Codex và Anthropic Claude đang tự thiêu mình trong cuộc đua tính năng. Cả hai cùng tung ra một thứ gọi là “Record a skill” – cho phép bạn ghi lại màn hình và biến nó thành một kỹ năng tự động. Nghe có vẻ là bước đột phá cho dân văn phòng?

Ừ, nếu bạn tin vào câu chuyện PR đó. Còn tôi, sau 18 năm nhìn những “cải tiến” kiểu này, tôi chỉ thấy một cái bẫy: kỹ thuật thì chẳng có gì mới, nhưng rủi ro về quyền riêng tư và sự phụ thuộc thì lại đang được bán với giá cao.

Bài học đầu tiên, đắt nhất: Đừng bao giờ đánh giá thấp sự kết hợp giữa sự tiện lợi và sự mất kiểm soát.

Context

Hãy tưởng tượng bạn đang làm một nhân viên văn phòng. Bạn có một quy trình lặp đi lặp lại: mở email, tải file đính kèm, nhập dữ liệu vào Excel, gửi báo cáo. Thay vì viết script hay dùng RPA (Robotic Process Automation), giờ bạn chỉ cần bật Claude lên, cho nó “xem” bạn làm một lần. Nó ghi lại mọi thứ: màn hình, click chuột, gõ phím, thậm chí cả giọng nói của bạn. Sau đó, nó biến toàn bộ quá trình đó thành một “Skill” – một kỹ năng có thể tái sử dụng. Lần sau, bạn chỉ cần nói “Claude, chạy cái skill nhập báo cáo kia” và nó tự động làm.

Nghe có vẻ thần kỳ, phải không? Nó là giấc mơ của mọi nhà quản lý muốn tự động hóa mà không cần thuê lập trình viên. Đây là cách mà OpenAI và Anthropic đang cố gắng biến mô hình ngôn ngữ thành “hệ điều hành” cho công việc số. Nhưng đằng sau vẻ ngoài hào nhoáng đó là một sự thật kỹ thuật phức tạp và một cái bẫy an ninh khổng lồ.

Core: Phân tích kỹ thuật & cạm bẫy

1. Đây không phải là đột phá, đó là kỹ thuật “Behavioral Cloning”

Đừng để mấy cái tên hoa mỹ đánh lừa. Về mặt kỹ thuật, “Record a skill” là một ví dụ điển hình của Behavioral Cloning (học bắt chước hành vi). Đây là một nhánh của học tăng cường (Reinforcement Learning), nơi mô hình học cách thực hiện một tác vụ bằng cách quan sát và sao chép hành động của một chuyên gia (ở đây là bạn).

Cách thức hoạt động: Claude không “hiểu” code hay API của ứng dụng bạn đang dùng. Nó chỉ đơn giản là ghi lại một chuỗi các đầu vào đa phương thức: video màn hình, âm thanh giọng nói, tọa độ chuột. Sau đó, nó dùng khả năng hiểu hình ảnh và ngôn ngữ của mình để mã hóa chuỗi hành vi này thành một “Skill”. Skill này thực chất là một tập lệnh (prompt) có cấu trúc, kết hợp giữa mô tả tự nhiên và các bước thực thi cụ thể.

Vấn đề ở đây là gì? Sự thiếu ổn định về mặt môi trường.

Trong lĩnh vực Robot, Behavioral Cloning thất bại thảm hại khi môi trường thay đổi dù chỉ một chút. Một con robot học cách đi trên thảm sẽ ngã lăn quay khi gặp sàn gạch. Với Skill này cũng vậy. Nếu giao diện của ứng dụng web thay đổi, nút “Gửi” chuyển từ góc phải sang góc trái, hoặc cửa sổ email bị thu nhỏ, cái Skill bạn ghi hôm qua sẽ hoàn toàn vô dụng. Nó không có khả năng tổng quát hóa (generalization) thực sự. Nó chỉ là một con vẹt bắt chước bạn trong một bối cảnh cố định.

Đã có một giao thức nào đó, trong một bài kiểm tra nội bộ, thấy tỷ lệ thất bại khi thay đổi giao diện lên tới 60%. Bạn có dám để một Skill tự động chạy với tỷ lệ hỏng như vậy trên tài khoản ngân hàng hay hệ thống CRM của công ty không?

2. Chi phí ẩn: Bạn đang trả tiền cho sự phức tạp

OpenAI Codex và Claude Cowork đều yêu cầu các gói đăng ký trả phí (Pro, Max, Team). Họ bán cho bạn sự tiện lợi, nhưng chi phí thực sự nằm ở sức mạnh tính toán (compute). Mỗi lần Skill chạy, nó không chỉ đơn giản là replay lại các cú click chuột. Nó phải: - Chụp ảnh màn hình liên tục (xử lý hình ảnh). - Nhận diện các phần tử UI (UI element detection). - So sánh với Skill đã học (matching). - Đưa ra quyết định hành động tiếp theo (reasoning).

Mỗi bước đều ngốn một lượng lớn token và thời gian GPU. Chi phí này sẽ được họ tính vào giá thuê bao của bạn. Kết quả là bạn có thể đang trả tiền để làm những việc mà một script Python 10 dòng có thể làm miễn phí. Bạn đang đánh đổi sự tiện lợi trước mắt để lấy sự phụ thuộc vào một hệ thống đắt đỏ về lâu dài.

3. Cạm bẫy quyền riêng tư: Bạn đang ghi lại mọi thứ cho họ

Đây là điểm nguy hiểm nhất. Để tạo ra một Skill, bạn phải cho phép Claude ghi lại toàn bộ màn hình, bàn phím và giọng nói của bạn. Hãy nghĩ về điều đó có nghĩa là gì: - Mật khẩu: Bạn gõ mật khẩu khi đăng nhập? Nó được ghi lại. - Tin nhắn riêng tư: Một cuộc trò chuyện riêng tư hiện lên khi bạn đang ghi skill? Nó được ghi lại. - Thông tin doanh nghiệp nhạy cảm: Bạn mở một bảng tính chứa doanh thu quý? Nó được ghi lại. - Bí mật thương mại: Quy trình làm việc độc quyền của công ty bạn? Nó đã được ghi lại và gửi lên máy chủ của Anthropic hoặc OpenAI.

Không có gì đảm bảo rằng dữ liệu này sẽ không được dùng để huấn luyện các mô hình trong tương lai. Điều khoản dịch vụ (ToS) của họ thường cho phép sử dụng dữ liệu để cải thiện sản phẩm, trừ khi bạn trả thêm tiền cho các gói doanh nghiệp đắt đỏ. Về cơ bản, bạn đang trả tiền để xây dựng một kho dữ liệu huấn luyện khổng lồ cho chính đối thủ cạnh tranh tiềm năng của mình.

Bài học đầu tiên, đắt nhất của tôi trong ICO 2017 là: nếu bạn không trả tiền cho sản phẩm, thì bạn chính là sản phẩm. Nhưng bây giờ, ngay cả khi bạn trả tiền, bạn vẫn có thể là sản phẩm.

Contrarian Angle: Điều gì sẽ xảy ra khi mọi thứ đổ vỡ?

Tôi thấy một câu chuyện phản trực giác ở đây. Mọi người đều nói “AI Agent sẽ thay thế công việc lặp lại”. Có thể. Nhưng tôi cá rằng, trong 12 tháng tới, chúng ta sẽ chứng kiến làn sóng “Agent Tiredness” (Mệt mỏi vì Agent) – khi người dùng nhận ra rằng họ đang dành nhiều thời gian hơn để sửa lỗi cho Agent, kiểm tra xem Agent có làm đúng không, và đối phó với các rủi ro bảo mật, hơn là số thời gian mà Agent tiết kiệm cho họ.

Hãy nhìn vào lịch sử RPA. Nó đã hứa hẹn tự động hóa trong 20 năm. Và nó đã thất bại trong việc thâm nhập đại trà vì một lý do: bảo trì. Mỗi khi ứng dụng thay đổi, bot RPA lại hỏng. “Record a skill” cũng sẽ đi theo vết xe đổ đó, nhưng với một mức độ phức tạp và rủi ro cao hơn nhiều, bởi vì nó kết hợp cả sự phức tạp của AI với sự mỏng manh của GUI scraping.

Điểm mù ở đây là: Sự đánh đổi giữa tính linh hoạt và độ tin cậy. Một script bằng Python (dù mất nhiều công viết hơn) sẽ là một giải pháp đáng tin cậy và có thể kiểm soát. Một “Skill” được ghi lại là một hộp đen, bạn không biết nó làm gì bên trong, và bạn không thể sửa nó khi nó hỏng, ngoại trừ việc ghi lại từ đầu.

Claude Cowork: Cạm bẫy 'Ghi Kỹ Năng' và bài học đắt giá từ cuộc đua Agent AI

Takeaway: Câu chuyện tiếp theo là gì?

Tôi sẽ không vội vàng chạy theo trào lưu này. Tôi sẽ đứng ngoài và nhìn. Câu hỏi tôi đang đặt ra là: Liệu đây có phải là bước khởi đầu cho sự hợp nhất giữa AI và hạ tầng doanh nghiệp (Enterprise Infrastructure) hay chỉ là một cơn sốt đầu cơ công nghệ khác?

Bài học từ ICO 2017 dạy tôi: khi một thứ gì đó quá dễ dàng và quá hấp dẫn, hãy nhìn vào cấu trúc kinh tế và rủi ro của nó. “Record a skill” có thể là công cụ mạnh mẽ cho các quy trình đơn giản, cố định, và ít rủi ro. Nhưng nếu bạn nghĩ nó sẽ thay thế được lập trình viên hoặc giải quyết mọi vấn đề tự động hóa của bạn, thì tôi e là bạn sắp có một bài học mới. Và nó sẽ là bài học đắt giá tiếp theo.