Ứng dụng AI

Ứng dụng AI · AI Agent

9 bài / 30 ngày · #15 trong 28 ứng dụng · 29 người viết

Bài viết trong cộng đồng có nhắc đến Cursor — mẹo dùng, so sánh và sản phẩm làm bằng Cursor.

Sắp xếp

Engineer Cursor merge gần 1.000 PR/tháng bằng AI agents như thế nào

Lauren Tan (@poteto) join Cursor mới 5 tháng: - Tháng trước: 1.000 PR - 12 ngày đầu tháng này: gần 800 PR - Tổng 5 tháng: 3.000+ PR Bạn này đang chia sẻ cách bạn làm việc ở Cursor. 3000+ PR là code thật của Cursor. Anh Elon Musk quả thật biết tìm nhân tài. Video workshop 1 tiếng này giải thích cách cô ấy đi tới mức đó. Lauren từng làm React Compiler ở Meta, từng làm tech lead và engineering manager ở Netflix. Không phải người ngồi prompt cho có output. Cốt lõi cô ấy nói rất thẳng: - Vấn đề lớn nhất của AI coding không phải generate code, mà là verify code - Nếu agent không tự chạy được sản phẩm, không bấm được UI, không mở simulator, không reproduce bug từ 1 screenshot hay 1 câu mô tả mơ hồ, thì cuối cùng bạn vẫn là bottleneck - Mỗi lần agent đoán mò, đọc thiếu code, đi sai hướng thì viết thành skill - Rồi test skill như test code: nhiều sub-agent chạy song song, có rubric, có model khác chấm điểm lại - Xây môi trường + quy trình + tiêu chí nghiệm thu trước, rồi mới để đàn agent làm việc - Đến mức cho agent tự merge PR. Có buổi sáng thức dậy đã có 20 PR vào main, check lại không vấn đề > `Mình đã dịch + gắn sub tiếng Việt. Ai đi qua thấy hay để lại 1 cmt nhé.`

Kho "gu thẩm mỹ" cho AI code giao diện, hơn 115 nghìn sao

AI viết code giao diện rất nhanh. Nhưng để ý mà xem, sản phẩm nào nó làm ra cũng na ná nhau: vẫn kiểu nền tím hồng đó, vẫn bố cục đó, vẫn mấy cái nút đó. Vấn đề không phải nó code dở. Là nó không có gu. UI UX Pro Max là một kho mở đang giải đúng chỗ đó. Nó là một skill (bộ hướng dẫn cài thêm cho AI, để AI biết làm sâu một việc chuyên môn). Cài xong, bạn bảo "làm cho mình trang bán hàng cho tiệm spa", AI sẽ không lao vào code ngay. Nó chốt trước một bộ thiết kế hoàn chỉnh: → kiểu giao diện hợp ngành → bảng màu, cặp font → bố cục các phần của trang → hiệu ứng, chuyển động → và một danh sách "những thứ đừng làm" riêng cho ngành đó Rồi mới code theo bộ đó. Giống như thay vì thuê thợ xây làm luôn, bạn đưa cho họ bản vẽ của kiến trúc sư trước. Bên trong kho có gì (theo tài liệu của chính kho): 1/ 161 bộ luật thiết kế theo ngành - spa, phòng khám, fintech, nhà hàng, game, portfolio... mỗi ngành một cách làm khác nhau 2/ 84 kiểu giao diện - từ Minimalism, Glassmorphism, Bento Grid tới Dark Mode 3/ 192 bảng màu gắn 1-1 với 192 loại sản phẩm 4/ 74 cặp font đã ghép sẵn, kèm sẵn Google Fonts 5/ Gần 100 nguyên tắc UX kèm các lỗi thường gặp và quy tắc dễ tiếp cận 6/ 22 nền tảng lập trình được hỗ trợ: React, Next.js, Vue, Svelte, Flutter, SwiftUI, Tailwind... 7/ 25 kiểu biểu đồ cho ai làm dashboard Cài được cho nhiều công cụ: Claude Code, Cursor, Windsurf, GitHub Copilot, Codex CLI, Gemini CLI, Antigravity, Warp và nhiều cái khác. Với Claude Code thì hai câu lệnh là xong. Điều mình thấy hay nhất nằm ở ý này: muốn AI làm ra thứ đẹp, đừng bắt nó đoán. Hãy đưa cho nó cái gu. Bạn nào đang để AI dựng giao diện thì vào xem thử, thấy hợp thì lưu bài lại. Link mình để ngay bình luận nhé 👇

Prompt Engineering chưa hết nóng, Graph Engineering đã ra lò

Từ Prompt Engineering đến Graph Engineering Chỉ trong khoảng hai năm, cách chúng ta xây dựng AI đã thay đổi rất nhiều. Ban đầu mọi người dành phần lớn thời gian để học Prompt Engineering, tức là học cách giao tiếp với AI. Sau đó đến Context Engineering, nơi trọng tâm chuyển sang việc chuẩn bị đúng dữ liệu và đúng ngữ cảnh để AI có đủ thông tin trước khi suy luận. Đầu năm nay, cộng đồng lại nói rất nhiều về Loop Engineering khi AI Agent bắt đầu biết tự suy nghĩ, tự sử dụng công cụ, tự kiểm tra kết quả rồi lặp lại cho đến khi hoàn thành công việc. Và chỉ vài tuần gần đây, một khái niệm mới lại xuất hiện liên tục trên X, Reddit và các cộng đồng AI: Graph Engineering. Mình thấy Graph Engineering không phải là một kỹ thuật mới mà là hệ quả tất yếu khi AI Agent bắt đầu xử lý những công việc đủ lớn. Andrew Ng mở đầu tài liệu của mình bằng một câu rất đáng chú ý: "Architecture matters more than the model." Nghĩa là khi các mô hình AI ngày càng mạnh và khoảng cách giữa chúng ngày càng thu hẹp, lợi thế cạnh tranh sẽ không còn nằm ở việc dùng GPT, Claude hay Qwen, mà nằm ở cách bạn thiết kế cả hệ thống phía sau. Điều này nghe khá giống với ngành phần mềm. Hai công ty có thể cùng dùng một ngôn ngữ lập trình, cùng dùng một cơ sở dữ liệu, nhưng sản phẩm cuối cùng lại khác nhau hoàn toàn vì kiến trúc hệ thống khác nhau. AI cũng đang bước vào giai đoạn như vậy. Model dần trở thành một thành phần trong hệ thống, thay vì là toàn bộ hệ thống. Vì sao Graph Engineering xuất hiện? Để hiểu vì sao Graph Engineering xuất hiện, trước tiên cần hiểu cách hầu hết AI Agent hiện nay hoạt động. Phần lớn các Agent đều chạy theo một vòng lặp khá đơn giản. Nhận yêu cầu, suy nghĩ, thực hiện hành động, kiểm tra kết quả rồi tiếp tục lặp lại nếu công việc chưa hoàn thành. Đây chính là Loop Engineering. Claude Code, Codex, Cursor hay Qoder đều hoạt động theo tư duy này. Chúng không chỉ trả lời câu hỏi mà có thể tự viết code, chạy terminal, sửa lỗi rồi thử lại nhiều lần cho đến khi chương trình chạy được. Loop Engineering giải quyết rất tốt những công việc có phạm vi nhỏ. Nhưng khi AI bắt đầu xử lý những bài toán lớn hơn thì bottleneck cũng xuất hiện rất nhanh. Hãy tưởng tượng bạn yêu cầu AI xây dựng một sản phẩm hoàn chỉnh. Nó phải đọc tài liệu yêu cầu, nghiên cứu đối thủ, tìm kiếm thông tin trên Internet, viết mã nguồn, chạy kiểm thử, sửa lỗi, viết tài liệu hướng dẫn rồi mới triển khai. Nếu tất cả các bước này đều do một Agent thực hiện thì toàn bộ trạng thái của dự án đều phải nằm trong một cửa sổ ngữ cảnh duy nhất. Dự án càng lớn, cửa sổ ngữ cảnh càng dài. Agent phải nhớ mình đã làm gì, đọc tài liệu nào, sửa lỗi gì, thử giải pháp nào và còn bao nhiêu việc chưa hoàn thành. Lượng token tăng lên, thời gian xử lý lâu hơn, việc kiểm tra lỗi cũng trở nên khó khăn hơn vì mọi thứ đều nằm trong cùng một vòng lặp. Đây chính là giới hạn của một Agent. Hiện tại, AI đang phải đóng quá nhiều vai trò cùng lúc. Nó vừa là người lập kế hoạch, vừa là lập trình viên, vừa là người kiểm thử, vừa là người phản biện và cũng là người ra quyết định cuối cùng. Trong thực tế, không có công ty nào vận hành theo cách đó. Graph Engineering xuất hiện để thay đổi đúng điểm này Thay vì xây dựng một AI biết làm tất cả, Graph Engineering chia toàn bộ công việc thành nhiều nút nhỏ, mỗi nút chỉ đảm nhận một vai trò duy nhất. Có AI chuyên lập kế hoạch, AI chuyên nghiên cứu, AI chuyên viết mã nguồn, AI chuyên chạy kiểm thử, AI chuyên kiểm tra tính chính xác, AI chuyên đánh giá kết quả cuối cùng. Nếu Loop Engineering giống như một nhân viên đa năng thì Graph Engineering giống như việc xây dựng cả một tổ chức, nơi mỗi người đều có chuyên môn riêng và phối hợp với nhau để hoàn thành một dự án. Nhưng nhiều Agent vẫn chưa phải là Graph Engineering Điểm quan trọng nhất của Graph không nằm ở số lượng Agent mà nằm ở cách các Agent trao đổi thông tin với nhau. Trong một hệ thống thông thường, gần như mọi thứ AI biết đều nằm trong cửa sổ ngữ cảnh. Khi phiên làm việc kết thúc hoặc cửa sổ ngữ cảnh đầy lên, AI gần như phải bắt đầu lại từ đầu. Nó phải đọc lại tài liệu, xây dựng lại bối cảnh và nhớ lại những gì mình đã làm. Điều này giống như một nhân viên mỗi sáng đi làm lại phải đọc toàn bộ email từ đầu để nhớ hôm qua mình đang làm đến đâu. Bên trong Graph Engineering, dữ liệu chảy như thế nào? Graph Engineering thay đổi hoàn toàn cách ghi nhớ này bằng một khái niệm gọi là Shared State. Thay vì lưu mọi thứ trong trí nhớ của từng Agent, toàn bộ trạng thái của công việc được đưa ra bên ngoài thành một vùng dữ liệu chung. Kế hoạch dự án, tài liệu đã đọc, các dữ kiện đã kiểm chứng, kết quả kiểm thử, những lỗi đã phát hiện hay quyết định của từng Agent đều được lưu lại trong Shared State. Mỗi Agent chỉ cần đọc đúng phần dữ liệu mình cần, xử lý công việc rồi ghi kết quả trở lại. Nó không cần đọc lại toàn bộ cuộc hội thoại để biết chuyện gì đã xảy ra. Nếu ví AI như một nhóm người cùng làm dự án thì Shared State giống hệt một tài liệu Google Docs mà cả nhóm cùng sử dụng. Người nghiên cứu ghi kết quả nghiên cứu. Người lập trình đọc kết quả đó để viết code. Người kiểm thử đọc phiên bản mới nhất để chạy test. Người đánh giá đọc toàn bộ kết quả để đưa ra quyết định cuối cùng. Không ai phải hỏi lại từ đầu hay đọc lại toàn bộ lịch sử làm việc của cả nhóm. Đó cũng là lý do Anthropic đưa ra một nhận xét rất thú vị: Agent có thể quên, nhưng Graph thì không quên. Trí nhớ không còn nằm trong model mà đã trở thành một phần của hệ thống. Graph Engineering cũng thay đổi hoàn toàn cách dữ liệu di chuyển trong hệ thống. Thay vì mọi bước đều chạy tuần tự, công việc được chia thành nhiều nhánh có thể thực hiện đồng thời. Nếu cần phân tích 100 báo cáo tài chính, hệ thống có thể tạo ra 100 Agent nhỏ, mỗi Agent đọc một báo cáo riêng rồi gửi kết quả về một Agent tổng hợp. Nếu cần kiểm tra một đoạn mã nguồn, một Agent có thể chạy kiểm thử trong khi Agent khác kiểm tra bảo mật và Agent thứ ba đánh giá hiệu năng. Cuối cùng, một Agent tổng hợp sẽ đọc kết quả của tất cả các Agent trước đó để đưa ra quyết định. Model hoàn toàn không thay đổi, nhưng tốc độ xử lý của cả hệ thống tăng lên rất nhiều nhờ kiến trúc mới.

+2

OpenMontage - kho mã nguồn mở hơn 54 nghìn sao biến trợ lý code AI của bạn thành một xưởng dựng video

Phần lớn công cụ video AI hiện nay cho bạn một đoạn clip từ một câu lệnh. OpenMontage đi xa hơn: nó cho trợ lý code AI của bạn cả một quy trình sản xuất từ đầu tới cuối. Nó làm gì Bạn cài kho vào máy, mở bằng Claude Code, Cursor, Copilot, Windsurf hay Codex, rồi ví dụ có thể nói: "Làm cho tôi video 60 giây giải thích cách mạng thần kinh học". Con agent sẽ tự tra cứu trên web, viết kịch bản, tạo hình ảnh, đọc lời bình, tìm nhạc nền miễn phí, gắn phụ đề và render ra file video cuối. Ba điểm mình thấy đáng chú ý 1/ Không cần khóa API trả phí vẫn ra được video thật. Cài xong là đã có sẵn Piper (bộ đọc chữ thành giọng nói chạy offline, miễn phí), kho tư liệu mở Archive org, NASA, Wikimedia Commons, bộ dựng hình Remotion và HyperFrames, FFmpeg để ghép và nén. Có khóa API thì mở thêm được các model tạo hình, tạo video, giọng đọc cao cấp. 2/ Nó dựng được video từ phim thật, không chỉ cho ảnh tĩnh trôi qua trôi lại. Repo nói rõ đây là chỗ nhiều "stack video AI miễn phí" hay lờ đi. Với luồng documentary montage, agent gom một kho phim tư liệu mở, tìm đúng cảnh cần rồi cắt dựng thành một timeline hoàn chỉnh. 3/ Có chốt duyệt của con người ở từng khâu sáng tạo. Storyboard được dựng thành bảng có giá tiền từng cảnh để bạn duyệt TRƯỚC khi render, và sau khi render máy còn tự soi lại video bằng ffprobe, lấy mẫu khung hình, đo mức âm thanh rồi mới đưa cho bạn. Quy mô Theo mô tả của kho: hơn 10 luồng sản xuất (giải thích hoạt hình, người dẫn, quay màn hình, trailer điện ảnh, cắt clip ngắn, lồng tiếng đa ngữ, podcast...), hơn 100 công cụ và hơn 700 file kiến thức dạy agent dùng từng công cụ cho đúng. Mỗi luồng đều đi theo một mạch cố định: nghiên cứu → đề xuất → kịch bản → lên kế hoạch từng cảnh → tạo tài nguyên → dựng phim → ghép hoàn chỉnh. Link GitHub mình để ngay bình luận 👇

Một kho hơn 120 skill miễn phí cho AI agent: dạy Claude, Codex, Cursor làm web đẹp và game

Prompt hay mà xài một lần rồi bỏ thì phí. Mình vừa xem một kho trên GitHub gom lại đúng chỗ phí đó: hơn 120 "skill" cho AI agent, để bạn không phải gõ lại từ đầu mỗi lần. Skill ở đây hiểu đơn giản là một file hướng dẫn nghề (file `SKILL.md`) viết sẵn cho AI đọc: khi nào thì dùng, làm theo mấy bước, mặc định lấy thông số nào, và những lỗi hay mắc phải tránh. Giống bạn đưa cho nhân viên mới một quy trình chuẩn thay vì ngồi dặn miệng lại mỗi ngày. Kho này của Meng To, dành cho người làm thiết kế và làm sản phẩm dùng chung với Codex, Claude, Cursor. Trong đó có gì: 1/ Web design (79 skill) - phần dày nhất. Landing page, trang giá, hiệu ứng cuộn, WebGL, bóng đổ, bố cục, các "mood" màu cho cả trang. 2/ Game development (19 skill) - làm game chạy thẳng trên trình duyệt bằng Three.js: dựng màn chơi, hệ thống quái, camera, hiệu ứng, rồi kiểm thử. 3/ Quy trình cho Codex (18 skill) - đây là chỗ mình thấy thú vị nhất. Ví dụ skill Video to Super Prompt: bạn quay màn hình một trang web hay một hiệu ứng đẹp, nó phân tích rồi viết ra một prompt cực chi tiết để agent dựng lại. Hoặc Stitched Full Page Capture: chụp trọn cả trang dài thay vì mỗi khung hình đầu, để agent thấy đủ nhịp và thứ bậc của bố cục. Còn lại là vài skill nhỏ về hỗ trợ khách hàng, nguồn ảnh, và cách ra prompt giao diện theo lối thiết kế trước. Link mình để ngay bình luận nhé 👇

Kho 817 kỹ năng an ninh mạng cho AI agent, gần 30.000 sao trên GitHub

Agent của bạn viết code nhanh, tra web giỏi. Nhưng đưa cho nó một bản trích xuất bộ nhớ máy nghi nhiễm mã độc, nó sẽ mò. Vì nó thiếu thứ mà một chuyên viên an ninh mạng có sẵn trong đầu: quy trình. Có một kho mở trên GitHub đang giải đúng chỗ thiếu đó: Anthropic Cybersecurity Skills. Gần 30.000 sao và hơn 3.500 lượt fork. Nói rõ ngay một điều để tránh hiểu lầm: tên kho có chữ Anthropic, nhưng đây là dự án cộng đồng của một cá nhân, và chính tác giả ghi rõ trong kho là không liên kết với Anthropic. Bên trong có gì 817 skill, trải trên 29 mảng an ninh mạng: điều tra số, phân tích mã độc, bảo mật đám mây, săn mối đe dọa, bảo mật ứng dụng web, red team, bảo mật AI... Mỗi skill là một thư mục riêng, không phải một bài viết: có file hướng dẫn chính, kèm tài liệu tham chiếu sâu và script chạy được. Và hướng dẫn đó viết cho máy làm theo, nên câu đầu tiên luôn là hai câu hỏi mà một bài blog không bao giờ trả lời: 1/ Khi nào dùng - dấu hiệu nào thì agent kích hoạt kỹ năng này 2/ Cần chuẩn bị gì - công cụ, quyền truy cập, môi trường cần có trước Hai mục này có ở gần như toàn bộ 817 skill. Sau đó là phần các bước làm, rồi phần nói về kết quả trông thế nào và cách xác nhận đã chạy đúng. Mỗi skill còn được gắn sẵn mã kỹ thuật theo 6 bộ khung chuẩn của ngành (MITRE ATT&CK, NIST CSF 2.0, MITRE ATLAS, MITRE D3FEND, NIST AI RMF và MITRE F3). Nghĩa là phát hiện của agent quy chiếu được về đúng một mã kỹ thuật mà cả ngành đang dùng, thay vì mô tả bằng lời của riêng nó. Nạp vào agent dễ tới mức nào Một dòng lệnh là xong. Kho viết theo chuẩn mở agent skills, nên nạp được vào Claude Code, GitHub Copilot, Codex CLI, Cursor, Gemini CLI và nhiều nền tảng khác mà không phải cấu hình gì thêm. Một lưu ý quan trọng Kho có cả kỹ thuật tấn công và red team. Tác giả ghi rõ ngay đầu trang: chỉ dùng hợp pháp, và chỉ trên hệ thống bạn sở hữu hoặc đã có văn bản cho phép kiểm thử. Với người làm bảo mật, đây là thứ đáng vào xem. Với người làm AI nói chung, nó còn là một ví dụ rất rõ về cách đóng gói kiến thức chuyên môn thành thứ mà agent dùng được ngay: không phải nhồi cho agent biết nhiều hơn, mà cho nó một quy trình để đi theo. Link GitHub mình để ngay bình luận nhé 👇