Top Contributor
Khang Vo

Rank #0 · Mindshare 0.00% · Tham gia từ 01/08/2026

Fan CứngSung SứcBền BỉHút LikeNghiện

23 bài trên Nghiên AI trong năm qua

Sắp xếp

Tháng qua trả tám trăm đô

Chỉ mua trăm phút phim thô chưa vừa Nay người mở máy như đùa Cắm dây, gõ lệnh, phim vừa hiện ra antirez vừa mở h3-metal, giấy phép MIT, chạy mô hình sinh video MiniMax H3 thẳng trên Apple Silicon, không gọi API nào. Ý tưởng: MiniMax mở trọng số H3 cuối tháng 7, nhưng muốn chạy vẫn phải có GPU NVIDIA. h3-metal viết lại toàn bộ đường suy luận bằng Metal, gói vào một binary C, để một cái Mac tự dựng clip 4 đến 15 giây kèm tiếng stereo 32 kHz. Bên trong H3 có ba khối: H3-Encoder mượn nguyên trọng số Qwen3-VL-32B rồi lấy hidden state tầng 50; hai VAE riêng mã hoá ảnh và âm thanh; H3-Omni-Transformer 50 block đoán latent video và latent audio cùng một lượt. Chỗ h3-metal khác bản gốc nằm ở cờ `--ssd-streaming`: chỉ hai block DiT ở trong RAM, block kế đọc từ SSD trong lúc GPU chạy block hiện tại. Encoder Qwen cũng nạp theo tầng, nên transformer, encoder và decoder không bao giờ cùng có mặt trong bộ nhớ. Số đo lấy từ README và trang giá: → 36,5 GiB xuống 2,0 GiB là bộ nhớ tensor của DiT khi bật `--ssd-streaming` ở 512², đổi lại một lượt 50 block chậm đi 84% → 3,5 giây cho bốn bước khử nhiễu trên M5 Max, so với 26,4 giây của bản tham chiếu 29 bước, SSIM toàn video 0,556 → 37 GiB trọng số phải tải về trước khi gõ lệnh đầu tiên → 0,13 USD mỗi giây video là giá thấp nhất OpenRouter niêm yết cho H3 qua API Hoá đơn: mỗi ngày 20 clip 10 giây, mức bình thường của một buổi thử prompt. 20 × 10,125 giây × 0,13 USD ra 26,3 USD một ngày, ba mươi ngày thành 790 USD, đổi lấy 101 phút video mà phần lớn bị xoá ngay trong hôm đó. Bản Metal đổi chỗ 790 USD kia lấy 37 GiB ổ cứng. Lưu ý mọi số đo trong README đều chạy trên M3 Max và M5 Max, không phải máy 24 GB. MiniMax cho không phần tốn máy nhất, rồi ghi thẳng trong model card: H3-Context-IR, khối đọc và viết lại prompt đa phương thức, không nằm trong bản mở nguồn, chỉ có qua API của họ, kèm lời khuyên nên cắm nó vào pipeline. Trọng số cũng không phải MIT mà là MiniMax H3 Community License. MIT là giấy phép của phần code Metal. Cắm vào: một binary `./h3 -d ./MiniMax-H3 -p "..." -o out.mp4`, cần FFmpeg và FFprobe trên PATH; muốn dùng trong ComfyUI thì đã có node ComfyUI-MiniMax-H3-Turbo, Apache-2.0. Cho không phần nặng đường xa Giữ riêng phần khéo, hoá ra vẫn tiền

Máy đọc hộ, tính từng trang

Trăm nghìn trang giấy, tính sang ba ngàn Bỗng đâu có kẻ phát tràn Cho không, xóa sạch cả ngàn hóa đơn Firecrawl vừa open-source anydoc, MIT license, chạy thẳng trên máy bạn. Ý tưởng: agent nào cũng phải đọc tài liệu người dùng ném vào, mà mỗi định dạng một thư viện, mỗi thư viện nhả ra một kiểu Markdown khác nhau. anydoc gom hết về một document model chung rồi in ra bằng đúng một bộ serializer, nên file .doc từ 2003 và .pptx hôm qua cho ra cùng một dạng chữ. 14 định dạng đi chung một đường: Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, PDF. Bảng giữ merged cell, list giữ cách đánh số của file gốc, có cả footnote và speaker note trong slide. Định dạng đọc từ nội dung file chứ không từ đuôi, nên file đặt sai tên vẫn ra đúng. PDF text-based xử lý tại chỗ, không gọi OCR. Viết bằng Rust, có binding cho Node.js và Python, bản WebAssembly chạy trong trình duyệt nên tài liệu không rời máy. Vài con số trong benchmark họ công bố, 100 tài liệu thật, 482 lượt chấm mù: → 4.4ms mỗi tài liệu, cùng phép đo LibreOffice mất 1129.5ms → Phủ 14/14 định dạng, unstructured được 8, markitdown 6 → Điểm chất lượng 81 trên 100, markitdown 65, LibreOffice 40 → 11.900 sao GitHub trong 6 ngày kể từ lúc mở Bước đọc tài liệu này ở Unstructured tính $0.03 một trang. Một pipeline 100.000 trang mỗi tháng là $3.000, tức $36.000 một năm, cho đúng cái việc mở file ra lấy chữ. LlamaParse ở chế độ agentic lên tới $0.09 một trang. anydoc làm bước đó bằng tiền điện. Firecrawl không phát chẩn. Họ vừa gọi $14.5M Series A và sống bằng credit crawl, $16 đến $599 một tháng. Đọc tài liệu là chi phí trong pipeline của họ chứ không phải chỗ thu tiền, nên cho không nó vừa kéo pipeline agent mình, vừa rút sàn giá của mấy hãng sống bằng đúng bước đó. Cắm vào agent bằng một lệnh: npx skills add firecrawl/anydoc. Cho không cái việc đọc trang Để còn bán tiếp cái đang hái tiền 👉 Link GitHub trong bình luận

Con máy thuê chạy thâu đêm

Đồng hồ nhích một, cộng thêm hàng ngàn Cuối năm ngó lại chín ngàn Sáng nay có kẻ mang sang, cho không Meta vừa mở Muse Glimmer 30B theo giấy phép Apache-2.0, bản nén 17GB chạy trọn trong một cỗ máy 24GB VRAM. Ý tưởng: một agent làm việc thật thì không gọi model một lần. Nó đọc màn hình, gọi tool, nhận về lỗi, đoán xem sai ở đâu, gọi lại. Mỗi vòng lặp đó là một hoá đơn. Muse Glimmer là con model 30B làm đúng chuỗi việc ấy nhưng nằm trên ổ cứng của bạn, không cần mạng. Bên trong là transformer đặc 52 lớp, cứ ba lớp cửa sổ trượt 2.048 token thì tới một lớp nhìn toàn cục và bỏ hẳn position embedding. Mỗi cặp key-value gánh 16 query head, KV cache co lại 16 lần, nên context 131.072 token vẫn nhét vừa bộ nhớ máy bàn. Kèm một perception encoder 2B để đọc ảnh chụp màn hình và biểu đồ, cộng một drafter DFlash đoán trước nguyên khối 16 token rồi để model chính kiểm song song, giữ cái đúng và sửa cái sai. Số đo Meta công bố: → 973 điểm Hacker News trong 24 giờ, trendingScore 663 trên Hugging Face → MCP Atlas 75,5 so với Gemma4-31B 54,2 và Qwen3.6-27B 62,5 → SWE-Bench Pro 51,2 so với 36,9 và 50,2, nhưng OSWorld-Verified chỉ 65,9, thua Qwen3.6 ở mức 75,6 → Nén còn 17GB thì rớt 1,0% trung bình trên 15 benchmark, bản 32GB rớt 0,2% → RTX 5090 từ 74,9 lên 233,4 token/giây khi bật drafter, MacBook M4 Max từ 23,7 lên 37,8 Chỗ đau nằm ở chữ always-on. Máy không tắt thì tính đủ 730 giờ một tháng. Trên bảng giá Inference Endpoints của chính Hugging Face, con A10G 24GB, đúng cái khuôn bộ nhớ Meta nhắm tới, là 1 đô một giờ. Vị chi 730 đô một tháng, 8.760 đô một năm, cho một agent. Muốn ba agent chạy song song thì nhân ba. Cỗ máy 24GB đặt trên bàn chạy đúng bản 17GB đó, hoá đơn còn lại là tiền điện. Meta không bán token, nên cho không tầng model chẳng mất gì. Apache-2.0 mở tới mức đối thủ cũng xài thương mại được. Đổi lại họ đứng cùng Ollama, LM Studio, Unsloth ở tầng phần mềm và AMD, Arm, Dell, Intel, NVIDIA ở tầng thiết bị. Model chạy trên máy người dùng nghĩa là Meta không trả một đồng GPU nào cho một lượt gọi nào, còn sàn giá của những bên đang bán agent theo lượt gọi thì bị kéo xuống bằng thứ họ không hề bán. Cắm vào đâu: transformers, llama.cpp và vLLM hỗ trợ từ ngày đầu, Hugging Face có sẵn hướng dẫn nối OpenClaw thẳng vào bản chạy local. Cho không nào phải là không Chạy trên máy khách, tiền ông khỏi bù

Thuê người thức trắng thâu đêm

Mỗi năm hăm mấy ngàn thêm tiền phòng Nay người cho hẳn không đồng Chỉ còn tiền điện chất chồng mỗi đêm Prime Intellect vừa mở nguồn prime-agent theo giấy phép MIT — con agent lập trình chạy thẳng trên máy bạn, macOS và Linux. Ý tưởng: thay vì đưa cho model một bộ công cụ cố định, nó đưa cho model một cái shell Python sống. Mọi thứ — đọc file, chạy lệnh, gọi agent con — đều là code chạy trong một kernel IPython không tắt. Subagent là một lời gọi hàm, `rlm(...)`, trả kết quả về như mọi hàm khác. Skill là package Python import được. Lệnh `/refine` cho phép nó tự sửa phần trạng thái mềm của chính mình, có bản ghi để lùi lại. Phiên chạy nền bằng daemon, đóng terminal xong quay lại vẫn còn đó. Vài con số: → 2.319 sao trong một ngày, đứng đầu bảng trending GitHub → 10.343 sao tổng, repo mở từ 08/05/2026 → Claude Code, thứ nó cạnh tranh trực tiếp, nằm trong gói $20/tháng, bản Max niêm yết từ $100/tháng → Prime Intellect vừa gọi $130 triệu Series A, có NVIDIA, Intel và Dell trong vòng Cho không phần mềm không có nghĩa là cho không phần chạy. Con này dựng để chạy dài: daemon nền, heartbeat, lịch hẹn, agent con đẻ agent con, chế độ tự trị theo hạn mức token. Muốn tự chủ thật thì tự host model. Thuê một A100 80GB ngay trên chợ GPU của chính Prime Intellect là $1,12/giờ. Chạy 8 tiếng mỗi ngày, 22 ngày làm việc, ra 176 giờ, thành $197 một tháng. Đội mười người là $1.970 một tháng, $23.640 một năm, cho một con agent miễn phí. Prime Intellect sống bằng hai thứ: cho thuê GPU theo giờ, từ $0,14 tới $35,20, và bán token qua Prime Inference. Con agent miễn phí là cái vòi, `/login` là chỗ vòi cắm vào. $130 triệu vừa gọi không phải để nuôi một CLI, mà để nuôi đường ống mà CLI đó dẫn tới. Cho không con máy chạy đêm Tiền điện tiền máy vẫn thêm mỗi tuần

Niêm yết một triệu token ở giá 0,0028 đô rồi ngạc nhiên vì hết GPU. Bài toán này không cần biết gì về AI vẫn giải ra.

Ngày 6/8 DeepSeek dán một dòng lên trang bảng giá: sắp tăng giá API, mức tăng ""đáng kể"". Không phần trăm, không ngày hiệu lực, chỉ dặn người dùng liệu mà tính. Năm ngày trước đó, OpenCode báo model V4 Flash chạy 8 nghìn tỷ token trong đúng một ngày, 5 nghìn tỷ từ tài khoản miễn phí và 3 nghìn tỷ là traffic trả tiền. Tính từ 14/6 đến 8/8, riêng cửa OpenCode đẩy qua 113 nghìn tỷ token, tăng 313%, chiếm 62% lưu lượng nền tảng này quan sát được. Bản V4 Pro đắt gấp ba, 0,435 và 0,87 đô mỗi triệu token, cùng kỳ chỉ hút 2,8 nghìn tỷ. Giá Flash lúc này vẫn là 0,14 đô token vào và 0,28 đô token ra. Vài tuần trước DeepSeek đã áp phụ phí giờ cao điểm, nhân đôi giá trong khung 9h đến 12h và 14h đến 18h giờ Bắc Kinh, và nói mục tiêu là phân bổ tài nguyên đều hơn chứ không phải kiếm thêm. Mình đọc bảng giá thì thấy hai mục tiêu đó không mâu thuẫn chút nào, lý do nằm ở cột thứ ba, cột gần như không ai đọc. Token đầu vào trúng cache tính 0,0028 đô mỗi triệu, bằng một phần năm mươi giá không trúng cache. Công cụ code dạng agent thì gửi lại gần như nguyên khối context ở mỗi lượt, nên OpenCode ghi nhận 96% token đầu vào là cache hit. Nhân ra: 0,96 nhân 0,0028 cộng 0,04 nhân 0,14, được khoảng 0,0083 đô mỗi triệu token vào, rẻ hơn giá trên bảng 17 lần. Số liệu vận hành khớp, một phiên trung bình ngốn 9,9 triệu token và hết đúng 0,10 đô, nhân lên 11,3 triệu phiên của 1,9 triệu người dùng. Chỉ có điều cache hit rẻ với người mua chứ không rẻ với người bán: khối KV cache nằm trong VRAM và giữ chỗ suốt phiên, nên cột rẻ nhất bảng giá lại là cột ăn bộ nhớ nhất. Ràng buộc không phải biên lợi nhuận mà là số GPU đang cắm điện, và hết chỗ thì nâng giá là cách bóp cầu mà không phải tuyên bố downtime. Cùng quãng đó thị trường đi ba hướng khác nhau: OpenAI hạ GPT-5.6 Luna 80% từ 30/7 xuống còn 0,20 và 1,20 đô, Anthropic để khuyến mãi Sonnet 5 hết hạn 31/8 rồi đưa giá về 3 và 15 đô thay cho 2 và 10, còn DeepSeek một tuần trước khi cảnh báo tăng giá vẫn đang tung model code rẻ hơn Claude Opus 4.8 tới 99%. Hóa đơn rơi vào đâu thì nhìn lại ngày 1/8: 5 trong 8 nghìn tỷ token hôm đó chạy trên tài khoản miễn phí, không sinh ra một xu doanh thu, chỉ sinh ra tiền điện và hàng chờ cho người có trả tiền. Nhóm gánh là 3 nghìn tỷ còn lại, cộng với đám startup đã dựng bảng tài chính trên mức 0,14 đô. Ai cũng gật rằng DeepSeek tăng kiểu gì thì vẫn rẻ nhất thị trường, và đúng là vậy, Fable 5 đang lấy 10 và 50 đô mỗi triệu token, tăng mười lần cũng chưa lấp nổi khoảng cách. Nhưng thứ vừa gãy không phải mức giá, mà là giả định rằng mức giá đứng yên đủ lâu để anh em kịp hoàn vốn. Thông báo tăng giá không kèm con số, cũng không kèm ngày hiệu lực.

Anthropic ký trả 1,25 tỷ đô mỗi tháng. Google trả thêm 920 triệu mỗi tháng. Vậy mà cả quý mảng AI của SpaceX chỉ ghi nhận được 2,56 tỷ :)))

Hợp đồng với Anthropic chạy tới tháng 5/2029, đổi lấy quyền dùng cụm Colossus 1 với hơn 220.000 GPU H100, H200 và GB200. Google trả khoảng 920 triệu một tháng cho chừng 110.000 GPU. Cộng lại, hai hợp đồng này có giá trị cam kết khoảng 2,17 tỷ đô mỗi tháng, tức 26 tỷ một năm nếu chạy hết công suất. Nhưng cả quý hai, toàn bộ mảng AI, gồm cả Grok và mọi thứ khác, chỉ ghi nhận 2,56 tỷ. Tính ra chưa tới 1,2 tháng doanh thu theo giá hợp đồng đầy đủ. Khoảng cách đó không phải kế toán mờ ám, nó là sự thật. Hợp đồng Anthropic ký ngày 6/5, tức chỉ nằm trong hai phần ba quý. Quan trọng hơn, loại hợp đồng này ghi nhận doanh thu theo lượng công suất thực sự bàn giao, không theo chữ ký. GPU phải về kho, phải có rack, có điện, có nước làm mát, có switch cắm xong mới bắt đầu tính tiền. Doanh thu vì thế bị chặn bởi tốc độ dựng trung tâm dữ liệu chứ không phải bởi nhu cầu. Đó chính xác là lý do capex quý này phình ra: mỗi đô la đổ vào hạ tầng là một đô la mở khóa doanh thu đã ký sẵn mà chưa được phép ghi sổ. Mảng AI vẫn lỗ hoạt động 1,25 tỷ đô trong quý, tuy có cải thiện từ mức 1,54 tỷ cùng kỳ. Đọc kỹ thì con số lỗ hoạt động này tình cờ đúng bằng số tiền Anthropic trả mỗi tháng, một sự trùng hợp mà tôi thấy khá thơ. Trong khi đó Starlink cộng thêm 1,7 tỷ doanh thu và thương vụ mua Cursor giá 60 tỷ đô vẫn chưa chốt, nghĩa là chi phí của nó chưa hề chạm vào bảng này. Ba khách hàng lớn gánh gần như toàn bộ mảng AI. Nếu Anthropic tự dựng đủ compute trước 2029, hoặc chỉ cần đàm phán lại giá, một phần ba doanh thu AI bốc hơi trong một cuộc họp. Cái nghịch lý là SpaceX đang bán cuốc xẻng cho chính những người đào vàng mà họ muốn cạnh tranh. Grok phải chiến thắng bằng tiền thuê từ Claude và Gemini. Doanh thu đã ký thì có thật, chỉ là nó đang xếp hàng chờ thợ điện.