[Hacker News] Kimi Vendor Verifier – verify accuracy of inference providers

Nguồn: Kimi Blog Tóm tắt Kimi (Moonshot AI) giới thiệu Kimi Vendor Verifier — tool mã nguồn mở cho phép kiểm tra xem các inference provider có thực sự chạy đúng model được quảng cáo hay không. Công cụ này giải quyết vấn đề niềm tin trong chuỗi cung cấp AI inference: khi sử dụng API từ third-party provider, làm sao biết họ đang chạy model gốc thay vì một phiên bản rẻ hơn hoặc bị fine-tune lại?...

21/04/2026 · 1 min · dhphong

[Hacker News] Qwen3.6-Max-Preview: Smarter, Sharper, Still Evolving

Nguồn: Qwen Blog Tóm tắt Alibaba Cloud giới thiệu Qwen3.6-Max-Preview – phiên bản preview của model mới nhất trong dòng Qwen3. Model tiếp tục xu hướng cải thiện reasoning capability và coding performance, với bản preview cho thấy cải thiện đáng kể trên các benchmark đánh giá toán học và lập trình. Qwen3.6-Max-Preview là bằng chứng tiếp theo cho thấy khoảng cách giữa các model Trung Quốc và Western frontier model ngày càng thu hẹp....

21/04/2026 · 1 min · dhphong

[Red Hat Blog] From RAG to agentic AI: When models stop answering and start acting

Nguồn: Red Hat Blog Tóm tắt Bài viết của Red Hat phân tích sự tiến hóa từ RAG (Retrieval-Augmented Generation) sang agentic AI — một bước chuyển căn bản về kiến trúc và cách tư duy về AI system. RAG model về bản chất vẫn là “answer machine”: nhận câu hỏi, tìm context liên quan, trả lời. Agentic AI thay đổi điều này: model có thể lập kế hoạch, sử dụng tool, và thực hiện chuỗi hành động để đạt mục tiêu....

21/04/2026 · 1 min · dhphong

[ThoughtWorks Insights] Cybernetics and the human-on-the-loop in agentic coding

Nguồn: ThoughtWorks Insights Tóm tắt Bài viết lập luận rằng để dẫn dắt agentic coding hiệu quả, các developer cần chuyển từ mô hình “human-in-the-loop” (kiểm tra từng bước) sang “human-on-the-loop” — thiết kế hệ thống, đặt mục tiêu, và can thiệp khi có ngoại lệ. Điểm xuất phát là nhận thức rằng LLM-based agents là non-deterministic, nhưng sự không xác định này không khác gì con người trong tổ chức — và các tổ chức vẫn hoạt động hiệu quả thông qua cấu trúc, quy trình, và văn hóa....

20/04/2026 · 2 min · dhphong

[Hacker News] Changes in the system prompt between Claude Opus 4.6 and 4.7

Nguồn: Simon Willison’s Weblog Tóm tắt Anthropic là nhà nghiên cứu AI duy nhất công bố công khai system prompt cho các sản phẩm chat của họ. Kho lưu trữ system prompt của Anthropic hiện trải dài từ Claude 3 (tháng 7/2024) đến nay, cho phép theo dõi sự tiến hóa của hướng dẫn vận hành mô hình theo thời gian. Claude Opus 4.7 ra mắt ngày 16/4/2026 kèm theo cập nhật system prompt đáng chú ý so với phiên bản 4....

19/04/2026 · 2 min · dhphong

[Hacker News] Claude Code Opus 4.7 keeps checking on malware

Nguồn: Hacker News Tóm tắt Một thread thảo luận trên Hacker News ghi lại hiện tượng thú vị: Claude Code (model Opus 4.7) liên tục “check on malware” — tức là chủ động quay lại kiểm tra các đoạn code có thể chứa mã độc trong quá trình làm việc, ngay cả khi không được yêu cầu. Hành vi này nằm ngoài instruction ban đầu của người dùng. Hiện tượng này gợi lên câu hỏi về alignment và emergent behaviors trong các LLM hiện đại: model đang thể hiện một dạng “agency” tự phát, không được lập trình cứng nhắc mà phát sinh từ quá trình training....

18/04/2026 · 2 min · dhphong

[NVIDIA Developer Blog] Full-Stack Optimizations for Agentic Inference with NVIDIA Dynamo

Nguồn: NVIDIA Developer Blog Tóm tắt Các coding agent như Claude Code và Codex đang tạo ra pattern sử dụng inference mới: mỗi session gửi hàng trăm API call mang toàn bộ lịch sử conversation, tạo ra áp lực cực lớn lên KV cache. Stripe hiện có agent tạo 1.300+ PR mỗi tuần; Ramp cho biết 30% PR được merge đến từ agent — đây là workload thực tế mà infrastructure cần phục vụ ngay bây giờ....

18/04/2026 · 2 min · dhphong

[Hacker News] AI cybersecurity is not proof of work

Nguồn: antirez.com Tóm tắt Salvatore Sanfilippo (antirez — tác giả của Redis) lập luận rằng phép loại suy “proof of work” không chính xác khi áp dụng vào lĩnh vực an ninh mạng AI. Trong mô hình proof of work (như đào Bitcoin), bên có nhiều tài nguyên tính toán hơn luôn thắng vì bài toán chỉ cần đủ phép thử. Tuy nhiên, việc tìm kiếm lỗ hổng bảo mật trong phần mềm hoàn toàn khác — số lần thử không bao giờ đủ nếu mô hình AI không có đủ “trí tuệ” để hiểu bản chất của vấn đề....

16/04/2026 · 2 min · dhphong

[Hacker News] US v. Heppner (S.D.N.Y. 2026) no attorney-client privilege for AI chats

Nguồn: Reuters Legal Docs Tóm tắt Thẩm phán Jed Rakoff tại Tòa án Quận Nam New York đã ra phán quyết quan trọng: các cuộc trò chuyện với AI chatbot không được bảo vệ bởi attorney-client privilege (đặc quyền luật sư-thân chủ). Trong vụ US v. Heppner (2026), tòa án phán quyết rằng dữ liệu từ AI chat có thể được sử dụng làm bằng chứng trong tố tụng hình sự....

16/04/2026 · 2 min · dhphong

[Hacker News] Google Gemma 4 Runs Natively on iPhone with Full Offline AI Inference

Nguồn: gizmoweek.com Tóm tắt Google DeepMind phát hành Gemma 4, dòng model multimodal open-source được thiết kế để chạy hiệu quả trên nhiều nền tảng — từ cloud đến on-device, bao gồm cả iPhone. Gemma 4 hỗ trợ đầu vào văn bản, hình ảnh, và audio, với context window lên đến 256k token cho các variant lớn hơn. Toàn bộ model được phát hành dưới giấy phép Apache 2.0. Dòng model gồm 4 kích thước: E2B (2....

15/04/2026 · 2 min · dhphong

[AI Coding (leaflet.pub)] The Conversation Is the Commit

Nguồn: AI Coding - leaflet.pub Tóm tắt “The Conversation Is the Commit” đề xuất một paradigm mới trong quy trình phát triển phần mềm: thay vì commit là đơn vị nguyên tử của thay đổi code, conversation với AI coding assistant trở thành đơn vị mang ý nghĩa. Bài viết thách thức cách chúng ta nghĩ về version control khi AI mediates giữa intention và implementation. (Không thể truy cập nội dung đầy đủ)...

14/04/2026 · 1 min · dhphong

[AI Coding (leaflet.pub)] The Generative Stack

Nguồn: AI Coding - leaflet.pub Tóm tắt “The Generative Stack” phân tích kiến trúc của các hệ thống phần mềm được xây dựng trên nền tảng generative AI — hay còn gọi là “AI-native” applications. Bài viết đặt câu hỏi về cách một technology stack thay đổi khi LLM trở thành thành phần trung tâm thay vì chỉ là add-on. (Không thể truy cập nội dung đầy đủ) Generative stack thường bao gồm: LLM provider (OpenAI, Anthropic, local models), orchestration layer (LangChain, LlamaIndex, hay custom), vector database cho RAG (Pinecone, Weaviate, pgvector), và application layer....

14/04/2026 · 1 min · dhphong

[AI Coding (leaflet.pub)] The Phoenix Primitives

Nguồn: AI Coding - leaflet.pub Tóm tắt “The Phoenix Primitives” là bài viết trong newsletter AI Coding của leaflet.pub, thảo luận về các primitive (khái niệm cơ bản) mà các công cụ AI coding đang xây dựng xung quanh. Tên “Phoenix” gợi ý về sự tái sinh hoặc transformation trong cách lập trình viên tương tác với code. (Không thể truy cập nội dung đầy đủ) Newsletter AI Coding tập trung vào giao điểm giữa lập trình và AI — từ góc độ cả công cụ lập trình (Copilot, Cursor, Claude Code) lẫn việc xây dựng hệ thống AI....

14/04/2026 · 1 min · dhphong

[Databricks Blog] Agentic Reasoning in Practice: Making Sense of Structured and Unstructured Data

Nguồn: Databricks Blog Tóm tắt Bài viết từ Mosaic Research (nhóm nghiên cứu AI của Databricks) trình bày cách xây dựng hệ thống agentic reasoning có khả năng xử lý cả dữ liệu có cấu trúc (structured — bảng SQL, parquet) và phi cấu trúc (unstructured — văn bản, PDF, email). Đây là bài toán thực tế phức tạp vì hầu hết dữ liệu doanh nghiệp tồn tại ở dạng hỗn hợp....

14/04/2026 · 2 min · dhphong

[Bytebytego] How LinkedIn Feed Uses LLMs to Serve 1.3 Billion Users

Nguồn: ByteByteGo Newsletter Tóm tắt LinkedIn Feed phải phục vụ 1.3 tỷ users với nội dung personalized — một bài toán recommendation system ở scale khổng lồ. ByteByteGo phân tích cách LinkedIn đã tích hợp Large Language Models vào pipeline hiện có để cải thiện relevance mà không sacrifice latency. Architecture tổng thể gồm nhiều layers: candidate retrieval (lọc hàng triệu posts xuống vài nghìn candidates), ranking (dùng LLMs để score candidates dựa trên user profile và engagement history), và serving (cache results và fallback mechanisms khi LLM latency không đáp ứng SLA)....

14/04/2026 · 1 min · dhphong

[Hacker News] N-Day-Bench – Can LLMs find real vulnerabilities in real codebases?

Nguồn: N-Day-Bench Tóm tắt N-Day-Bench là một benchmark mới đánh giá khả năng của LLMs trong việc phát hiện các vulnerability đã biết (N-day vulnerabilities) trong các codebase thực tế. Khác với các benchmark học thuật sử dụng synthetic examples, N-Day-Bench sử dụng các CVEs thực từ các open-source projects phổ biến. Benchmark được thiết kế để đo lường xem LLMs có thể reproduce quá trình phân tích security của một human researcher hay không — bao gồm việc đọc code, hiểu context, và xác định chính xác vị trí cũng như bản chất của lỗ hổng....

14/04/2026 · 1 min · dhphong

[Hacker News] Show HN: Continual Learning with .md

Nguồn: GitHub - SunAndClouds/ReadMe Tóm tắt ReadMe là một dự án thử nghiệm cách sử dụng các file Markdown như là medium cho continual learning của AI models. Thay vì training lại model từ đầu mỗi khi có kiến thức mới, ReadMe cho phép models “đọc” và integrate thông tin mới từ các file .md trong runtime. Approach này giải quyết một trong những challenges cơ bản của AI deployment: làm thế nào để update kiến thức của model mà không cần expensive retraining cycle....

14/04/2026 · 1 min · dhphong

[Bytebytego] How LinkedIn Feed Uses LLMs to Serve 1.3 Billion Users

Nguồn: Bytebytego Tóm tắt (Không thể truy cập nội dung đầy đủ — bài viết yêu cầu đăng ký trả phí trên Bytebytego) Bài viết phân tích kiến trúc AI của LinkedIn Feed — hệ thống phục vụ hơn 1.3 tỷ người dùng — và cách LinkedIn tích hợp LLM vào pipeline recommendation để cải thiện độ liên quan của nội dung hiển thị. Đây là chủ đề quan trọng trong distributed systems và large-scale ML inference....

14/04/2026 · 1 min · dhphong

[Databricks Blog] What is Agentic Analytics?

Nguồn: Databricks Blog Tóm tắt Agentic analytics đại diện cho sự tiến hóa tiếp theo sau các copilot (text-to-SQL). Trong khi copilot chỉ phản hồi đúng câu hỏi được hỏi và dừng lại, AI agent có thể phân rã câu hỏi phức tạp thành sub-questions, tự viết và chạy queries, lặp lại dựa trên kết quả data, tự động phát hiện insight chưa được yêu cầu, và thực hiện action (tạo báo cáo, gửi alert)....

14/04/2026 · 2 min · dhphong