[Hacker News] Lambda Calculus Benchmark for AI

Nguồn: LamBench Tóm tắt LamBench là một benchmark đánh giá khả năng suy luận của các LLM thông qua các bài toán lambda calculus — một nhánh toán học lý thuyết về computation và functional programming. Khác với benchmark code thông thường, lambda calculus thuần túy không có shortcut từ việc nhớ training data; model phải thực sự “tính toán”. Kết quả ranking hiện tại (120 câu hỏi) rất thú vị: GPT-5....

25/04/2026 · 1 min · dhphong

[Hacker News] Show HN: A Karpathy-style LLM wiki your agents maintain (Markdown and Git)

Nguồn: GitHub - nex-crm/wuphf Tóm tắt WUPHF là một framework open-source cho phép chạy một “văn phòng AI” nơi nhiều AI agent (CEO, PM, engineer, designer…) cùng làm việc trong một không gian chia sẻ với shared brain. Được viết bằng Go 1.25+, framework cung cấp giao diện web và TUI mode qua tmux, khởi động chỉ bằng một lệnh npx wuphf. Kiến trúc của WUPHF cho phép các agent nhìn thấy nhau đang làm gì, tranh luận về task, và claim công việc thay vì hoạt động ẩn sau API calls....

25/04/2026 · 2 min · dhphong

[Hacker News] Amateur armed with ChatGPT solves an Erdős problem

Nguồn: Scientific American Tóm tắt Liam Price, 23 tuổi, không có bằng toán học nâng cao, đã giải được một bài toán của Paul Erdős tồn tại hơn 60 năm — chỉ bằng một prompt đơn gửi đến GPT-5.4 Pro. Kết quả được đăng lên erdosproblems.com và xác nhận bởi một số nhà toán học, trong đó có Terence Tao (Fields Medal 2006). Điều đáng chú ý không chỉ là bài toán được giải, mà là phương pháp AI dùng hoàn toàn mới so với các hướng tiếp cận con người đã thử....

25/04/2026 · 2 min · dhphong

[Hacker News] Hear your agent suffer through your code

Nguồn: GitHub - AndrewVos/endless-toil Tóm tắt Endless Toil là một plugin hài hước cho các AI coding agents (Codex, Claude Code, Cursor) — plugin này phát ra các âm thanh rên rỉ của con người, leo thang theo mức độ “cursed” của code mà agent đang đọc. Tên dự án xuất phát từ sự thật rằng AI agents phải đọc qua rất nhiều code chất lượng thấp. Plugin hoạt động real-time song song với coding agent, phân tích code trong quá trình agent xử lý và điều chỉnh cường độ âm thanh tương ứng....

24/04/2026 · 1 min · dhphong

[Hacker News] DeepSeek v4

Nguồn: DeepSeek API Docs Tóm tắt DeepSeek đã ra mắt phiên bản mới DeepSeek v4 với hai model: deepseek-v4-flash và deepseek-v4-pro. Đây là thế hệ tiếp theo thay thế cho deepseek-chat và deepseek-reasoner — hai model cũ sẽ bị deprecated vào ngày 24/07/2026. API tương thích với cả định dạng OpenAI và Anthropic, cho phép sử dụng SDK của cả hai provider mà không cần thay đổi code đáng kể. deepseek-v4-flash tương ứng với non-thinking mode (trước đây là deepseek-chat), trong khi deepseek-v4-pro có thinking mode tích hợp với các tham số như reasoning_effort: "high"....

24/04/2026 · 1 min · dhphong

[Anthropic Engineering] An update on recent Claude Code quality reports

Nguồn: Anthropic Engineering Tóm tắt Anthropic đã công bố phân tích hậu kiểm (postmortem) chi tiết về ba thay đổi riêng biệt đã ảnh hưởng đến chất lượng Claude Code trong vài tháng qua. Tất cả vấn đề đã được khắc phục kể từ ngày 20 tháng 4 (v2.1.116). Thứ nhất, ngày 4 tháng 3, mức reasoning effort mặc định của Claude Code đã bị hạ từ high xuống medium để giảm độ trễ — quyết định này sau đó bị hoàn tác vào ngày 7 tháng 4....

24/04/2026 · 2 min · dhphong

[Databricks Blog] Databricks partners with OpenAI on GPT-5.5

Nguồn: Databricks Blog Tóm tắt Databricks thông báo hợp tác chiến lược với OpenAI để tích hợp GPT-5.5 vào nền tảng Data Intelligence. Đây là sự kiện đáng chú ý vì Databricks trước đây được biết đến với việc hỗ trợ các mô hình open-source (DBRX, Llama) và là đối thủ cạnh tranh tiềm năng với OpenAI trong không gian AI doanh nghiệp. Quan hệ đối tác này cho phép khách hàng Databricks truy cập GPT-5....

24/04/2026 · 1 min · dhphong

[OpenAI Blog] Introducing GPT-5.5

Nguồn: OpenAI Blog Tóm tắt OpenAI ra mắt GPT-5.5, phiên bản cải tiến tiếp theo trong dòng sản phẩm GPT-5. Mô hình này được thiết kế để nâng cao khả năng lập luận, coding và xử lý tác vụ phức tạp so với GPT-5, đồng thời được tối ưu cho agentic workloads đang ngày càng phổ biến. GPT-5.5 đi kèm với System Card riêng mô tả đánh giá an toàn, Bio Bug Bounty program mới để phát hiện khả năng sinh học nguy hiểm tiềm năng, và tích hợp vào Databricks Data Intelligence Platform thông qua quan hệ đối tác chiến lược với Databricks....

24/04/2026 · 1 min · dhphong

[The Pragmatic Engineer] The Pulse: AI token spending out of control – what's next?

Nguồn: The Pragmatic Engineer Tóm tắt Trong 2–3 tháng qua, chi tiêu cho AI agents tại nhiều công ty công nghệ đã tăng đột biến, đặt ra những thách thức mới cho engineering leader về quản lý budget. Bài viết tổng hợp dữ liệu từ 15 công ty về tốc độ tăng trưởng token spend và các chiến lược ứng phó khác nhau. Liên quan đến sự tăng trưởng chi tiêu, GitHub Copilot và Anthropic đã bắt đầu giới hạn người dùng cá nhân ít sinh lợi hơn để ưu tiên phục vụ khách hàng doanh nghiệp — những người có mức chi tiêu tăng 10x trong vài tháng gần đây....

24/04/2026 · 1 min · dhphong

[Hacker News] Sneaky spam in conversational replies to blog posts

Nguồn: Terence Eden’s Blog Tóm tắt Tác giả Terence Eden mô tả một kỹ thuật spam mới và tinh vi hơn trong phần bình luận blog: thay vì spam đơn lẻ, kẻ spam tạo ra một “cuộc hội thoại giả” gồm ba bình luận liên tiếp ostensibly đang reply lẫn nhau. Bình luận thứ nhất và thứ ba trông hoàn toàn bình thường; link spam casino được nhúng vào bình luận thứ hai ở giữa, không có https:// để tránh bị filter....

23/04/2026 · 2 min · dhphong

[Tailscale Engineering] Aperture beta: better controls for the AI agent era

Nguồn: Tailscale Engineering Blog Tóm tắt Tailscale công bố Aperture chính thức bước vào giai đoạn beta với nhiều tính năng mới được thiết kế để giúp tổ chức kiểm soát chi phí và bảo mật khi triển khai AI agents. Sự kiện này diễn ra trong bối cảnh mô hình flat-rate cho AI đang sụp đổ — các agents như Claude Code, Codex hay OpenCode tiêu thụ token nhiều hơn hàng chục lần so với người dùng thông thường....

23/04/2026 · 2 min · dhphong

[Microsoft Dev Blogs] Securing MCP: A Control Plane for Agent Tool Execution

Nguồn: Microsoft Dev Blogs Tóm tắt Model Context Protocol (MCP) đang trở thành chuẩn phổ biến để AI agents khám phá và sử dụng các tools bên ngoài — từ databases, APIs đến file systems. Tuy nhiên, MCP standardize execution surface mà không định nghĩa cách surface đó được quản trị: tool definitions được đưa trực tiếp vào model, và không có điểm nào để đánh giá policy trước khi một tool call được thực thi....

23/04/2026 · 2 min · dhphong

[OpenAI Blog] Speeding up agentic workflows with WebSockets in the Responses API

Nguồn: OpenAI Blog Tóm tắt OpenAI đã thêm hỗ trợ WebSockets vào Responses API, giải quyết một bottleneck quan trọng trong các agentic workflows. Trước đây, mỗi bước trong pipeline của agent phải thiết lập kết nối HTTP mới, gây ra latency tích lũy đáng kể khi agent thực hiện nhiều tool calls liên tiếp. Với WebSockets, client duy trì một persistent connection xuyên suốt toàn bộ vòng đời của agent session....

23/04/2026 · 1 min · dhphong

[Spotify Engineering] Background Coding Agents: Supercharging Downstream Consumer Dataset Migrations (Honk, Part 4)

Nguồn: Spotify Engineering Tóm tắt Bài viết là phần 4 trong series về hành trình của Spotify với background coding agents, có codename nội bộ là “Honk”. Series này ghi chép cách Spotify sử dụng AI agents để tự động hóa việc bảo trì phần mềm ở quy mô lớn, tích hợp với các platform nội bộ Backstage và Fleet Management. Trong case study cụ thể này, một team tại Spotify đã dùng Honk để giải quyết bài toán migrating hàng nghìn dataset consumers sang phiên bản dataset mới....

23/04/2026 · 2 min · dhphong

[Hacker News] Our eighth generation TPUs: two chips for the agentic era

Nguồn: Google Blog Tóm tắt Google đã công bố thế hệ TPU thứ tám với hai chip chuyên biệt: TPU 8t dành cho huấn luyện mô hình quy mô lớn và TPU 8i dành cho inference độ trễ thấp. Đây là kết quả của hơn một thập kỷ phát triển phần cứng AI tùy chỉnh, được thiết kế đặc biệt cho kỷ nguyên các hệ thống AI có khả năng tác nhân (agentic AI)....

22/04/2026 · 2 min · dhphong

[Hacker News] Changes to GitHub Copilot individual plans

Nguồn: GitHub Blog Tóm tắt GitHub thông báo thay đổi cấu trúc gói dịch vụ GitHub Copilot dành cho cá nhân. Bài viết được đăng ngày 20/4/2026 trên GitHub Blog mục Company News, báo hiệu có sự điều chỉnh đáng kể về pricing hoặc feature set của các gói Copilot individual. Đây là chủ đề được Hacker News chú ý, phản ánh tầm ảnh hưởng rộng của GitHub Copilot trong cộng đồng developer....

22/04/2026 · 1 min · dhphong

[Hacker News] SpaceX Says It Has Agreement to Acquire Cursor for $60B

Nguồn: Bloomberg Tóm tắt SpaceX được Bloomberg báo cáo đã đạt thỏa thuận để mua lại Cursor — AI code editor do Anysphere phát triển — với định giá 60 tỷ USD. Đây là một trong những thương vụ M&A lớn nhất trong lĩnh vực AI developer tools từ trước đến nay. Cursor được biết đến rộng rãi trong cộng đồng developer với tính năng AI pair programming tích hợp sâu vào workflow, cạnh tranh trực tiếp với GitHub Copilot....

22/04/2026 · 1 min · dhphong

[OpenAI Blog] Scaling Codex to enterprises worldwide

Nguồn: OpenAI Blog Tóm tắt (Không thể truy cập nội dung đầy đủ — trang bị Cloudflare protection) OpenAI thông báo mở rộng Codex — công cụ AI coding agent — ra quy mô enterprise toàn cầu. Codex là AI agent có khả năng viết code, chạy test, debug, và thực hiện các task kỹ thuật phức tạp trong môi trường sandboxed, được thiết kế để hoạt động song song với workflow của kỹ sư phần mềm....

21/04/2026 · 1 min · dhphong

[GitLab Blog] GitHub Copilot's new policy for AI training is a governance wake-up call

Nguồn: GitLab Blog Tóm tắt GitHub Copilot thay đổi policy cho phép sử dụng code của user để train AI model, với opt-out thay vì opt-in như trước. GitLab coi đây là “governance wake-up call” — tín hiệu rõ ràng rằng các tổ chức cần xem xét lại policy về AI tool và data ownership trong software development. Vấn đề cốt lõi là code trong private repository của doanh nghiệp có thể chứa intellectual property, business logic nhạy cảm, và security-relevant implementation....

21/04/2026 · 1 min · dhphong

[GitLab Blog] Prepare your pipeline for AI-discovered zero-days

Nguồn: GitLab Blog Tóm tắt AI đang được tích hợp vào security research và có khả năng tìm kiếm zero-day vulnerability với tốc độ và quy mô chưa từng có. Điều này đặt ra câu hỏi: CI/CD pipeline của các tổ chức có sẵn sàng phản ứng nhanh với các lỗ hổng được phát hiện bởi AI không? Bài viết của GitLab đề xuất các bước chuẩn bị cụ thể cho pipeline: tích hợp automated security scanning ở mọi stage, thiết lập response playbook rõ ràng khi zero-day được công bố, và xây dựng khả năng patch nhanh (emergency release process)....

21/04/2026 · 1 min · dhphong