Hướng Dẫn Xây Dựng Blog Với Hugo + PaperMod + Cloudflare Pages

Thời gian ước tính lần đầu: 2–3 giờ | Cập nhật: 2026-09 Em chọn Hugo + theme PaperMod + Cloudflare Pages + Giscus. PaperMod hỗ trợ sẵn nút share và chỗ gắn bình luận, nên anh ít phải viết code nhất. Tổng quan quy trình Anh viết bài Markdown trên máy, git push lên GitHub, Cloudflare tự build và đăng lên web. Bình luận và like nằm trong GitHub Discussions của chính repo đó. ...

GraphRAG: Kết Hợp Neo4j và Qdrant Để Giảm Hallucination

Vấn đề với RAG thông thường Retrieval-Augmented Generation (RAG) đã trở thành giải pháp phổ biến để giảm hallucination cho LLM. Tuy nhiên, Semantic RAG thuần túy vẫn còn những điểm yếu cơ bản: Mất ngữ cảnh quan hệ: Vector search chỉ tìm đoạn văn gần nghĩa nhất, không nắm được mối quan hệ giữa các thực thể (ví dụ: “Sản phẩm A thuộc danh mục B, được bảo hành bởi chính sách C”). Retrieval rời rạc: Các chunk độc lập không liên kết dẫn đến câu trả lời thiếu nhất quán. Hallucination vẫn xảy ra khi câu hỏi đòi hỏi lý luận nhiều bước qua nhiều tài liệu. Giải pháp: GraphRAG GraphRAG là kiến trúc kết hợp hai lớp retrieval: ...

Multi-Agent Workflow: Tự Động Hóa CSKH Với LangGraph và FastMCP

Bài toán: CSKH truyền thống không đủ scale Hệ thống chăm sóc khách hàng (CSKH) truyền thống dựa trên rule-based chatbot hoặc FAQ tĩnh gặp nhiều hạn chế: không xử lý được câu hỏi phức tạp, không nhớ ngữ cảnh hội thoại, và cần cập nhật thủ công liên tục. Giải pháp: xây dựng Agentic AI System với nhiều agent chuyên biệt, phối hợp tự động để xử lý mọi loại truy vấn khách hàng. ...

On-Device AI: Chạy Neural Network Offline Với ONNX Trên Mobile

AI Lingua – Học ngoại ngữ thông minh không cần internet AI Lingua là ứng dụng học ngoại ngữ đa nền tảng mà tôi xây dựng với mục tiêu mang trải nghiệm AI cá nhân hóa đến mọi người dùng – kể cả khi không có kết nối internet. Tại sao chọn On-Device AI thay vì Cloud API? Đây là câu hỏi đầu tiên khi thiết kế kiến trúc. Ba lý do chính dẫn đến quyết định On-Device: ...

OpenVideoLab: Tạo Sinh Video AI Đa Phương Thức Trên GPU 16GB

OpenVideoLab là gì? OpenVideoLab là một hệ thống tạo sinh video AI đa phương thức mà tôi xây dựng nhằm khai thác sức mạnh của các mô hình Video Diffusion Transformer thế hệ mới như LTX-2.5, MiniMax và Wan – tất cả trên một GPU consumer-grade chỉ 16GB VRAM. Mục tiêu của dự án là dân chủ hóa việc tạo video AI chất lượng cao mà không cần phần cứng enterprise đắt tiền. ...

Quantization Int8/FP4: Chạy Model AI Lớn Trên GPU Tài Nguyên Giới Hạn

Bài toán: Model AI quá lớn để chạy Các mô hình Video Diffusion Transformer thế hệ mới (LTX-2.5, Wan, CogVideo) có kích thước 10–30B tham số. Ở độ chính xác fp16, mỗi tham số chiếm 2 bytes → model 13B cần ~26GB VRAM chỉ để load. Đây là rào cản lớn với hầu hết developer vì GPU consumer phổ biến nhất hiện nay (RTX 4080/4090) chỉ có 16–24GB VRAM. Quantization là gì? Quantization là kỹ thuật giảm số bit biểu diễn trọng số model, đánh đổi một phần độ chính xác để tiết kiệm bộ nhớ và tăng tốc độ suy luận. ...