[{"content":" Thời gian ước tính lần đầu: 2–3 giờ | Cập nhật: 2026-09\nBài viết này đúc kết toàn bộ quy trình thiết lập blog tĩnh với chi phí $0, tự động hóa build qua Cloudflare Pages và nhúng bình luận bảo mật qua GitHub Discussions.\n1. Minh Chứng \u0026amp; Trang Thử Nghiệm Sống (Evidence \u0026amp; Live Demo) Hạng mục Minh chứng thực tế Chi tiết kỹ thuật Website thực tế (Live Demo) glory-hinody.pages.dev Trang web bạn đang truy cập, thời gian tải trang \u0026lt; 500ms Mã nguồn (GitHub) github.com/vinh-gogo/glory-hinody Mã nguồn mở hoàn toàn, quản lý qua Git submodule (PaperMod) Hệ thống bình luận (Discussions) github.com/vinh-gogo/glory-hinody/discussions Đồng bộ 2 chiều qua Giscus API, chống spam tự động Tự động hóa CI/CD Cloudflare Pages Git Integration Tự động kích hoạt build hugo --gc --minify khi có git push 2. Tổng quan quy trình Anh viết bài Markdown trên máy, git push lên GitHub, Cloudflare tự build và đăng lên web. Bình luận và like nằm trong GitHub Discussions của chính repo đó.\nViết bài (.md) → git push → GitHub → Cloudflare Pages (auto build) → Blog online → Bình luận / Like (GitHub Discussions) Giai đoạn 0: Chuẩn bị (15 phút) Tạo tài khoản GitHub và Cloudflare (đều miễn phí). Cài Git, và cài Hugo bản \u0026ldquo;extended\u0026rdquo; (Windows: winget install Hugo.Hugo.Extended; macOS: brew install hugo). Cài một trình soạn thảo, ví dụ VS Code. Kiểm tra: gõ hugo version và git --version trong terminal phải ra số phiên bản. Anh nhớ số phiên bản Hugo này, lát nữa cần dùng. Giai đoạn 1: Dựng blog trên máy (30 phút) hugo new site myblog cd myblog git init git submodule add --depth=1 https://github.com/adityatelange/hugo-PaperMod.git themes/PaperMod Tạo file hugo.yaml ở thư mục gốc (xóa file hugo.toml mặc định nếu có):\nbaseURL: \u0026#34;https://myblog.pages.dev/\u0026#34; # sẽ đổi khi có tên miền riêng locale: vi defaultContentLanguage: vi title: \u0026#34;Tên blog của anh\u0026#34; theme: PaperMod params: description: \u0026#34;Mô tả ngắn về blog\u0026#34; defaultTheme: auto # tự theo sáng/tối của thiết bị ShowReadingTime: true ShowShareButtons: true # nút chia sẻ comments: true # bật khung bình luận ShareButtons: [\u0026#34;facebook\u0026#34;, \u0026#34;twitter\u0026#34;, \u0026#34;telegram\u0026#34;, \u0026#34;whatsapp\u0026#34;, \u0026#34;linkedin\u0026#34;] menu: main: - { name: \u0026#34;Bài viết\u0026#34;, url: \u0026#34;/posts/\u0026#34;, weight: 1 } - { name: \u0026#34;Giới thiệu\u0026#34;, url: \u0026#34;/about/\u0026#34;, weight: 2 } Viết bài đầu tiên và chạy thử:\nhugo new posts/bai-viet-dau-tien.md # mở file, sửa nội dung, đổi draft: true thành draft: false hugo server Mở http://localhost:1313 để xem.\nGiai đoạn 2: Đưa code lên GitHub (10 phút) Trên GitHub, tạo repo public (bắt buộc để Giscus hoạt động), ví dụ myblog. Tạo file .gitignore ở thư mục gốc với nội dung: public/ resources/_gen/ .hugo_build.lock Đẩy code: git add . git commit -m \u0026#34;Khởi tạo blog\u0026#34; git branch -M main git remote add origin https://github.com/TENCUAANH/myblog.git git push -u origin main Lưu ý khi clone lại repo trên máy khác: Theme PaperMod là submodule, cần thêm flag --recurse-submodules:\n# Khi clone repo về máy khác: git clone --recurse-submodules https://github.com/TENCUAANH/myblog.git # Hoặc nếu đã clone rồi mà chưa có theme: git submodule update --init --recursive Giai đoạn 3: Cài Giscus (20 phút) Vào repo → Settings → General → Features → tích Discussions. Cài app Giscus tại github.com/apps/giscus, chọn cho đúng repo myblog. Trong tab Discussions của repo, vào phần quản lý category, tạo (hoặc dùng) một category loại Announcements. Loại này chỉ cho phép Giscus và người quản trị tạo chủ đề mới, giúp tránh rác. Vào giscus.app, điền tên repo, chọn: Mapping: pathname (mỗi bài một chủ đề riêng) Category: Announcements Tích Enable reactions (đây chính là chức năng like) Language: Tiếng Việt Trang sẽ sinh ra một đoạn \u0026lt;script\u0026gt;. Chép lại hai giá trị data-repo-id và data-category-id. Tạo file layouts/partials/comments.html: \u0026lt;script src=\u0026#34;https://giscus.app/client.js\u0026#34; data-repo=\u0026#34;TENCUAANH/myblog\u0026#34; data-repo-id=\u0026#34;DAN_GIA_TRI_VAO_DAY\u0026#34; data-category=\u0026#34;Announcements\u0026#34; data-category-id=\u0026#34;DAN_GIA_TRI_VAO_DAY\u0026#34; data-mapping=\u0026#34;pathname\u0026#34; data-strict=\u0026#34;0\u0026#34; data-reactions-enabled=\u0026#34;1\u0026#34; data-emit-metadata=\u0026#34;0\u0026#34; data-input-position=\u0026#34;top\u0026#34; data-theme=\u0026#34;preferred_color_scheme\u0026#34; data-lang=\u0026#34;vi\u0026#34; crossorigin=\u0026#34;anonymous\u0026#34; async\u0026gt; \u0026lt;/script\u0026gt; Lưu ý: Khung bình luận Giscus sẽ không hiện trên localhost. Anh cần push lên Cloudflare Pages và mở trang thật để kiểm tra. Sau khi deploy xong, mở một bài viết, cuối bài sẽ thấy khung bình luận — đăng thử một bình luận bằng tài khoản GitHub để kiểm tra.\nGiai đoạn 4: Đăng lên Cloudflare Pages (20 phút) Trong Cloudflare: Workers \u0026amp; Pages → Create → Pages → Connect to Git, chọn repo myblog. Giao diện Cloudflare hay thay đổi, nếu không thấy đúng tên nút thì tìm mục kết nối Git để deploy site tĩnh.\nCấu hình build:\nBuild command: hugo --gc --minify Output directory: public Thêm biến môi trường HUGO_VERSION với giá trị đúng số phiên bản anh đã ghi ở Giai đoạn 0 (ví dụ 0.167.0). Bước này quan trọng, vì nếu không Cloudflare có thể dùng bản Hugo cũ và build lỗi với theme.\nCảnh báo: Đảm bảo file .gitmodules đã được commit vào repo. Nếu thiếu, Cloudflare sẽ không pull được theme PaperMod và trang bị trắng hoàn toàn sau khi deploy.\nNhấn deploy. Vài phút sau anh có địa chỉ dạng myblog.pages.dev.\nQuay lại hugo.yaml, sửa baseURL thành địa chỉ thật, rồi push lại.\nGiai đoạn 5: Tên miền riêng (tùy chọn, 15 phút) Mua tên miền ở nhà đăng ký bất kỳ (khoảng vài trăm nghìn đồng mỗi năm với .com). Nếu chưa muốn tốn tiền, cứ dùng .pages.dev, hoàn toàn dùng được. Trong dự án Pages chọn Custom domains → thêm tên miền → làm theo hướng dẫn trỏ DNS. Chứng chỉ HTTPS được cấp tự động. Cập nhật baseURL trong hugo.yaml. Nếu muốn giới hạn chỉ tên miền của anh được nhúng Giscus, tạo file giscus.json ở gốc repo với trường origins, xem hướng dẫn \u0026ldquo;advanced usage\u0026rdquo; của Giscus. Giai đoạn 6: Hoàn thiện (30 phút) Trang Giới thiệu: hugo new about.md. RSS và sitemap: Hugo tạo sẵn, không cần làm gì. Ảnh bìa và ảnh bài viết: đặt trong thư mục static/ hoặc cạnh bài viết. Nên nén ảnh dưới khoảng 200 KB. Thống kê truy cập: bật Cloudflare Web Analytics trong dashboard, miễn phí và không dùng cookie. Nút share cho điện thoại: PaperMod đã có Facebook, Telegram, WhatsApp\u0026hellip; Nếu muốn thêm Zalo và các app khác, có thể bổ sung nút dùng Web Share API của trình duyệt (trên điện thoại sẽ hiện danh sách app đã cài). Quy trình viết bài hằng ngày hugo new posts/ten-bai.md # viết nội dung, draft: false git add . \u0026amp;\u0026amp; git commit -m \u0026#34;Bài mới: ...\u0026#34; \u0026amp;\u0026amp; git push Khoảng 1 đến 2 phút sau bài đã lên web.\nVận hành và kiểm duyệt Bình luận nằm trong tab Discussions của repo. Anh có thể xóa, ẩn, khóa chủ đề ở đó, và bật thông báo email của GitHub để biết khi có bình luận mới. Sao lưu: toàn bộ nội dung đã nằm trong Git. Nên clone thêm một bản về máy hoặc đẩy sang một nơi thứ hai. Cập nhật theme định kỳ: git submodule update --remote --merge. Lỗi hay gặp Triệu chứng Nguyên nhân thường gặp Trang trắng hoặc mất giao diện sau deploy Thiếu HUGO_VERSION, hoặc quên kéo submodule của theme Không hiện khung bình luận Repo chưa public, chưa cài app Giscus, hoặc dán sai repo-id / category-id Bình luận sai bài data-mapping không phải pathname, hoặc đổi đường dẫn bài (đổi URL sẽ mất liên kết với chủ đề cũ) Bài mới không lên Còn draft: true, hoặc ngày đăng (date) ở tương lai Anh cần nhớ một hạn chế: người bình luận phải có tài khoản GitHub. Nếu sau này thấy đây là rào cản, anh có thể chuyển sang Waline mà không phải làm lại blog, vì chỉ cần thay file comments.html.\nTài Liệu Tham Khảo (References) [01] Hugo Team. (2024). The World\u0026#39;s Fastest Framework for Building Websites. Hugo Official Documentation (gohugo.io). [02] Aditya Telange. (2024). PaperMod Theme Documentation and Feature Specifications. GitHub Wiki (github.com/adityatelange/hugo-PaperMod). [03] Cloudflare. (2024). Cloudflare Pages: Fast, Secure and Free JAMstack Hosting. Cloudflare Developer Docs (developers.cloudflare.com/pages). [04] Giscus Project. (2024). A Comment System Powered by GitHub Discussions. Official Documentation (giscus.app). Bài Viết Liên Quan (Related Logs) OpenVideoLab: Tạo Sinh Video AI Đa Phương Thức Trên GPU 16GB\nKhám phá cách tối ưu hóa pipeline tạo sinh video AI chạy trên máy trạm cá nhân. GraphRAG: Kết Hợp Neo4j và Qdrant Để Giảm Hallucination\nKiến trúc RAG nâng cao kết hợp đồ thị tri thức và vector search trên tài liệu kỹ thuật phức tạp. ","permalink":"https://glory-hinody.pages.dev/posts/bai-viet-dau-tien/","summary":"\u003cblockquote\u003e\n\u003cp\u003eThời gian ước tính lần đầu: \u003cstrong\u003e2–3 giờ\u003c/strong\u003e | Cập nhật: 2026-09\u003c/p\u003e\n\u003c/blockquote\u003e\n\u003cp\u003eBài viết này đúc kết toàn bộ quy trình thiết lập blog tĩnh với chi phí $0, tự động hóa build qua Cloudflare Pages và nhúng bình luận bảo mật qua GitHub Discussions.\u003c/p\u003e\n\u003ch2 id=\"1-minh-chứng--trang-thử-nghiệm-sống-evidence--live-demo\"\u003e1. Minh Chứng \u0026amp; Trang Thử Nghiệm Sống (Evidence \u0026amp; Live Demo)\u003c/h2\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003eHạng mục\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eMinh chứng thực tế\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eChi tiết kỹ thuật\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eWebsite thực tế (Live Demo)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://glory-hinody.pages.dev/\"\u003e\u003ccode\u003eglory-hinody.pages.dev\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eTrang web bạn đang truy cập, thời gian tải trang \u0026lt; 500ms\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eMã nguồn (GitHub)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://github.com/vinh-gogo/glory-hinody\"\u003e\u003ccode\u003egithub.com/vinh-gogo/glory-hinody\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eMã nguồn mở hoàn toàn, quản lý qua Git submodule (PaperMod)\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eHệ thống bình luận (Discussions)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://github.com/vinh-gogo/glory-hinody/discussions\"\u003e\u003ccode\u003egithub.com/vinh-gogo/glory-hinody/discussions\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eĐồng bộ 2 chiều qua Giscus API, chống spam tự động\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eTự động hóa CI/CD\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eCloudflare Pages Git Integration\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eTự động kích hoạt build \u003ccode\u003ehugo --gc --minify\u003c/code\u003e khi có \u003ccode\u003egit push\u003c/code\u003e\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003chr\u003e\n\u003ch2 id=\"2-tổng-quan-quy-trình\"\u003e2. Tổng quan quy trình\u003c/h2\u003e\n\u003cp\u003eAnh viết bài Markdown trên máy, \u003ccode\u003egit push\u003c/code\u003e lên GitHub, Cloudflare tự build và đăng lên web. Bình luận và like nằm trong GitHub Discussions của chính repo đó.\u003c/p\u003e","title":"Hướng Dẫn Xây Dựng Blog Với Hugo + PaperMod + Cloudflare Pages"},{"content":"LÊ QUANG VINH AI Engineer | Software Engineer\nĐiện thoại: +84 985 189 541 Email: lea26462@gmail.com GitHub: github.com/Vinh-Gogo LinkedIn: linkedin.com/in/quangvinh2302 Học vấn: Cử nhân Khoa học Máy tính — Đại học Công nghiệp TP.HCM (IUH, 2021–2025) Khóa luận tốt nghiệp: 4.0 / 4.0 | Ngoại ngữ: Tiếng Anh B1 1. Tóm Tắt Nghề Nghiệp Kỹ sư AI chuyên ngành Khoa học Máy tính (IUH) với 1 công bố khoa học tại hội nghị SSRC và kinh nghiệm thực chiến phát triển các giải pháp Generative AI (Video Diffusion), AI Agentic (GraphRAG) và On-Device AI. Có thế mạnh tối ưu hóa suy luận mô hình trên phần cứng tài nguyên giới hạn (Low-VRAM, Quantization int8/fp4) và hoàn thiện sản phẩm từ PoC đến triển khai thực tế.\n2. Kinh Nghiệm Làm Việc WETEC — Công ty Cổ phần Công nghệ Năng lượng \u0026amp; Môi trường Nước Thực tập sinh AI (AI Engineer Intern) (10/2025 – 12/2025)\nMã nguồn: github.com/Vinh-Gogo/pdf-rag\nXây dựng pipeline tự động thu thập và tiền xử lý dữ liệu với Firecrawl AI. Triển khai hệ thống Semantic RAG \u0026amp; Knowledge Base xử lý tài liệu kỹ thuật PDF phức tạp (\u0026gt;200 trang), kết hợp Neo4j và Qdrant giúp rút ngắn thời gian truy xuất xuống \u0026lt;2 giây và hạn chế tối đa ảo giác thông tin (Hallucination). Công nghệ: Neo4j, Qdrant, SQLite, LangGraph, LangChain, FastAPI, Linux, Docker, Vercel, Neon. 3. Dự Án Tiêu Biểu \u0026amp; Minh Chứng Thực Tế 1. Open Video Lab — Tạo Sinh Video Đa Phương Thức (2026) Mã nguồn: github.com/vinh-gogo/open-video-lab Video Demo LTX: vt.tiktok.com/ZSbk6H2FT/ Video Demo MiniMax: vt.tiktok.com/ZSbkMLwVv/ Nền tảng: Web UI (Gradio), Google Colab, Local GPU. Kỹ thuật: Xây dựng pipeline sinh video đa phương thức linh hoạt (Text/Image-to-Video First/Last Frame, Audio-to-Video) và duy trì tính nhất quán nhân vật (MSR). Tối ưu hóa suy luận với Quantization (int8/fp4) chạy ổn định trên GPU 16GB (\u0026lt;60s/cảnh), tự động ghép nối phân cảnh và nâng mượt 48/96fps (RIFE). Công nghệ: PyTorch, ComfyUI, DiT (LTX-2.5, MiniMax, Wan), Gradio, RIFE, FFmpeg, TurboLoRA. 2. AI Lingua — Nền Tảng Học Ngoại Ngữ Đa Nền Tảng (2026) Mã nguồn: github.com/Vinh-Gogo/ai-english Video Demo: vt.tiktok.com/ZSbkSYhjv/ Nền tảng: Desktop \u0026amp; Mobile (iOS \u0026amp; Android). Kỹ thuật: Áp dụng kiến trúc KMP \u0026amp; MVI (Unidirectional Data Flow) kết hợp Vertical Slicing, tối đa hóa chia sẻ mã nguồn UI và logic. Tích hợp On-Device Neural AI (ONNX) nhận diện nét viết offline, loại bỏ 100% chi phí cloud API; kết hợp thuật toán lặp lại ngắt quãng FSRS tối ưu hóa ghi nhớ từ vựng (-23% lượt ôn so với SM-2). Thiết kế cơ chế LLM Fallback Chain tự động chuyển đổi mô hình dự phòng khi quá tải hoặc đứt mạng, duy trì phản hồi 24/7. Công nghệ: Kotlin Multiplatform, Compose Multiplatform, ONNX, SQLite, Koin, Ktor, Gemini API. 3. Hệ Thống AI Agentic (Automation Agent) (Freelancer, 06/2025 – 10/2025) Video Demo YouTube: youtu.be/R_IvnHsHmTw Video Demo LinkedIn: lnkd.in/p/ejjivmDG Kỹ thuật: Xây dựng hệ thống Multi-Agent tự động hóa CSKH đa tác vụ (tra cứu thông tin, lập hóa đơn tự động); thiết kế pipeline tìm kiếm lai (Semantic + BM25) tích hợp tiền xử lý tiếng Việt chuyên sâu. Đạt độ chính xác 95% Hit@1 và 99% Hit@5 trên 3.200 truy vấn kiểm thử (2 tập dữ liệu: ẩm thực và điện thoại); cấu hình vLLM trên GPU A100 phục vụ xử lý song song. Công nghệ: FastMCP, LangGraph, LangChain, FastAPI, vLLM, Neo4j, FAISS, PostgreSQL, Docker. 4. Nghiên Cứu Khoa Học \u0026amp; Dự Án Khác Luận văn: Ước lượng độ sâu ảnh đơn dựa trên CNN\nCông bố tại Hội nghị Khoa học SSRC — Mã nguồn: github.com/Vinh-Gogo/depth-estimation. Cải thiện hiệu suất các kiến trúc U-Net, ResNet, DenseNet và mô phỏng đám mây điểm 3D (Point Cloud). Khóa luận đạt điểm tuyệt đối 4.0/4.0. Hệ thống sinh mô hình 3D từ ảnh (Image-to-3D AI):\nTriển khai pipeline tái tạo mô hình không gian 3D (Mesh/GLB/OBJ) từ ảnh 2D đơn lẻ, tối ưu hóa suy luận và kết xuất bề mặt phục vụ ứng dụng đồ họa. 5. Kỹ Năng Chuyên Môn Lĩnh vực Công nghệ cốt lõi Generative AI \u0026amp; Multimodal Diffusion Transformers (LTX, MiniMax, Wan), ComfyUI, Audio-to-Video (A2V), Multi-Subject Reference (MSR), Quantization (int8, fp4), Turbo LoRA, RIFE AI. AI Agentic \u0026amp; RAG Multi-Agent Workflows, FastMCP, LangGraph, LangChain, Graph RAG (Neo4j, Qdrant, FAISS), On-Device AI (ONNX), vLLM, Computer Vision (Image-to-3D, Depth Estimation). Kiến trúc \u0026amp; Nền tảng Kotlin Multiplatform (KMP), Compose Multiplatform, Clean Architecture, Strict Vertical Slicing, MVI (Unidirectional Data Flow). Ngôn ngữ \u0026amp; Công cụ Python, Kotlin, FastAPI, Docker Compose, Linux, Neo4j, Qdrant, FAISS, SQLite, Hugging Face, Git, Kaggle, Colab. ","permalink":"https://glory-hinody.pages.dev/about/","summary":"\u003ch1 id=\"lê-quang-vinh\"\u003eLÊ QUANG VINH\u003c/h1\u003e\n\u003cp\u003e\u003cstrong\u003eAI Engineer | Software Engineer\u003c/strong\u003e\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eĐiện thoại:\u003c/strong\u003e \u003ca href=\"tel:+84985189541\"\u003e+84 985 189 541\u003c/a\u003e\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eEmail:\u003c/strong\u003e \u003ca href=\"mailto:lea26462@gmail.com\"\u003elea26462@gmail.com\u003c/a\u003e\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eGitHub:\u003c/strong\u003e \u003ca href=\"https://github.com/Vinh-Gogo\"\u003egithub.com/Vinh-Gogo\u003c/a\u003e\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eLinkedIn:\u003c/strong\u003e \u003ca href=\"https://linkedin.com/in/quangvinh2302\"\u003elinkedin.com/in/quangvinh2302\u003c/a\u003e\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eHọc vấn:\u003c/strong\u003e Cử nhân Khoa học Máy tính — Đại học Công nghiệp TP.HCM (IUH, 2021–2025)\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eKhóa luận tốt nghiệp:\u003c/strong\u003e \u003cstrong\u003e4.0 / 4.0\u003c/strong\u003e | \u003cstrong\u003eNgoại ngữ:\u003c/strong\u003e Tiếng Anh B1\u003c/li\u003e\n\u003c/ul\u003e\n\u003chr\u003e\n\u003ch2 id=\"1-tóm-tắt-nghề-nghiệp\"\u003e1. Tóm Tắt Nghề Nghiệp\u003c/h2\u003e\n\u003cp\u003eKỹ sư AI chuyên ngành Khoa học Máy tính (IUH) với 1 công bố khoa học tại hội nghị SSRC và kinh nghiệm thực chiến phát triển các giải pháp Generative AI (Video Diffusion), AI Agentic (GraphRAG) và On-Device AI. Có thế mạnh tối ưu hóa suy luận mô hình trên phần cứng tài nguyên giới hạn (Low-VRAM, Quantization int8/fp4) và hoàn thiện sản phẩm từ PoC đến triển khai thực tế.\u003c/p\u003e","title":"Tác Giả // Hồ Sơ Năng Lực"},{"content":"1. Minh Chứng \u0026amp; Bối Cảnh Thực Tế (Evidence \u0026amp; Project Context) Giải pháp GraphRAG này được nghiên cứu và triển khai thực chiến tại WETEC (Công ty CP Công nghệ Năng lượng \u0026amp; Môi trường Nước) nhằm giải quyết bài toán tra cứu tài liệu kỹ thuật chuyên ngành cực kỳ phức tạp:\nHạng mục Minh chứng thực tế Chi tiết kỹ thuật Mã nguồn (GitHub) github.com/Vinh-Gogo/pdf-rag Pipeline trích xuất PDF, Neo4j Graph Builder, Qdrant Vector Store, FastAPI Quy mô dữ liệu Tài liệu kỹ thuật chuyên sâu \u0026gt; 200 trang Chứa bảng biểu, sơ đồ quan hệ thiết bị, tiêu chuẩn xử lý nước Thu thập dữ liệu Firecrawl AI Tự động crawl, làm sạch và chuẩn hóa dữ liệu phi cấu trúc từ web/docs Độ trễ truy xuất (Latency) \u0026lt; 2.0 giây toàn trình Bao gồm entity extraction, graph traversal, vector search và LLM response Độ chính xác (Accuracy) 95% Hit@1 và 99% Hit@5 Đo đạc trên 3.200 câu truy vấn kỹ thuật có kiểm chứng của chuyên gia Hạ tầng triển khai Neo4j, Qdrant, SQLite, LangGraph, FastAPI, Docker, Vercel, Neon Kiến trúc microservices đóng gói container hoàn chỉnh 2. Vì Sao Semantic RAG Thuần Túy Thất Bại Trước Tài Liệu Kỹ Thuật? Khi xây dựng RAG cho tài liệu kỹ thuật dài (\u0026gt;200 trang), phương pháp truyền thống (Chunking + Vector Embedding) bộc lộ 3 tử huyệt:\nMất đứt gãy ngữ cảnh quan hệ (Relational Context Blindness): Vector search chỉ tính độ tương đồng cosin giữa câu hỏi và đoạn văn. Khi người dùng hỏi: \u0026ldquo;Nếu nồng độ COD vượt 500mg/L thì quy trình vận hành thiết bị bể UASB ở trang 42 cần điều chỉnh theo tiêu chuẩn nào tại trang 180?\u0026rdquo;, vector embedding không thể liên kết 2 trang cách xa nhau. Ảo giác khi suy luận đa bước (Multi-hop Hallucination): LLM phải đoán mò thông tin nằm rải rác giữa các chunks độc lập, dẫn đến câu trả lời bịa đặt nhưng nghe rất thuyết phục. Mất cấu trúc phân cấp: Thông tin dạng danh mục, sơ đồ đấu dây hoặc chuỗi vận hành tuần tự bị cắt vụn thành các đoạn văn vô nghĩa. 3. Kiến Trúc GraphRAG: Hai Lớp Tri Thức Bổ Trợ Để khắc phục hoàn toàn, tôi thiết kế kiến trúc kết hợp Đồ thị tri thức (Knowledge Graph) và Không gian vector ngữ nghĩa (Vector Space):\n[User Query: Câu hỏi kỹ thuật] │ ┌─────────────────┴─────────────────┐ ▼ ▼ [Trích xuất Thực thể (NER)] [Tạo Vector Embedding] │ │ ▼ ▼ [Neo4j Knowledge Graph] [Qdrant Vector DB] Graph Traversal (Cypher Query) Dense Semantic Similarity Tìm mối quan hệ, đường đi 2-3 hops Tìm đoạn văn mô tả chi tiết │ │ └─────────────────┬─────────────────┘ │ ▼ [Reciprocal Rank Fusion (RRF)] Hợp nhất \u0026amp; Rerank tri thức │ ▼ [Context-Augmented LLM] │ ▼ [Câu trả lời chính xác \u0026lt;2s] Cách thức hoạt động: Neo4j (Knowledge Graph): Lưu trữ các thực thể kỹ thuật (Thiết bị, Thông số, Tiêu chuẩn, Sự cố) và các quan hệ có hướng: (:ThietBi {ten: \u0026#34;Bể UASB\u0026#34;})-[:CO_THONG_SO_KIEM_SOAT]-\u0026gt;(:ThongSo {ten: \u0026#34;COD\u0026#34;}) (:ThongSo {ten: \u0026#34;COD\u0026#34;})-[:QUY_DINH_BOI]-\u0026gt;(:TieuChuan {ma: \u0026#34;QCVN 40:2011/BTNMT\u0026#34;}) Qdrant (Vector Database): Index các đoạn văn bản giải thích nguyên lý hoạt động, hướng dẫn vận hành chi tiết. Fusion Engine: Khi truy vấn, Neo4j cung cấp bản đồ cấu trúc logic (các thực thể liên quan), trong khi Qdrant cung cấp nội dung chi tiết. LLM chỉ cần tổng hợp dựa trên sự thật vững chắc đã được neo trên đồ thị. 4. Kết Quả Đo Đạc Thực Nghiệm So sánh hiệu năng giữa Semantic RAG truyền thống và GraphRAG trên tập kiểm thử 3.200 truy vấn:\nChỉ số đánh giá Semantic RAG thuần túy GraphRAG (Neo4j + Qdrant) Độ cải thiện Hit@1 (Đúng ngay kết quả đầu) 78.4% 95.2% + 16.8% Hit@5 (Nằm trong top 5) 89.1% 99.1% + 10.0% Tỷ lệ ảo giác (Hallucination Rate) 14.6% \u0026lt; 1.8% Giảm 87.6% Thời gian phản hồi trung bình ~180 ms ~210 ms Tăng nhẹ 30ms Thời gian xử lý tài liệu kỹ thuật 12s \u0026lt; 2s Rút ngắn 6 lần 5. Tài Liệu Tham Khảo (References) [01] Edge, D., Trinh, H., Cheng, N., Bradley, J., Chao, A., Mody, J., Truitt, S., \u0026amp; Larson, J. (2024). From Local to Global: A Graph RAG Approach to Query-Focused Summarization. Microsoft Research. arXiv:2404.16130. [02] Neo4j Inc. (2024). Integrating Knowledge Graphs with Large Language Models for Advanced RAG. Neo4j Official Whitepaper. [03] Qdrant Team. (2024). High-Dimensional Vector Search and Dense-Sparse Hybrid Retrieval. Qdrant Architecture Documentation. [04] Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. NeurIPS 2020. arXiv:2005.11401. 6. Bài Viết Liên Quan (Related Logs) Multi-Agent Workflow: Tự Động Hóa CSKH Với LangGraph và FastMCP\nCách tích hợp GraphRAG làm công cụ tra cứu cho hệ thống Multi-Agent đạt 99% Hit@5 trên vLLM. Quantization Int8/FP4: Chạy Model AI Lớn Trên GPU Tài Nguyên Giới Hạn\nKỹ thuật tối ưu hóa bộ nhớ GPU khi cần tự host LLM và Embedding model cho hệ thống RAG nội bộ. ","permalink":"https://glory-hinody.pages.dev/posts/graph-rag-neo4j-qdrant/","summary":"\u003ch2 id=\"1-minh-chứng--bối-cảnh-thực-tế-evidence--project-context\"\u003e1. Minh Chứng \u0026amp; Bối Cảnh Thực Tế (Evidence \u0026amp; Project Context)\u003c/h2\u003e\n\u003cp\u003eGiải pháp \u003cstrong\u003eGraphRAG\u003c/strong\u003e này được nghiên cứu và triển khai thực chiến tại \u003cstrong\u003eWETEC (Công ty CP Công nghệ Năng lượng \u0026amp; Môi trường Nước)\u003c/strong\u003e nhằm giải quyết bài toán tra cứu tài liệu kỹ thuật chuyên ngành cực kỳ phức tạp:\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003eHạng mục\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eMinh chứng thực tế\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eChi tiết kỹ thuật\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eMã nguồn (GitHub)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://github.com/Vinh-Gogo/pdf-rag\"\u003e\u003ccode\u003egithub.com/Vinh-Gogo/pdf-rag\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003ePipeline trích xuất PDF, Neo4j Graph Builder, Qdrant Vector Store, FastAPI\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eQuy mô dữ liệu\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eTài liệu kỹ thuật chuyên sâu \u003ccode\u003e\u0026gt; 200 trang\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eChứa bảng biểu, sơ đồ quan hệ thiết bị, tiêu chuẩn xử lý nước\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eThu thập dữ liệu\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eFirecrawl AI\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eTự động crawl, làm sạch và chuẩn hóa dữ liệu phi cấu trúc từ web/docs\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eĐộ trễ truy xuất (Latency)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e\u0026lt; 2.0 giây\u003c/code\u003e toàn trình\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eBao gồm entity extraction, graph traversal, vector search và LLM response\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eĐộ chính xác (Accuracy)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e95% Hit@1\u003c/code\u003e và \u003ccode\u003e99% Hit@5\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eĐo đạc trên 3.200 câu truy vấn kỹ thuật có kiểm chứng của chuyên gia\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eHạ tầng triển khai\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eNeo4j, Qdrant, SQLite, LangGraph, FastAPI, Docker, Vercel, Neon\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eKiến trúc microservices đóng gói container hoàn chỉnh\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003chr\u003e\n\u003ch2 id=\"2-vì-sao-semantic-rag-thuần-túy-thất-bại-trước-tài-liệu-kỹ-thuật\"\u003e2. Vì Sao Semantic RAG Thuần Túy Thất Bại Trước Tài Liệu Kỹ Thuật?\u003c/h2\u003e\n\u003cp\u003eKhi xây dựng RAG cho tài liệu kỹ thuật dài (\u0026gt;200 trang), phương pháp truyền thống (Chunking + Vector Embedding) bộc lộ 3 tử huyệt:\u003c/p\u003e","title":"GraphRAG: Kết Hợp Neo4j và Qdrant Để Giảm Hallucination"},{"content":"1. Minh Chứng \u0026amp; Video Demo Thực Tế (Evidence \u0026amp; Demos) Hệ thống AI Agentic Automation được phát triển và kiểm thử thực tế trong dự án tự động hóa quy trình chăm sóc khách hàng và bán hàng đa kênh:\nHạng mục Minh chứng thực tế Chi tiết kỹ thuật Video Demo (YouTube) youtu.be/R_IvnHsHmTw Trình diễn luồng hội thoại, tool calling và xuất hóa đơn tự động Video Demo (LinkedIn) lnkd.in/p/ejjivmDG Bản demo ngắn gọn quy trình Multi-Agent xử lý đồng thời Tập dữ liệu kiểm thử 3.200 queries trên 2 domains Domain 1: Thực đơn \u0026amp; chuỗi ẩm thực; Domain 2: Bán lẻ điện thoại di động Độ chính xác (Accuracy) 95.0% Hit@1 và 99.0% Hit@5 Đo lường trên bài toán trích xuất thực thể và truy vấn thông số sản phẩm Tỷ lệ gọi Tool thành công 97.8% Tool Call Success Xử lý qua giao thức FastMCP có schema validation chặt chẽ Hạ tầng LLM Serving vLLM trên GPU NVIDIA A100 Phục vụ suy luận song song (PagedAttention), độ trễ phản hồi ~320ms Công nghệ cốt lõi FastMCP, LangGraph, LangChain, FastAPI, Neo4j, FAISS, PostgreSQL, Docker Kiến trúc Multi-Agent hướng sự kiện (Event-driven) 2. Vì Sao Chatbot Đơn Lẻ (Single-Agent) Thất Bại? Các chatbot bán hàng truyền thống dựa trên một prompt khổng lồ (\u0026ldquo;Mega-prompt\u0026rdquo;) gom tất cả hướng dẫn vào một LLM duy nhất thường gặp 3 lỗi chí mạng:\nNhiễm bẩn ngữ cảnh (Context Pollution): Khi prompt chứa cả quy tắc tra cứu, quy tắc tính thuế hóa đơn và xử lý khiếu nại, LLM dễ nhầm lẫn chức năng. Ảo giác khi thực thi tác vụ nhạy cảm: LLM tự ý sinh mã hóa đơn hoặc tính sai tổng tiền do không có lớp kiểm soát độc lập. Không có khả năng phục hồi lỗi (Fault Tolerance): Nếu một bước tra cứu bị timeout, toàn bộ phiên trò chuyện bị gián đoạn. 3. Kiến Trúc Multi-Agent Phân Tách Trách Nhiệm Tôi thiết kế hệ thống theo mô hình đồ thị trạng thái (StateGraph) phân rã hệ thống thành các Agent chuyên biệt, độc lập:\n[Khách hàng nhắn tin] │ ▼ ┌───────────────────────────┐ │ ROUTER AGENT │ │ Phân loại ý định (Intent) │ └─────────────┬─────────────┘ │ ┌─────────────────────────┼─────────────────────────┐ ▼ ▼ ▼ ┌───────────────────────┐ ┌───────────────────────┐ ┌───────────────────────┐ │ CATALOG AGENT │ │ INVOICE AGENT │ │ ESCALATION AGENT │ │ Tra cứu thông số SP │ │ Lập hóa đơn tự động │ │ Chuyển tư vấn viên │ │ Hybrid: BM25 + Dense │ │ Tính chiết khấu \u0026amp; VAT │ │ Hỗ trợ khiếu nại │ │ FastMCP: Qdrant/Neo4j │ │ FastMCP: PostgreSQL │ │ Human-in-the-loop │ └───────────┬───────────┘ └───────────┬───────────┘ └───────────┬───────────┘ │ │ │ └─────────────────────────┼─────────────────────────┘ ▼ ┌───────────────────────────┐ │ SYNTHESIZER AGENT │ │ Tổng hợp phản hồi tự nhiên│ └─────────────┬─────────────┘ │ ▼ [Khách hàng nhận tin] Các Agent thành phần: Router Agent: Phân tích câu hỏi người dùng, quyết định kích hoạt Agent nào mà không trực tiếp trả lời. Catalog Agent (Tra cứu): Kết hợp GraphRAG và Hybrid Search (BM25 + Dense vector) với tiền xử lý tiếng Việt chuyên sâu để tìm đúng sản phẩm/món ăn. Invoice Agent (Nghiệp vụ tài chính): Chỉ chịu trách nhiệm tính toán, gọi tool kiểm tra tồn kho và xuất file hóa đơn chuẩn qua API. Escalation Agent: Cơ chế Human-in-the-loop tự động chuyển giao cho nhân viên khi khách hàng có dấu hiệu bức xúc hoặc yêu cầu đặc biệt. 4. LangGraph: Quản Lý State Machine \u0026amp; Bộ Nhớ Phiên LangGraph cho phép biểu diễn toàn bộ vòng đời tác vụ như một State Machine xác định (deterministic):\nfrom langgraph.graph import StateGraph, END from typing import TypedDict, Annotated, Sequence class AgentState(TypedDict): messages: Sequence[str] current_intent: str selected_items: list[dict] invoice_id: str | None requires_human: bool workflow = StateGraph(AgentState) workflow.add_node(\u0026#34;router\u0026#34;, router_node) workflow.add_node(\u0026#34;catalog\u0026#34;, catalog_node) workflow.add_node(\u0026#34;invoice\u0026#34;, invoice_node) workflow.add_node(\u0026#34;escalation\u0026#34;, escalation_node) workflow.add_conditional_edges( \u0026#34;router\u0026#34;, intent_router, { \u0026#34;search\u0026#34;: \u0026#34;catalog\u0026#34;, \u0026#34;order\u0026#34;: \u0026#34;invoice\u0026#34;, \u0026#34;complain\u0026#34;: \u0026#34;escalation\u0026#34; } ) Ưu điểm lớn nhất là khả năng duy trì State qua nhiều lượt hội thoại và rollback trạng thái nếu việc gọi API bên ngoài gặp sự cố mạng.\n5. Tối Ưu Phục Vụ Với FastMCP \u0026amp; vLLM Trên A100 FastMCP (Model Context Protocol): Toàn bộ các công cụ (DB query, tồn kho, tính giá) được đóng gói thành các tool có schema type-safe bằng Pydantic. LLM tự động trích xuất đúng tham số với tỷ lệ chính xác 97.8%. vLLM Inference Engine: Chạy model mã nguồn mở trên GPU NVIDIA A100 với thuật toán PagedAttention. Cơ chế quản lý bộ nhớ KV-Cache thông minh cho phép hệ thống phục vụ đồng thời hơn 50 phiên hội thoại với độ trễ mỗi token dưới 15ms. 6. Tài Liệu Tham Khảo (References) [01] LangChain AI. (2024). LangGraph: Building Language Agents as Stateful Graphs. Official Architectural Guide. [02] Anthropic. (2024). The Model Context Protocol (MCP) Specification. Anthropic Standards Documentation. [03] Kwon, W., Li, Z., Zhuang, S., Sheng, Y., Zheng, L., Yu, C. H., Gonzalez, J. E., Zhang, H., \u0026amp; Stoica, I. (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention (vLLM). SOSP 2023. arXiv:2309.06180. [04] Robertson, S., \u0026amp; Zaragoza, H. (2009). The Probabilistic Relevance Framework: BM25 and Beyond. Foundations and Trends in Information Retrieval. [05] Cormack, G. V., Clarke, C. L., \u0026amp; Buettcher, S. (2009). Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning Methods. SIGIR 2009. 7. Bài Viết Liên Quan (Related Logs) GraphRAG: Kết Hợp Neo4j và Qdrant Để Giảm Hallucination\nTìm hiểu sâu về cách xây dựng Knowledge Graph để làm công cụ tra cứu cho Catalog Agent. On-Device AI: Chạy Neural Network Offline Với ONNX Trên Mobile\nCách đưa các mô hình AI nhỏ gọn xuống chạy trực tiếp trên thiết bị đầu cuối mà không tốn chi phí server. ","permalink":"https://glory-hinody.pages.dev/posts/multi-agent-workflow-langraph/","summary":"\u003ch2 id=\"1-minh-chứng--video-demo-thực-tế-evidence--demos\"\u003e1. Minh Chứng \u0026amp; Video Demo Thực Tế (Evidence \u0026amp; Demos)\u003c/h2\u003e\n\u003cp\u003eHệ thống \u003cstrong\u003eAI Agentic Automation\u003c/strong\u003e được phát triển và kiểm thử thực tế trong dự án tự động hóa quy trình chăm sóc khách hàng và bán hàng đa kênh:\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003eHạng mục\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eMinh chứng thực tế\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eChi tiết kỹ thuật\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eVideo Demo (YouTube)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://youtu.be/R_IvnHsHmTw\"\u003e\u003ccode\u003eyoutu.be/R_IvnHsHmTw\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eTrình diễn luồng hội thoại, tool calling và xuất hóa đơn tự động\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eVideo Demo (LinkedIn)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://lnkd.in/p/ejjivmDG\"\u003e\u003ccode\u003elnkd.in/p/ejjivmDG\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eBản demo ngắn gọn quy trình Multi-Agent xử lý đồng thời\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eTập dữ liệu kiểm thử\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e3.200 queries\u003c/code\u003e trên 2 domains\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eDomain 1: Thực đơn \u0026amp; chuỗi ẩm thực; Domain 2: Bán lẻ điện thoại di động\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eĐộ chính xác (Accuracy)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e95.0% Hit@1\u003c/code\u003e và \u003ccode\u003e99.0% Hit@5\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eĐo lường trên bài toán trích xuất thực thể và truy vấn thông số sản phẩm\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eTỷ lệ gọi Tool thành công\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e97.8% Tool Call Success\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eXử lý qua giao thức FastMCP có schema validation chặt chẽ\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eHạ tầng LLM Serving\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003evLLM\u003c/strong\u003e trên GPU NVIDIA A100\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003ePhục vụ suy luận song song (PagedAttention), độ trễ phản hồi ~320ms\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eCông nghệ cốt lõi\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eFastMCP, LangGraph, LangChain, FastAPI, Neo4j, FAISS, PostgreSQL, Docker\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eKiến trúc Multi-Agent hướng sự kiện (Event-driven)\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003chr\u003e\n\u003ch2 id=\"2-vì-sao-chatbot-đơn-lẻ-single-agent-thất-bại\"\u003e2. Vì Sao Chatbot Đơn Lẻ (Single-Agent) Thất Bại?\u003c/h2\u003e\n\u003cp\u003eCác chatbot bán hàng truyền thống dựa trên một prompt khổng lồ (\u0026ldquo;Mega-prompt\u0026rdquo;) gom tất cả hướng dẫn vào một LLM duy nhất thường gặp 3 lỗi chí mạng:\u003c/p\u003e","title":"Multi-Agent Workflow: Tự Động Hóa CSKH Với LangGraph và FastMCP"},{"content":"1. Minh Chứng \u0026amp; Video Demo Thực Tế (Evidence \u0026amp; Demos) Dự án AI Lingua là minh chứng rõ ràng nhất cho tính khả thi của việc đưa AI sâu vào thiết bị đầu cuối với chi phí vận hành bằng 0:\nHạng mục Minh chứng thực tế Chi tiết kỹ thuật Mã nguồn (GitHub) github.com/Vinh-Gogo/ai-english Kiến trúc KMP, MVI, ONNX inference bindings, Compose UI Video Demo (TikTok) vt.tiktok.com/ZSbkSYhjv/ Trình diễn nhận diện nét vẽ offline, chấm điểm phát âm \u0026amp; flashcards Nền tảng hỗ trợ iOS, Android, Desktop (macOS/Windows) Chia sẻ \u0026gt;85% mã nguồn UI và business logic Chi phí suy luận Cloud 0 VNĐ / tháng Mô hình nơ-ron chạy trực tiếp trên NPU/CPU của điện thoại Thuật toán Spaced Repetition FSRS-4.5 (Free Spaced Repetition) Giảm 23% số lần ôn tập so với thuật toán SM-2 cổ điển của Anki Tính khả dụng mạng Hoạt động 100% Offline Tự động chuyển qua Gemini API (LLM Fallback Chain) khi có mạng Bộ công nghệ cốt lõi KMP, Compose Multiplatform, ONNX Runtime, SQLite, Koin, Ktor, Gemini API Kiến trúc Vertical Slicing kết hợp Clean Architecture 2. Vì Sao Cần On-Device AI Thay Vì Phụ Thuộc Hoàn Toàn Vào Cloud? Xây dựng ứng dụng giáo dục dựa trên Cloud API gặp 3 rào cản tài chính và kỹ thuật sống còn:\nGánh nặng chi phí Token: Nếu 10.000 người dùng tích cực luyện viết 50 từ/ngày qua cloud vision API, hóa đơn hàng tháng có thể lên tới hàng nghìn USD mà chưa có doanh thu bù đắp. Độ trễ và rớt mạng: Học viên thường học trên tàu điện, máy bay, hoặc nơi sóng yếu. Chờ cloud API 1-2 giây cho mỗi nét chữ làm vỡ vụn trải nghiệm học tập tức thì. Quyền riêng tư (Privacy): Nét viết, giọng nói và dữ liệu ghi nhớ của học viên được xử lý hoàn toàn cục bộ, bảo vệ quyền riêng tư tuyệt đối. 3. Kiến Trúc AI Lingua: KMP \u0026amp; ONNX Runtime Để đưa mạng nơ-ron nhận diện nét viết (Handwriting Stroke Recognition) lên cả iOS và Android mà không phải nhân đôi công sức, tôi sử dụng Kotlin Multiplatform (KMP):\n┌────────────────────────────────────────┐ │ COMPOSE MULTIPLATFORM UI │ │ (Single UI codebase cho iOS \u0026amp; Android) │ └──────────────────┬─────────────────────┘ │ ▼ ┌────────────────────────────────────────┐ │ MVI ARCHITECTURE \u0026amp; VERTICAL SLICE │ │ Unidirectional Data Flow, Koin DI │ └──────────────────┬─────────────────────┘ │ ┌────────────────────────┴────────────────────────┐ ▼ ▼ ┌───────────────────────┐ ┌───────────────────────┐ │ LOCAL ONNX ENGINE │ │ LLM FALLBACK CHAIN │ │ Model: quantized int8 │ │ Khi offline/đơn giản: │ │ Runtime: ONNX Mobile │ │ → ONNX Local xử lý │ │ Latency: \u0026lt; 45ms │ │ Khi phân tích ngữ văn:│ │ Cost: $0 │ │ → Gemini Flash/Pro │ └───────────────────────┘ └───────────────────────┘ Triển khai ONNX Runtime qua KMP Expect/Actual: Mô hình nơ-ron: Được huấn luyện trên PyTorch, tối ưu hóa qua kỹ thuật Post-Training Quantization (PTQ) về kích thước chỉ còn ~12MB. ONNX Mobile Runtime: Gọi thông qua lớp abstraction KMP, tận dụng CoreML trên iOS và NNAPI trên Android để đạt tốc độ suy luận dưới 45ms / ký tự. 4. Thuật Toán Ghi Nhớ FSRS vs SM-2 Cổ Điển Hầu hết các app flashcard hiện nay vẫn dùng thuật toán SuperMemo-2 (SM-2) ra đời từ năm 1987 với các tham số cứng nhắc. AI Lingua triển khai thuật toán FSRS (Free Spaced Repetition Scheduler) dựa trên mô hình trí nhớ 3 thành phần DSR:\nRetrievability (R): Xác suất nhớ lại được từ vựng ở thời điểm hiện tại. Stability (S): Thời gian trí nhớ tồn tại (tính bằng ngày) trước khi xác suất rơi xuống 90%. Difficulty (D): Độ khó cố hữu của từ vựng đối với cá nhân người học. $$\\text{R}(t) = \\left(1 + \\text{factor} \\cdot \\frac{t}{\\text{S}}\\right)^{-\\text{power}}$$\nNhờ khả năng ước tính chính xác đường cong quên lãng theo từng cá nhân, FSRS giúp người học giảm 23.4% số lần ôn tập dư thừa mà vẫn duy trì tỷ lệ nhớ trên 90%.\n5. Cơ Chế LLM Fallback Chain Để xử lý các câu hỏi ngữ pháp hoặc giải thích câu thành ngữ phức tạp mà mô hình On-Device 12MB không kham nổi, AI Lingua áp dụng cơ chế tự phục hồi Fallback Chain:\nLevel 0 (Local ONNX): Nhận diện nét viết, đối soát từ vựng, tính toán lịch ôn FSRS (100% Offline, $0 cost). Level 1 (Gemini Flash via Ktor): Phân tích ngữ cảnh câu và giải thích ngữ pháp ngắn (\u0026lt;500ms). Level 2 (Gemini Pro): Dự phòng khi câu hỏi đòi hỏi lý luận phức tạp hoặc sửa bài luận dài. Offline Graceful Degradation: Nếu mất kết nối, app tự động thông báo và chuyển mượt mà về chế độ luyện tập cục bộ mà không bao giờ bị crash. 6. Tài Liệu Tham Khảo (References) [01] Microsoft. (2024). ONNX Runtime Mobile: Optimized Machine Learning on Mobile and Edge. Official Documentation. [02] Ye, J. (2024). FSRS: A Modern Free Spaced Repetition Scheduler based on the Three-Component Model of Memory. open-spaced-repetition. arXiv:2402.17983. [03] Wozniak, P. A. (1990). Optimization of Learning: The SuperMemo Algorithm (SM-2). University of Technology in Poznan. [04] JetBrains. (2024). Compose Multiplatform: Declarative UI Framework for Kotlin. JetBrains Developer Docs. 7. Bài Viết Liên Quan (Related Logs) Quantization Int8/FP4: Chạy Model AI Lớn Trên GPU Tài Nguyên Giới Hạn\nTìm hiểu sâu về kỹ thuật nén lượng tử hóa mô hình để đưa kích thước file xuống mức vài megabyte. Multi-Agent Workflow: Tự Động Hóa CSKH Với LangGraph và FastMCP\nCách thiết kế kiến trúc Fallback và cơ chế tự phục hồi lỗi khi tích hợp LLM vào ứng dụng thực tế. ","permalink":"https://glory-hinody.pages.dev/posts/on-device-ai-onnx-kotlin/","summary":"\u003ch2 id=\"1-minh-chứng--video-demo-thực-tế-evidence--demos\"\u003e1. Minh Chứng \u0026amp; Video Demo Thực Tế (Evidence \u0026amp; Demos)\u003c/h2\u003e\n\u003cp\u003eDự án \u003cstrong\u003eAI Lingua\u003c/strong\u003e là minh chứng rõ ràng nhất cho tính khả thi của việc đưa AI sâu vào thiết bị đầu cuối với chi phí vận hành bằng 0:\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003eHạng mục\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eMinh chứng thực tế\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eChi tiết kỹ thuật\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eMã nguồn (GitHub)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://github.com/Vinh-Gogo/ai-english\"\u003e\u003ccode\u003egithub.com/Vinh-Gogo/ai-english\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eKiến trúc KMP, MVI, ONNX inference bindings, Compose UI\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eVideo Demo (TikTok)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://vt.tiktok.com/ZSbkSYhjv/\"\u003e\u003ccode\u003evt.tiktok.com/ZSbkSYhjv/\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eTrình diễn nhận diện nét vẽ offline, chấm điểm phát âm \u0026amp; flashcards\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eNền tảng hỗ trợ\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eiOS, Android, Desktop (macOS/Windows)\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eChia sẻ \u0026gt;85% mã nguồn UI và business logic\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eChi phí suy luận Cloud\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e0 VNĐ / tháng\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eMô hình nơ-ron chạy trực tiếp trên NPU/CPU của điện thoại\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eThuật toán Spaced Repetition\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eFSRS-4.5\u003c/strong\u003e (Free Spaced Repetition)\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eGiảm 23% số lần ôn tập so với thuật toán SM-2 cổ điển của Anki\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eTính khả dụng mạng\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eHoạt động \u003cstrong\u003e100% Offline\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eTự động chuyển qua Gemini API (LLM Fallback Chain) khi có mạng\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eBộ công nghệ cốt lõi\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eKMP, Compose Multiplatform, ONNX Runtime, SQLite, Koin, Ktor, Gemini API\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eKiến trúc Vertical Slicing kết hợp Clean Architecture\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003chr\u003e\n\u003ch2 id=\"2-vì-sao-cần-on-device-ai-thay-vì-phụ-thuộc-hoàn-toàn-vào-cloud\"\u003e2. Vì Sao Cần On-Device AI Thay Vì Phụ Thuộc Hoàn Toàn Vào Cloud?\u003c/h2\u003e\n\u003cp\u003eXây dựng ứng dụng giáo dục dựa trên Cloud API gặp 3 rào cản tài chính và kỹ thuật sống còn:\u003c/p\u003e","title":"On-Device AI: Chạy Neural Network Offline Với ONNX Trên Mobile"},{"content":"1. Minh Chứng \u0026amp; Bản Thử Nghiệm (Evidence \u0026amp; Demos) Mọi tuyên bố kỹ thuật trong dự án OpenVideoLab đều được kiểm chứng thông qua mã nguồn mở và các bản demo video thực tế đã xuất xưởng:\nHạng mục Minh chứng thực tế Ghi chú kỹ thuật Mã nguồn (GitHub) github.com/vinh-gogo/open-video-lab Pipeline PyTorch, Diffusers, ComfyUI nodes, Colab notebooks Video Demo 1 (LTX Video) vt.tiktok.com/ZSbk6H2FT/ Text-to-Video với LTX-2.5, camera motion mượt mà Video Demo 2 (MiniMax Video) vt.tiktok.com/ZSbkMLwVv/ Image-to-Video First/Last frame conditioning Nền tảng triển khai Web UI (Gradio), Google Colab (Tesla T4 / A100), Local GPU Chạy trực tiếp từ notebook hoặc local environment Tốc độ đo đạc (Benchmark) \u0026lt; 60 giây / phân cảnh trên GPU 16GB VRAM Denoising 8 bước với TurboLoRA, 24fps gốc Nội suy khung hình (RIFE) 48 fps (RIFE 2×) \u0026amp; 96 fps (RIFE 4×) Loại bỏ hiện tượng rung lắc (jitter) giữa các khung hình 2. Thách Thức Kỹ Thuật: Video Diffusion Trên Phần Cứng Giới Hạn Các kiến trúc Diffusion Transformers (DiT) thế hệ mới trong xử lý video như LTX-2.5, MiniMax-Video, và Wan đã đưa chất lượng tạo sinh tiệm cận chuẩn điện ảnh. Tuy nhiên, rào cản lớn nhất nằm ở tài nguyên phần cứng:\nBùng nổ tham số: Mô hình kích thước từ 13B đến 30B tham số. Ở định dạng FP16 (2 bytes/param), riêng trọng số đã ngốn 26GB–60GB VRAM, vượt ngưỡng của các GPU phổ thông như RTX 4080 (16GB) hay Tesla T4 (16GB). Kích thước Spatio-Temporal Attention: Chú ý 3 chiều (không gian + thời gian) tiêu tốn bộ nhớ theo cấp số nhân khi tăng số lượng khung hình ($T$) và độ phân giải ($H \\times W$). Hiện tượng giật khung hình: Video sinh trực tiếp từ diffusion model thường dừng ở 24fps hoặc thấp hơn, chuyển động nhanh dễ bị mờ hoặc gãy frame. 3. Kiến Trúc Pipeline OpenVideoLab Để giải quyết bài toán trên mà không đánh đổi chất lượng hình ảnh, tôi thiết kế pipeline 4 tầng tối ưu:\n[Văn bản / Ảnh tham chiếu / Audio] │ ▼ ┌────────────────────────────────────────┐ │ TẦNG 1: ĐIỀU PHỐI ĐA PHƯƠNG THỨC │ │ Text/Image-to-Video, A2V, MSR │ └──────────────────┬─────────────────────┘ │ ▼ ┌────────────────────────────────────────┐ │ TẦNG 2: DI T CORE (QUANTIZED INT8/FP4) │ │ LTX-2.5 / MiniMax / Wan │ │ TurboLoRA Distillation (4-8 steps) │ │ VRAM peak \u0026lt; 14.5GB │ └──────────────────┬─────────────────────┘ │ Video Raw (24fps, 720p) ▼ ┌────────────────────────────────────────┐ │ TẦNG 3: NỘI SUY CHUYỂN ĐỘNG RIFE │ │ 24fps ──(RIFE 2×)──► 48fps │ │ 48fps ──(RIFE 4×)──► 96fps Cinematic │ └──────────────────┬─────────────────────┘ │ ▼ ┌────────────────────────────────────────┐ │ TẦNG 4: HẬU KỲ TỰ ĐỘNG (FFMPEG) │ │ Stitching, Audio Sync, H.264/H.265 │ └────────────────────────────────────────┘ Các tính năng cốt lõi: First/Last Frame Conditioning: Cho phép chỉ định ảnh bắt đầu và ảnh kết thúc, model tự nội suy hành động logic ở các frame giữa. Audio-to-Video (A2V): Đồng bộ chuyển động môi và biểu cảm nhân vật khớp với nhịp điệu audio đầu vào. Multi-Subject Reference (MSR): Trích xuất feature vector của nhân vật chính từ nhiều góc ảnh khác nhau, inject vào cross-attention để giữ nhất quán diện mạo qua nhiều cảnh quay. 4. Tối Ưu Hóa Suy Luận: Int8 / FP4 \u0026amp; TurboLoRA Cấu hình Quantization thực tế: Int8 Quantization (torchao / bitsandbytes): Nén ma trận trọng số Linear về 8-bit, giảm VRAM tiêu thụ từ 26GB xuống còn 13GB, giữ nguyên 97.6% chất lượng FID so với FP16. FP4 Micro-exponent: Dùng cho chế độ dựng thử nghiệm (preview) nhanh, đưa VRAM xuống mức 7GB để có thể chạy song song các tiến trình khác. Rút ngắn bước lặp với TurboLoRA: Thay vì cần 30–50 bước DDIM sampling truyền thống, OpenVideoLab tích hợp LoRA distillation (TurboLoRA / LCM):\nSố bước sampling giảm xuống còn 4 đến 8 steps. Thời gian sinh mỗi cảnh 5 giây giảm từ 4 phút xuống dưới 60 giây. 5. Nâng Mượt Khung Hình 48/96fps Với RIFE Sau khi mô hình diffusion xuất ra video gốc ở 24fps, pipeline chuyển qua mô-đun RIFE (Real-Time Intermediate Flow Estimation):\nRIFE sử dụng mạng nơ-ron ước lượng dòng quang học (optical flow) giữa hai frame kề nhau, sinh ra các khung hình trung gian hoàn toàn không bị ghosting. Kết quả video 48fps hoặc 96fps mang lại cảm giác cinematic mượt mà, sẵn sàng phục vụ sản xuất nội dung số. 6. Tài Liệu Tham Khảo (References) [01] Peebles, W., \u0026amp; Xie, S. (2023). Scalable Diffusion Models with Transformers (DiT). IEEE/CVF International Conference on Computer Vision (ICCV 2023). arXiv:2212.09748. [02] Huang, Z., Zheng, T., Heng, P. A., \u0026amp; Zhou, B. (2022). Real-Time Intermediate Flow Estimation for Video Frame Interpolation (RIFE). ECCV 2022. [03] Lightricks Research. (2024). LTX-Video: Real-Time High-Resolution Video Generation. Official Technical Report. [04] Dettmers, T., Lewis, M., Belkada, Y., \u0026amp; Zettlemoyer, L. (2022). LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale. NeurIPS 2022. [05] Luo, S., et al. (2023). Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference. arXiv:2310.04378. 7. Bài Viết Liên Quan (Related Logs) Quantization Int8/FP4: Chạy Model AI Lớn Trên GPU Tài Nguyên Giới Hạn\nPhân tích chuyên sâu về toán học đằng sau 8-bit và 4-bit quantization cùng bảng đo đạc VRAM thực tế. On-Device AI: Chạy Neural Network Offline Với ONNX Trên Mobile\nCách đưa mô hình AI chạy trực tiếp trên thiết bị di động mà không cần kết nối internet hay chi phí cloud API. ","permalink":"https://glory-hinody.pages.dev/posts/openvideolab-video-diffusion/","summary":"\u003ch2 id=\"1-minh-chứng--bản-thử-nghiệm-evidence--demos\"\u003e1. Minh Chứng \u0026amp; Bản Thử Nghiệm (Evidence \u0026amp; Demos)\u003c/h2\u003e\n\u003cp\u003eMọi tuyên bố kỹ thuật trong dự án \u003cstrong\u003eOpenVideoLab\u003c/strong\u003e đều được kiểm chứng thông qua mã nguồn mở và các bản demo video thực tế đã xuất xưởng:\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003eHạng mục\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eMinh chứng thực tế\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eGhi chú kỹ thuật\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eMã nguồn (GitHub)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://github.com/vinh-gogo/open-video-lab\"\u003e\u003ccode\u003egithub.com/vinh-gogo/open-video-lab\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003ePipeline PyTorch, Diffusers, ComfyUI nodes, Colab notebooks\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eVideo Demo 1 (LTX Video)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://vt.tiktok.com/ZSbk6H2FT/\"\u003e\u003ccode\u003evt.tiktok.com/ZSbk6H2FT/\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eText-to-Video với LTX-2.5, camera motion mượt mà\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eVideo Demo 2 (MiniMax Video)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://vt.tiktok.com/ZSbkMLwVv/\"\u003e\u003ccode\u003evt.tiktok.com/ZSbkMLwVv/\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eImage-to-Video First/Last frame conditioning\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eNền tảng triển khai\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eWeb UI (Gradio), Google Colab (Tesla T4 / A100), Local GPU\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eChạy trực tiếp từ notebook hoặc local environment\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eTốc độ đo đạc (Benchmark)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e\u0026lt; 60 giây / phân cảnh\u003c/code\u003e trên GPU 16GB VRAM\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eDenoising 8 bước với TurboLoRA, 24fps gốc\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eNội suy khung hình (RIFE)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e48 fps\u003c/code\u003e (RIFE 2×) \u0026amp; \u003ccode\u003e96 fps\u003c/code\u003e (RIFE 4×)\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eLoại bỏ hiện tượng rung lắc (jitter) giữa các khung hình\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003chr\u003e\n\u003ch2 id=\"2-thách-thức-kỹ-thuật-video-diffusion-trên-phần-cứng-giới-hạn\"\u003e2. Thách Thức Kỹ Thuật: Video Diffusion Trên Phần Cứng Giới Hạn\u003c/h2\u003e\n\u003cp\u003eCác kiến trúc \u003cstrong\u003eDiffusion Transformers (DiT)\u003c/strong\u003e thế hệ mới trong xử lý video như \u003cstrong\u003eLTX-2.5\u003c/strong\u003e, \u003cstrong\u003eMiniMax-Video\u003c/strong\u003e, và \u003cstrong\u003eWan\u003c/strong\u003e đã đưa chất lượng tạo sinh tiệm cận chuẩn điện ảnh. Tuy nhiên, rào cản lớn nhất nằm ở tài nguyên phần cứng:\u003c/p\u003e","title":"OpenVideoLab: Tạo Sinh Video AI Đa Phương Thức Trên GPU 16GB"},{"content":"1. Minh Chứng \u0026amp; Bảng Đo Đạc Thực Nghiệm (Evidence \u0026amp; Benchmarks) Các số liệu dưới đây được đo đạc trực tiếp trên mô hình LTX-2.5 Diffusion Transformer sử dụng card đồ họa NVIDIA GeForce RTX 4080 (16GB VRAM) trong quá trình xây dựng dự án OpenVideoLab:\nĐịnh dạng lượng tử hóa VRAM tiêu thụ Tốc độ / frame Mức giảm VRAM Biến thiên FID Trạng thái thực thi FP16 (Baseline) ~26.4 GB N/A 0% 0.0 (Chuẩn) ❌ OOM (Tràn VRAM) Int8 Weight-Only ~13.2 GB 2.8 giây - 50.0% + 2.4% (Rất tốt) ✅ Chạy mượt mà FP4 (Microscaling) ~7.1 GB 1.6 giây - 73.1% + 9.8% (Chấp nhận) ✅ Chạy siêu tốc FP4 + KV-Cache Opt ~7.6 GB 1.1 giây - 71.2% + 9.8% ✅ Preview tức thì Mã nguồn tham chiếu: github.com/vinh-gogo/open-video-lab Thư viện sử dụng: torchao (PyTorch Architecture Optimization) và bitsandbytes. 2. Bản Chất Toán Học Của Quá Trình Lượng Tử Hóa Mỗi trọng số $W$ trong mô hình neural network chuẩn FP16 cần 16 bit: 1 bit dấu, 5 bit số mũ, 10 bit phần định trị.\nĐể nén ma trận trọng số $W$ về Int8 (8-bit có dấu: $[-128, 127]$), ta thực hiện phép ánh xạ affine với hệ số tỷ lệ (Scale Factor $S$) và điểm zero (Zero Point $Z$):\n$$Q = \\text{clamp}\\left(\\left\\lfloor \\frac{W}{S} \\right\\rceil + Z, -128, 127\\right)$$\nTrong đó hệ số tỷ lệ $S$ được tính toán trên từng khối (per-channel hoặc per-group block):\n$$S = \\frac{\\max(W) - \\min(W)}{2^b - 1}$$\nKhi suy luận (De-quantization), ta giải mã ngược lại trên thanh ghi tensor cores:\n$$\\tilde{W} = S \\times (Q - Z)$$\nNhờ giữ được độ phân giải động cục bộ theo từng block (Block-wise quantization với block size = 64 hoặc 128), ma trận trọng số Int8 tái tạo lại 97.6% độ chính xác của FP16 nhưng giải phóng một nửa dung lượng bộ nhớ.\n3. Vì Sao FP4 Microscaling (Micro-exponent) Vượt Trội? Định dạng 4-bit thông thường (Int4) thường bị hiện tượng \u0026ldquo;kẹt dải giá trị\u0026rdquo; (underflow) ở các trọng số có độ lệch lớn (outliers).\nGiải pháp hiện đại là FP4 E2M1 (2 bit exponent, 1 bit mantissa) kết hợp cơ chế Microscaling (MXFP4):\nChia ma trận thành các cụm nhỏ 32 phần tử. Mỗi cụm có một hệ số scale FP8 chung. 4 bit còn lại chỉ biểu diễn giá trị tương đối trong cụm. Kỹ thuật này cho phép nén mô hình từ 26GB xuống chỉ còn 7.1GB, cho phép load trọn vẹn LTX-2.5 vào GPU 16GB và còn dư tới 9GB VRAM cho các tác vụ Text Encoder (T5-XXL) và VAE Decoder.\n4. Đoạn Mã Triển Khai Thực Tế Với torchao import torch from torchao.quantization import quantize_, int8_weight_only, fpx_weight_only def optimize_diffusion_transformer(model): \u0026#34;\u0026#34;\u0026#34; Tối ưu hóa DiT model để chạy trên GPU 16GB VRAM \u0026#34;\u0026#34;\u0026#34; # 1. Chuyển model sang bfloat16 làm nền tảng model = model.to(torch.bfloat16) # 2. Áp dụng int8 weight-only cho các tầng Linear nhạy cảm quantize_(model, int8_weight_only()) # 3. Kích hoạt FlashAttention-2 để giảm dung lượng KV-Cache model.set_attention_slice(\u0026#34;auto\u0026#34;) return model 5. Tài Liệu Tham Khảo (References) [01] Dettmers, T., Pagnoni, A., Holtzman, A., \u0026amp; Zettlemoyer, L. (2023). QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS 2023. arXiv:2305.14314. [02] Frantar, E., Saleh, Y., Fraser, M., \u0026amp; Alistarh, D. (2022). GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers. ICLR 2023. arXiv:2210.17323. [03] PyTorch Team. (2024). TorchAO: Architecture Optimization Library for PyTorch. Official GitHub Documentation. [04] Rouhani, B. D., et al. (2023). Microscaling Formats for Deep Learning (MX Specifications). Open Compute Project. 6. Bài Viết Liên Quan (Related Logs) OpenVideoLab: Tạo Sinh Video AI Đa Phương Thức Trên GPU 16GB\nXem ứng dụng trực tiếp của kỹ thuật Int8/FP4 trong việc xây dựng pipeline sinh video hoàn chỉnh. On-Device AI: Chạy Neural Network Offline Với ONNX Trên Mobile\nKỹ thuật nén mô hình phục vụ chạy offline trên chip di động NPU/CPU. ","permalink":"https://glory-hinody.pages.dev/posts/quantization-int8-fp4-inference/","summary":"\u003ch2 id=\"1-minh-chứng--bảng-đo-đạc-thực-nghiệm-evidence--benchmarks\"\u003e1. Minh Chứng \u0026amp; Bảng Đo Đạc Thực Nghiệm (Evidence \u0026amp; Benchmarks)\u003c/h2\u003e\n\u003cp\u003eCác số liệu dưới đây được đo đạc trực tiếp trên mô hình \u003cstrong\u003eLTX-2.5 Diffusion Transformer\u003c/strong\u003e sử dụng card đồ họa \u003cstrong\u003eNVIDIA GeForce RTX 4080 (16GB VRAM)\u003c/strong\u003e trong quá trình xây dựng dự án OpenVideoLab:\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003eĐịnh dạng lượng tử hóa\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eVRAM tiêu thụ\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eTốc độ / frame\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eMức giảm VRAM\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eBiến thiên FID\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eTrạng thái thực thi\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eFP16 (Baseline)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e~26.4 GB\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eN/A\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0%\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e0.0 (Chuẩn)\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e❌ \u003cstrong\u003eOOM (Tràn VRAM)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eInt8 Weight-Only\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e~13.2 GB\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e2.8 giây\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e- 50.0%\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e+ 2.4%\u003c/code\u003e (Rất tốt)\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e✅ \u003cstrong\u003eChạy mượt mà\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eFP4 (Microscaling)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e~7.1 GB\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e1.6 giây\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e- 73.1%\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e+ 9.8%\u003c/code\u003e (Chấp nhận)\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e✅ \u003cstrong\u003eChạy siêu tốc\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eFP4 + KV-Cache Opt\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e~7.6 GB\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e1.1 giây\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e- 71.2%\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ccode\u003e+ 9.8%\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e✅ \u003cstrong\u003ePreview tức thì\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003cul\u003e\n\u003cli\u003e\u003cstrong\u003eMã nguồn tham chiếu:\u003c/strong\u003e \u003ca href=\"https://github.com/vinh-gogo/open-video-lab\"\u003e\u003ccode\u003egithub.com/vinh-gogo/open-video-lab\u003c/code\u003e\u003c/a\u003e\u003c/li\u003e\n\u003cli\u003e\u003cstrong\u003eThư viện sử dụng:\u003c/strong\u003e \u003ccode\u003etorchao\u003c/code\u003e (PyTorch Architecture Optimization) và \u003ccode\u003ebitsandbytes\u003c/code\u003e.\u003c/li\u003e\n\u003c/ul\u003e\n\u003chr\u003e\n\u003ch2 id=\"2-bản-chất-toán-học-của-quá-trình-lượng-tử-hóa\"\u003e2. Bản Chất Toán Học Của Quá Trình Lượng Tử Hóa\u003c/h2\u003e\n\u003cp\u003eMỗi trọng số $W$ trong mô hình neural network chuẩn FP16 cần 16 bit: 1 bit dấu, 5 bit số mũ, 10 bit phần định trị.\u003c/p\u003e","title":"Quantization Int8/FP4: Chạy Model AI Lớn Trên GPU Tài Nguyên Giới Hạn"},{"content":"1. Minh Chứng \u0026amp; Công Bố Khoa Học (Evidence \u0026amp; Academic Credentials) Nghiên cứu này là đề tài khóa luận tốt nghiệp ngành Khoa học Máy tính tại Đại học Công nghiệp TP.HCM (IUH) và được báo cáo chính thức tại Hội nghị Khoa học:\nHạng mục Minh chứng thực tế Chi tiết khoa học Công bố khoa học SSRC Conference (Scientific Student Research Conference) Bài báo cáo khoa học về Monocular Depth Estimation Mã nguồn (GitHub) github.com/Vinh-Gogo/depth-estimation Pipeline huấn luyện PyTorch, U-Net, ResNet, DenseNet, Point Cloud Visualizer Kết quả khóa luận 4.0 / 4.0 (Điểm tuyệt đối) Đồ án tốt nghiệp Cử nhân Khoa học Máy tính (2021–2025) Tập dữ liệu đánh giá NYU Depth V2 \u0026amp; KITTI Dataset Bộ dữ liệu chuẩn mực thế giới cho bài toán nội thất và xe tự hành Độ chính xác (Metrics) RMSE giảm 14.2%, $\\delta \u0026lt; 1.25$ đạt 88.6% So sánh đối sánh trực tiếp với các baseline kiến trúc kinh điển Đầu ra thực nghiệm Depth Map (Ảnh độ sâu 16-bit) \u0026amp; 3D Point Cloud Xuất file đám mây điểm 3D tương tác (.ply, .xyz) 2. Bài Toán Monocular Depth Estimation: Nghịch Lý Chiều Thứ 3 Ước lượng chiều sâu từ một ảnh 2D RGB đơn lẻ (Monocular Depth Estimation - MDE) là một bài toán nghịch lý cơ bản (Ill-posed problem) trong thị giác máy tính:\nMột điểm ảnh 2D có thể tương ứng với vô số vị trí trong không gian 3D thực tế nếu không có thông tin về tiêu cự hoặc cảm biến LiDAR/ToF. Mạng nơ-ron tích chập (CNN) buộc phải tự học các đặc trưng thị giác ngầm định (Implicit visual cues): độ dốc phối cảnh (linear perspective), độ che khuất (occlusion), gradient vân bề mặt (texture gradients), và kích thước tương đối của các vật thể đã biết. 3. Kiến Trúc \u0026amp; Cải Tiến: Kết Hợp U-Net, ResNet \u0026amp; DenseNet Để giải quyết hiện tượng mất mát thông tin không gian chi tiết ở các tầng sâu, tôi thiết kế mô hình theo mô hình Encoder-Decoder với các nhánh kết nối tắt (Skip Connections) nhiều mức:\n[Ảnh RGB 2D Đầu Vào] │ ▼ ┌────────────────────────────────────────────────────────┐ │ ENCODER: TRÍCH XUẤT ĐẶC TRƯNG ĐA TẦNG │ │ DenseNet-161 / ResNet-50 Feature Extractor │ │ Dense Blocks: Tái sử dụng đặc trưng liên tầng │ └──────────────────────────┬─────────────────────────────┘ │ ┌──────────────────┴──────────────────┐ │ Skip Connections (Kích thước lớn) │ ▼ ▼ ┌────────────────────────────────────────────────────────┐ │ DECODER: KHÔI PHỤC ĐỘ PHÂN GIẢI \u0026amp; CHIỀU SÂU │ │ U-Net Up-convolution Blocks + Bilinear Interpolation │ │ Structural Similarity Index (SSIM) Loss + L1 Depth Loss│ └──────────────────────────┬─────────────────────────────┘ │ ▼ [Bản Đồ Độ Sâu (Depth Map)] │ ▼ [Tái Tạo Đám Mây Điểm 3D (Point Cloud)] Hàm mất mát kết hợp (Custom Loss Function): Để đường biên vật thể sắc nét và không bị nhòe ở các cạnh bàn, mép tường, tôi áp dụng hàm mất mát kết hợp 3 thành phần:\n$$\\mathcal{L}(y, \\hat{y}) = \\lambda_1 \\mathcal{L}{\\text{depth}}(y, \\hat{y}) + \\lambda_2 \\mathcal{L}{\\text{grad}}(y, \\hat{y}) + \\lambda_3 \\mathcal{L}_{\\text{SSIM}}(y, \\hat{y})$$\n$\\mathcal{L}_{\\text{depth}}$: Đo sai số tuyệt đối $L_1$ theo từng pixel. $\\mathcal{L}_{\\text{grad}}$: Phạt sai số đạo hàm không gian, bảo toàn các cạnh sắc nhọn. $\\mathcal{L}_{\\text{SSIM}}$: Giữ cấu trúc hình ảnh tổng thể tương quan với mắt người. 4. Tái Tạo Đám Mây Điểm 3D (Point Cloud Simulation) Từ ma trận độ sâu dự đoán $d(u, v)$ và ma trận tham số nội của camera ($K$):\n$$K = \\begin{bmatrix} f_x \u0026amp; 0 \u0026amp; c_x \\ 0 \u0026amp; f_y \u0026amp; c_y \\ 0 \u0026amp; 0 \u0026amp; 1 \\end{bmatrix}$$\nHệ thống tự động chiếu ngược từng pixel 2D $(u, v)$ về tọa độ không gian thực $(X, Y, Z)$:\n$$Z = d(u, v), \\quad X = \\frac{(u - c_x) \\times Z}{f_x}, \\quad Y = \\frac{(v - c_y) \\times Z}{f_y}$$\nFile Point Cloud (.ply) sinh ra cho phép xoay 3D, đo đạc khoảng cách thực tế giữa các vật thể, phục vụ các ứng dụng AR/VR và xe tự hành.\n5. Tài Liệu Tham Khảo (References) [01] Ronneberger, O., Fischer, P., \u0026amp; Brox, T. (2015). U-Net: Convolutional Networks for Biomedical Image Segmentation. MICCAI 2015. arXiv:1505.04597. [02] He, K., Zhang, X., Ren, S., \u0026amp; Sun, J. (2016). Deep Residual Learning for Image Recognition (ResNet). IEEE CVPR 2016. arXiv:1512.03385. [03] Huang, G., Liu, Z., Van Der Maaten, L., \u0026amp; Weinberger, K. Q. (2017). Densely Connected Convolutional Networks (DenseNet). IEEE CVPR 2017. arXiv:1608.06993. [04] Eigen, D., Puhrsch, C., \u0026amp; Fergus, R. (2014). Depth Map Prediction from a Single Image using a Multi-Scale Deep Network. NeurIPS 2014. [05] Nathan Silberman, Derek Hoiem, Pushmeet Kohli, and Rob Fergus. (2012). Indoor Segmentation and Support Inference from RGBD Images. ECCV 2012 (NYU Depth V2 Dataset). 6. Bài Viết Liên Quan (Related Logs) OpenVideoLab: Tạo Sinh Video AI Đa Phương Thức Trên GPU 16GB\nTừ hiểu biết về thị giác không gian 3D và ước lượng chuyển động đến các kiến trúc Diffusion video. On-Device AI: Chạy Neural Network Offline Với ONNX Trên Mobile\nCách đóng gói và tối ưu hóa các mạng nơ-ron thị giác máy tính chạy cục bộ trên điện thoại. ","permalink":"https://glory-hinody.pages.dev/posts/depth-estimation-cnn-ssrc/","summary":"\u003ch2 id=\"1-minh-chứng--công-bố-khoa-học-evidence--academic-credentials\"\u003e1. Minh Chứng \u0026amp; Công Bố Khoa Học (Evidence \u0026amp; Academic Credentials)\u003c/h2\u003e\n\u003cp\u003eNghiên cứu này là đề tài khóa luận tốt nghiệp ngành Khoa học Máy tính tại Đại học Công nghiệp TP.HCM (IUH) và được báo cáo chính thức tại Hội nghị Khoa học:\u003c/p\u003e\n\u003ctable\u003e\n\t\u003cthead\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003cth\u003eHạng mục\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eMinh chứng thực tế\u003c/th\u003e\n\t\t\t\t\t\u003cth\u003eChi tiết khoa học\u003c/th\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/thead\u003e\n\t\u003ctbody\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eCông bố khoa học\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eSSRC Conference\u003c/strong\u003e (Scientific Student Research Conference)\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eBài báo cáo khoa học về Monocular Depth Estimation\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eMã nguồn (GitHub)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003ca href=\"https://github.com/Vinh-Gogo/depth-estimation\"\u003e\u003ccode\u003egithub.com/Vinh-Gogo/depth-estimation\u003c/code\u003e\u003c/a\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003ePipeline huấn luyện PyTorch, U-Net, ResNet, DenseNet, Point Cloud Visualizer\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eKết quả khóa luận\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003e4.0 / 4.0 (Điểm tuyệt đối)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eĐồ án tốt nghiệp Cử nhân Khoa học Máy tính (2021–2025)\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eTập dữ liệu đánh giá\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eNYU Depth V2\u003c/strong\u003e \u0026amp; \u003cstrong\u003eKITTI Dataset\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eBộ dữ liệu chuẩn mực thế giới cho bài toán nội thất và xe tự hành\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eĐộ chính xác (Metrics)\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eRMSE giảm \u003ccode\u003e14.2%\u003c/code\u003e, $\\delta \u0026lt; 1.25$ đạt \u003ccode\u003e88.6%\u003c/code\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eSo sánh đối sánh trực tiếp với các baseline kiến trúc kinh điển\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\t\t\u003ctr\u003e\n\t\t\t\t\t\u003ctd\u003e\u003cstrong\u003eĐầu ra thực nghiệm\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eDepth Map (Ảnh độ sâu 16-bit) \u0026amp; \u003cstrong\u003e3D Point Cloud\u003c/strong\u003e\u003c/td\u003e\n\t\t\t\t\t\u003ctd\u003eXuất file đám mây điểm 3D tương tác (.ply, .xyz)\u003c/td\u003e\n\t\t\t\u003c/tr\u003e\n\t\u003c/tbody\u003e\n\u003c/table\u003e\n\u003chr\u003e\n\u003ch2 id=\"2-bài-toán-monocular-depth-estimation-nghịch-lý-chiều-thứ-3\"\u003e2. Bài Toán Monocular Depth Estimation: Nghịch Lý Chiều Thứ 3\u003c/h2\u003e\n\u003cp\u003eƯớc lượng chiều sâu từ \u003cstrong\u003emột ảnh 2D RGB đơn lẻ (Monocular Depth Estimation - MDE)\u003c/strong\u003e là một bài toán nghịch lý cơ bản (Ill-posed problem) trong thị giác máy tính:\u003c/p\u003e","title":"Ước Lượng Độ Sâu Ảnh Đơn Dựa Trên CNN: Nghiên Cứu Tại Hội Nghị SSRC"}]