Tín Hiệu · bài nền

Nền tảng AI: hiểu bản chất để không bị ngợp

Bài nền đọc một lần, khoảng 25 phút. Viết cho người từng học AI mà giờ quên phần lớn, hoặc chưa học bao giờ, và cần hiểu bản chất để ra quyết định chứ không phải để làm kỹ sư.

Viết 24/09/2026cập nhật cùng số Tin AI hằng tháng
← Mọi bản tin Tín Hiệu

Chín phần:

  1. AI là gì — 4 vòng tròn lồng nhau
  2. Dòng thời gian cách mạng AI (8 mốc phải nhớ)
  3. LLM hoạt động thế nào — giải thích bằng đời thường
  4. Từ chatbot đến agent — cái gì đang xảy ra 2025–2026
  5. Ảnh, video, giọng nói: một họ khác, không phải LLM
  6. Ba cách "dạy" AI việc của mình: Prompt/RAG · Fine-tune · Memory
  7. Model đóng vs model mở, chạy trên mây vs chạy trên Mac
  8. Bảy nguyên tắc để ra quyết định (phần quan trọng nhất)
  9. Từ điển 35 thuật ngữ hay gặp

1. AI là gì — 4 vòng tròn lồng nhau

2. Dòng thời gian cách mạng AI — 8 mốc phải nhớ

MốcNămChuyện gìVì sao quan trọng
1 · AI luật cứng1956–1990sNgười viết từng luật "nếu… thì…". Hệ chuyên gia.Thất bại vì thế giới quá nhiều ngoại lệ → "mùa đông AI".
2 · Machine learning thống kê1990s–2000sMáy học từ dữ liệu: lọc spam, gợi ý sản phẩm Amazon, xếp hạng Google.Bài học: dữ liệu quan trọng hơn luật. Đây là AI đã chạy ngầm trong ads/recommendation suốt 20 năm.
3 · Deep learning bùng nổ2012 (AlexNet)Mạng nơ-ron nhiều tầng + GPU thắng áp đảo cuộc thi nhận diện ảnh.Mở ra kỷ nguyên NVIDIA. Từ đây "càng nhiều dữ liệu + càng nhiều GPU = càng giỏi".
4 · Transformer2017 (Google, bài "Attention Is All You Need")Kiến trúc mới cho phép model "chú ý" tới mọi từ trong câu cùng lúc, huấn luyện song song cực nhanh.Chữ T trong GPT. Mọi LLM hiện nay đều là Transformer.
5 · Tiền huấn luyện quy mô lớn2018–2020 (GPT-1/2/3, BERT)Cho model đọc gần hết internet để đoán từ tiếp theo. GPT-3 có 175 tỷ tham số.Phát hiện "scaling law": cứ tăng dữ liệu + tham số + GPU là khả năng tăng đều, không cần thiết kế lại.
6 · ChatGPT30/11/2022OpenAI thêm lớp "dạy làm trợ lý" (RLHF) lên GPT-3.5 và cho dùng miễn phí. 100 triệu người dùng sau 2 tháng.Thời điểm AI ra khỏi phòng lab. 2023 là năm chạy đua: GPT-4 (3/2023), Claude, Llama mở (Meta), Midjourney v5, Gemini.
7 · Model biết "nghĩ" + đa phương thức2024OpenAI o1 (9/2024) suy luận từng bước trước khi trả lời; Claude 3.5 Sonnet điều khiển máy tính (10/2024); model nhìn ảnh, nghe giọng thành chuẩn.Từ "đoán nhanh" sang "nghĩ chậm rồi trả lời" → giải được toán, code, lập kế hoạch nhiều bước.
8 · Năm của agent + giá rẻ2025DeepSeek R1 (1/2025) gây sốc: ngang hàng top với chi phí thấp hơn nhiều, mở trọng số. MCP (Anthropic, 11/2024) thành chuẩn nối AI với công cụ. Claude Code, Codex, Gemini CLI ra đời. Veo 3 sinh video có tiếng. GPT-5 (8/2025).AI thôi là "hộp chat" mà thành người làm việc: tự mở web, sửa file, chạy lệnh, gọi API. Đây là thứ người làm marketing dùng được ngay hôm nay.
9 · 2026: tầng "trên Opus" + agent tự hành + giá rơi2026Anthropic ra lớp Mythos/Fable trên Opus (Fable 5 tháng 6, Fable 5.1 tháng 9); OpenAI GPT-5.5 → 5.6 → GPT-6 Astra (9/2026); Google Gemini 3.x Flash làm "ngựa thồ" $0,75; model mở Trung Quốc (Kimi K3 2,8T, Qwen3.8, DeepSeek V4) dẫn phong trào mở; Sora đóng cửa; Claude Code có auto mode, Channels, Remote Control; luật AI Việt Nam có hiệu lực 01/03.Ba chuyện cùng lúc: model đỉnh đắt gấp đôi, model thường rẻ gần bằng 0, và AI bắt đầu bị luật quản (nhãn nội dung AI). Chi tiết trong số Tin AI tháng 09/2026.

Cách nhớ 5 giây: Luật cứng → Học từ dữ liệu → Mạng sâu + GPU → Transformer → Đọc cả internet → ChatGPT → Biết nghĩ → Biết làm việc (agent).

3. LLM hoạt động thế nào — giải thích bằng đời thường

3.1 Bản chất: máy đoán từ tiếp theo, đoán cực giỏi

3.2 Token — đơn vị tính tiền và tính trí nhớ

3.3 Context window — bộ nhớ làm việc, không phải bộ nhớ dài hạn

3.4 Tham số, huấn luyện, hậu huấn luyện

3.5 "Nghĩ trước khi nói" — reasoning / thinking / extended thinking

3.6 Nhiệt độ và tính ngẫu nhiên

4. Từ chatbot đến agent — cái gì đang xảy ra 2025–2026

Chatbot (2022–2023)Trợ lý có công cụ (2024)Agent (2025–2026)
Hỏi → ĐápHỏi → gọi 1 công cụ → ĐápGiao mục tiêu → tự lặp: nghĩ → làm → xem kết quả → làm tiếp → báo cáo
"Viết giúp caption""Tìm web rồi viết caption""Quét 5 kênh đối thủ, dựng bảng, ghi vào Sheet, báo Telegram lúc 8h"

5. Ảnh, video, giọng nói: một họ khác, không phải LLM

6. Ba cách "dạy" AI việc của mình

CáchLàm gìKhi nào dùngChi phíVí dụ
Prompt + RAG (nạp ngữ cảnh / truy xuất tài liệu)Đưa tài liệu đúng lúc vào context: CLAUDE.md, DNA doanh nghiệp, skill, tìm trong kho bằng FTS/vector rồi dán vào95% việc doanh nghiệpRẻ, đổi được ngayFile DNA thương hiệu, kho skill, công cụ tìm toàn văn trong kho tài liệu
Fine-tune (tinh chỉnh)Huấn luyện thêm model trên dữ liệu riêng để đổi giọng/định dạngKhi cần một kiểu đầu ra rất cố định, khối lượng cực lớn, hoặc model nhỏ chạy rẻTốn công, phải làm lại khi model mới raHầu hết doanh nghiệp nhỏ chưa cần
Memory (trí nhớ dài hạn)Model tự ghi lại điều đã học về người dùng, nạp lại phiên sauTrợ lý cá nhân dùng lâu dàiRẻ nhưng phải dọn rác định kỳMemory của Claude Code, ChatGPT

Nguyên tắc: dữ liệu riêng + quy trình riêng nằm ngoài model (file, Sheet, skill). Model đổi thì vẫn giữ được. Đừng để tri thức nằm trong một hội thoại.

7. Model đóng vs mở, chạy mây vs chạy Mac

8. Bảy nguyên tắc để ra quyết định — phần quan trọng nhất

  1. Model nào cũng đang đoán. Số liệu, luật, tên người, link: bắt trích nguồn hoặc tự kiểm. Ảo giác giảm nhưng không mất.
  2. Context là bộ nhớ làm việc, file là bộ nhớ dài hạn. Đầu tư vào file hướng dẫn nền, DNA thương hiệu, skill, sổ nhật ký — đó là tài sản, model chỉ là công nhân thuê tháng.
  3. Giá giảm ~10 lần mỗi 12–18 tháng cho cùng mức thông minh. Việc "đắt quá" năm nay sẽ rẻ năm sau → thiết kế quy trình trước, chờ giá.
  4. Agent ≠ chatbot. Lợi ích thật đến khi AI làm (đăng bài, quét số, ghi Sheet, báo cáo) chứ không chỉ viết. Đa số thị trường Việt Nam chưa tới giai đoạn này.
  5. Lợi thế cạnh tranh không nằm ở model (ai cũng mua được) mà ở dữ liệu riêng + quy trình riêng + tốc độ áp dụng. Đây là thứ đối thủ không copy được.
  6. Đừng khoá cứng vào một hãng. MCP, skill, file markdown là chuẩn mở; giữ mọi thứ ở dạng model nào đọc cũng được.
  7. Chọn model theo cỡ việc: nhỏ-rẻ cho việc lặp (phân loại, tóm tắt), lớn cho việc khó (chiến lược, dựng hệ thống). Đừng dùng Opus để viết 1 caption, đừng dùng Haiku để thiết kế phễu.

9. Từ điển 35 thuật ngữ

Thuật ngữNghĩa ngắn
LLMModel ngôn ngữ lớn, sinh chữ bằng cách đoán token tiếp theo
TokenMảnh chữ, đơn vị tính tiền & bộ nhớ; tiếng Việt tốn 1,5–2× tiếng Anh
Context windowLượng token model nhìn được trong một lần trả lời
ParametersSố nút vặn trong model; nhiều = giỏi hơn nhưng đắt hơn
PretrainingĐọc internet để học đoán chữ
Post-training / RLHFDạy model làm trợ lý, quyết định tính cách
Knowledge cutoffMốc kiến thức cuối của dữ liệu huấn luyện
HallucinationẢo giác: bịa nội dung với giọng tự tin
Reasoning / ThinkingModel viết nháp suy nghĩ trước khi trả lời
MultimodalHiểu/sinh nhiều dạng: chữ, ảnh, âm thanh, video
DiffusionKỹ thuật sinh ảnh/video bằng khử nhiễu
TransformerKiến trúc mạng nơ-ron nền của mọi LLM (2017)
AttentionCơ chế để model "chú ý" tới các phần liên quan trong đầu vào
Scaling lawTăng dữ liệu + tham số + GPU → khả năng tăng đều
PromptCâu lệnh/đầu vào cho model
System promptHướng dẫn nền cố định (CLAUDE.md là một dạng)
Few-shotCho vài ví dụ trong prompt để model bắt chước
RAGTruy xuất tài liệu liên quan rồi nạp vào context
Embedding / VectorBiến chữ thành dãy số để so "gần nghĩa" (dùng cho tìm kiếm ngữ nghĩa)
Fine-tuningHuấn luyện thêm trên dữ liệu riêng
AgentLLM + công cụ + vòng lặp tự làm việc nhiều bước
Tool use / Function callingModel gọi công cụ bên ngoài (API, lệnh, file)
MCPChuẩn mở nối AI với công cụ/dữ liệu (USB-C của AI)
SkillGói hướng dẫn cách làm một việc cho agent
Sub-agentAgent con được agent mẹ giao việc, chạy song song
Computer useAI nhìn màn hình và bấm chuột, gõ phím
Open-weightModel tải về chạy được trên máy mình
InferenceLúc model chạy để trả lời (khác lúc huấn luyện)
LatencyĐộ trễ trả lời
TemperatureMức ngẫu nhiên khi chọn từ
GuardrailHàng rào an toàn/chính sách chặn đầu ra xấu
BenchmarkBài thi chuẩn để so model (SWE-bench về code, GPQA về khoa học, ARC-AGI về suy luận, LMArena do người chấm)
TTS / STTChữ→giọng / Giọng→chữ
Watermark (SynthID, C2PA)Dấu ẩn đánh dấu nội dung AI
GEOGenerative Engine Optimization: tối ưu để xuất hiện trong câu trả lời AI (thay cho SEO cổ điển)

Muốn nhận bản tổng kết tuần qua email, kèm kho tài liệu miễn phí? Mình gửi cho người trong danh sách sớm trước.

Vào danh sách sớm →