C
ClaudeDuc · คู่มือ Claude ภาษาไทย
THEORY · LLM WIKI
รู้ทันการทำงานของ
LLM
มินิวิกิ 10 คำศัพท์พื้นฐานที่คนใช้ AI ทุกคนควรเข้าใจ — จาก Token ถึง RAG อ่านจบแล้วเข้าใจว่าทำไม AI ตอบแบบนั้น และจะใช้งานมันให้ฉลาดขึ้นได้อย่างไร
สารบัญ
10 คำศัพท์ที่ต้องรู้จัก (Table of Contents)
- 1. LLM คืออะไร — และ Transformer
- 2. Token — หน่วยที่ AI ใช้อ่าน/คิด
- 3. Context Window — ความจำระยะสั้น
- 4. Parameters — ขนาดของโมเดล
- 5. Training vs Inference — ฝึกกับใช้งาน
- 6. Temperature — ตัวคุมความสร้างสรรค์
- 7. Hallucination — ทำไม AI มั่วได้มั่นใจ
- 8. Embeddings — แปลความหมายเป็นตัวเลข
- 9. RAG — ให้ AI อ้างอิงข้อมูลจริง
- 10. Fine-tuning vs Prompting vs RAG — เลือกใช้ยังไง
01
บทที่ 1 · คำนิยาม
LLM คืออะไร (Large Language Model)
LLM = เครื่องทำนายคำถัดไปที่ฉลาดมาก
- LLM (Large Language Model) คือโครงข่ายประสาทเทียม (neural network) ที่ถูกฝึกด้วยข้อความมหาศาลจากอินเทอร์เน็ต หนังสือ และเอกสารต่าง ๆ
- งานหลักที่มันเรียนรู้คือ ทำนายคำ (token) ถัดไป ที่น่าจะตามมา ทีละคำ ต่อเนื่องกันจนกลายเป็นคำตอบทั้งย่อหน้า
- สถาปัตยกรรมเบื้องหลังโมเดลส่วนใหญ่ในปัจจุบัน (Claude, GPT, Gemini) เรียกว่า Transformer ซึ่งมีกลไกสำคัญชื่อ Attention
- Attention ทำให้โมเดล "มองย้อนไปทั้งประโยค" แล้วตัดสินใจว่าคำไหนควรให้น้ำหนัก/ความสำคัญมากกว่ากันตอนสร้างคำตอบ — คล้ายเวลาคนอ่านประโยคยาว ๆ แล้วรู้ว่าคำไหนเชื่อมกับคำไหน
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
เข้าใจ Transformer แล้วได้อะไร
🧠 อธิบายพฤติกรรม AI ได้
เพราะ AI "ทำนายคำถัดไป" ไม่ใช่ "ค้นหาความจริง" มันจึงตอบลื่นไหลเป็นธรรมชาติ แต่ก็อาจมั่นใจผิด ๆ ได้ (ดู Hallucination บทที่ 7)
🔗 Attention = ทำไมมันเข้าใจบริบท
Attention ช่วยให้ AI เชื่อมโยงคำต้นประโยคกับท้ายประโยคได้ แม้ห่างกันมาก จึงเข้าใจการอ้างอิง เช่น "มัน" หมายถึงอะไรในประโยคก่อนหน้า
02
บทที่ 2 · คำนิยาม
Token (หน่วยของข้อความ)
Token คือชิ้นส่วนย่อยของข้อความที่ AI ใช้อ่านและคิด
- โมเดลไม่ได้อ่านข้อความเป็น "ตัวอักษร" หรือ "คำ" ตรง ๆ แต่จะตัดข้อความออกเป็น token — อาจเป็นคำเต็ม ส่วนของคำ หรือแม้แต่เครื่องหมายวรรคตอน
- ตัวอย่างภาษาอังกฤษ: คำว่า
tokenization อาจถูกตัดเป็น token + ization ส่วนคำสั้น ๆ อย่าง the มักเป็น 1 token
- ภาษาไทยมักถูกตัดเป็น token ที่ไม่ตรงกับคำ ๆ หนึ่งเป๊ะ ทำให้บางครั้งข้อความไทยใช้ token มากกว่าที่คิด
- ทุกคำถามที่เราพิมพ์ + คำตอบที่ AI สร้าง = ถูกนับเป็น token ทั้งหมด
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
Token กำหนด "ค่าใช้จ่าย" และ "ขนาด"
💰 ต้นทุนการใช้งาน
ราคา API และโควตาการใช้งานส่วนใหญ่คิดตามจำนวน token ทั้งขาเข้า (prompt) และขาออก (คำตอบ) — พิมพ์ยาวหรือให้ AI ตอบยาว ก็ใช้ token มากขึ้น
📏 ขีดจำกัดของบทสนทนา
จำนวน token ทั้งหมดที่โมเดลรับได้ในครั้งเดียว (prompt + คำตอบ) ถูกจำกัดด้วย context window — ไปดูบทถัดไป
03
บทที่ 3 · คำนิยาม
Context Window (ขนาดหน้าต่างบริบท)
พื้นที่ทั้งหมดที่ AI "มองเห็น" ได้ในครั้งเดียว
- Context window คือจำนวน token สูงสุดที่โมเดลรับเข้าไปประมวลผลได้ในคำขอเดียว รวมทั้งข้อความที่เราป้อนเข้าไปและคำตอบที่มันสร้างออกมา
- โมเดลรุ่นใหม่ในปี 2026 รองรับ context window ที่ใหญ่ขึ้นมาก บางรุ่นรับข้อความได้เป็นแสนถึงล้าน token ต่อครั้ง (ตัวเลขจริงต่างกันไปตามรุ่น ควรเช็คสเปกล่าสุดของแต่ละโมเดล)
- เมื่อบทสนทนายาวเกิน context window เนื้อหาส่วนต้น ๆ จะถูก "ตัดทิ้ง" หรือสรุปย่อ AI จะไม่เห็นมันอีกต่อไป
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
Context ยาว ≠ จำแม่นทุกจุด
- งานวิจัยพบปรากฏการณ์ "lost in the middle" — โมเดลมักจำและใช้ข้อมูล ช่วงต้นกับช่วงท้าย ของ context ได้แม่นกว่าข้อมูลที่อยู่ ตรงกลาง แม้ context window จะใหญ่ขึ้นเรื่อย ๆ ปรากฏการณ์นี้ก็ยังพบอยู่ในโมเดลปี 2026 เพียงแต่ลดความรุนแรงลงในบางรุ่น
- ใช้ในทางปฏิบัติ: วางข้อมูลสำคัญที่สุดไว้ต้นหรือท้ายข้อความ อย่าฝังไว้กลางเอกสารยาว ๆ แล้วหวังว่า AI จะดึงมาใช้ได้แม่นเท่ากัน
- ถ้างานต้องอ้างอิงเอกสารจำนวนมาก ให้พิจารณาใช้ RAG (บทที่ 9) แทนการยัดทุกอย่างใส่ context เดียว
04
บทที่ 4 · คำนิยาม
Parameters (ขนาดโมเดล)
Parameters คือ "ตัวหมุน" ที่โมเดลปรับระหว่างฝึก
- Parameter คือค่าตัวเลขภายในโครงข่ายประสาทเทียมที่ถูกปรับแต่งระหว่างการฝึก (training) เพื่อให้โมเดลทำนายคำถัดไปได้แม่นขึ้นเรื่อย ๆ
- จำนวน parameter มักถูกใช้เป็นตัวเลขคร่าว ๆ บอก "ขนาด" ของโมเดล ยิ่งมาก โมเดลก็ยิ่งมีความจุในการเก็บรูปแบบภาษาและความรู้ได้มากขึ้น
- ผู้พัฒนาโมเดลชั้นนำส่วนใหญ่ (รวมถึง Anthropic) ไม่เปิดเผยจำนวน parameter ที่แน่นอนของโมเดลปัจจุบัน จึงไม่ควรเชื่อตัวเลขที่ไม่มีแหล่งอ้างอิงทางการ
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
ใหญ่กว่า ≠ ดีกว่าเสมอไป
⚖️ Tradeoff ประสิทธิภาพ vs ขนาด
โมเดลใหญ่มักเก่งงานซับซ้อนกว้าง ๆ แต่ใช้ทรัพยากรและเวลาตอบมากกว่า โมเดลเล็กที่ผ่านการ fine-tune เฉพาะทางสามารถทำงานเฉพาะด้านได้ดีพอ ๆ กันหรือดีกว่า ด้วยต้นทุนที่ต่ำกว่ามาก
🎯 เลือกโมเดลให้เหมาะกับงาน
งานง่าย เช่น สรุปข้อความสั้น ๆ ใช้โมเดลเล็ก/เร็วก็พอ ส่วนงานที่ต้องให้เหตุผลซับซ้อนหลายขั้น ค่อยเลือกโมเดลใหญ่กว่า — ประหยัดทั้งเวลาและค่าใช้จ่าย
05
บทที่ 5 · คำนิยาม
Training vs Inference (ฝึก vs ใช้งาน)
3 ขั้นตอนสร้างผู้ช่วย AI ก่อนถึงมือผู้ใช้
Pre-trainingโมเดลเรียนรู้จากข้อความปริมาณมหาศาล ฝึกทำนายคำถัดไปซ้ำ ๆ จนได้ "โมเดลฐาน" ที่เข้าใจภาษาและมีความรู้กว้าง ๆ
Fine-tuning (Supervised Fine-Tuning)ให้โมเดลดูตัวอย่างคำตอบที่ดี แล้วเลียนแบบพฤติกรรมการตอบแบบผู้ช่วย ไม่ใช่แค่ทำนายคำต่อคำแบบสุ่ม
RLHF / Alignmentใช้ feedback จากมนุษย์ (จัดอันดับคำตอบไหนดีกว่ากัน) มาปรับโมเดลต่อ ให้ตอบอย่างมีประโยชน์ ซื่อสัตย์ และปลอดภัยมากขึ้น
Inferenceคือ "ตอนใช้งานจริง" — เราพิมพ์คำถาม โมเดลที่ฝึกเสร็จแล้วนำ parameter ที่ปรับไว้มาทำนายคำตอบ ไม่มีการเรียนรู้เพิ่มเติมระหว่างนี้
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
ทำไมต้องแยกสองขั้นตอนนี้ให้ออก
- Training เกิดขึ้นครั้งเดียว (หรือเป็นรอบ ๆ) โดยผู้พัฒนาโมเดล ใช้เวลาและทรัพยากรมหาศาล ผู้ใช้ทั่วไปไม่ได้มีส่วนในขั้นนี้
- Inference คือทุกครั้งที่เราส่งข้อความไปหา AI — โมเดล "ไม่เรียนรู้" จากบทสนทนาของเราแบบถาวร (เว้นแต่ผู้ให้บริการเปิดให้ใช้ข้อมูลไปฝึกต่อ)
- เข้าใจตรงนี้แล้วจะไม่แปลกใจว่าทำไม AI "ลืม" ทุกอย่างเมื่อเริ่มแชทใหม่ — เพราะความจำอยู่แค่ใน context window ของแชทนั้น ไม่ใช่ในตัวโมเดลถาวร
06
บทที่ 6 · คำนิยาม
Temperature (การสุ่มเลือกคำตอบ)
ปุ่มคุมความสุ่มตอนเลือกคำถัดไป
- ในแต่ละจังหวะ โมเดลจะคำนวณ "ความน่าจะเป็น" ของคำถัดไปหลาย ๆ ตัวเลือก แล้วสุ่มเลือกหนึ่งตัวตามความน่าจะเป็นนั้น
- Temperature เป็นค่าที่ปรับว่าการสุ่มนั้น "แหลม" หรือ "แบน" แค่ไหน — ค่ามักอยู่ระหว่าง 0 ถึง 2
- Temperature ต่ำ (เช่น 0.2) → โมเดลเลือกคำที่น่าจะเป็นที่สุดเกือบทุกครั้ง คำตอบจึงนิ่ง สม่ำเสมอ คาดเดาได้
- Temperature สูง (เช่น 0.8–1+) → เปิดโอกาสให้เลือกคำที่ไม่ใช่ตัวเลือกอันดับหนึ่งบ้าง คำตอบจึงหลากหลาย สร้างสรรค์ แต่เสี่ยงหลุดประเด็นมากขึ้น
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
เลือก Temperature ให้เหมาะกับงาน
📊 งานที่ต้องแม่นยำ ใช้ค่าต่ำ
สรุปเอกสาร, เขียนโค้ด, ตอบคำถามเชิงข้อเท็จจริง, งานที่ต้องทำซ้ำได้ผลเหมือนเดิม — ตั้ง temperature ต่ำ (ใกล้ 0)
🎨 งานที่ต้องการไอเดียใหม่ ใช้ค่าสูง
เขียนเรื่องแต่ง, ระดมไอเดียโฆษณา, ตั้งชื่อแบรนด์ — ตั้ง temperature สูงขึ้นเพื่อให้ได้ตัวเลือกที่หลากหลายไม่ซ้ำแบบเดิม
07
บทที่ 7 · คำนิยาม
Hallucination (อาการมั่วอย่างมั่นใจ)
ทำไม AI ถึง "มั่ว" แบบมั่นใจสุด ๆ
- Hallucination คือการที่ AI สร้างข้อมูลที่ฟังดูมั่นใจ ลื่นไหล แต่ไม่เป็นความจริง เช่น อ้างอิงงานวิจัยที่ไม่มีอยู่จริง หรือบอกข้อเท็จจริงผิด ๆ
- สาเหตุหลักคืองานวิจัยพบว่า กระบวนการฝึกและวัดผลโมเดลมักให้รางวัลกับการ "เดาคำตอบ" มากกว่าการยอมรับว่า "ไม่รู้" เพราะการทดสอบส่วนใหญ่ให้คะแนนคำตอบที่ผิดกับคำตอบที่บอกว่าไม่แน่ใจเท่ากัน (คือ 0 คะแนนทั้งคู่) โมเดลจึงถูกฝึกให้ "เดาไปเลยดีกว่า"
- โมเดลไม่มีกลไก "ตรวจสอบข้อเท็จจริง" ในตัวเองแบบมนุษย์ค้นเอกสาร มันแค่ทำนายลำดับคำที่ฟังดูสมเหตุสมผลที่สุดจากสิ่งที่เคยเห็นตอนฝึก
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
ลดความเสี่ยงจาก Hallucination
- อย่าเชื่อ 100% โดยเฉพาะตัวเลข ชื่อเฉพาะ วันที่ หรือการอ้างอิงแหล่งที่มา — ควรตรวจสอบซ้ำเสมอ
- ใช้ RAG (Retrieval-Augmented Generation) เพื่อให้ AI อ้างอิงจากเอกสารจริงที่เราป้อนให้ แทนที่จะพึ่งความจำจากตอนฝึกอย่างเดียว — ช่วยลด hallucination ได้มาก เพราะมี "ของจริง" ให้ยึด
- ตั้งคำถามให้เจาะจง ให้บริบทชัดเจน และขอให้ AI ระบุแหล่งที่มา/บอกความไม่แน่ใจ จะช่วยลดโอกาสมั่วได้
08
บทที่ 8 · คำนิยาม
Embeddings (เวกเตอร์ความหมาย)
Embedding = พิกัดของความหมายในพื้นที่หลายมิติ
- Embedding คือการแปลงข้อความ (คำ ประโยค หรือทั้งเอกสาร) ให้เป็น เวกเตอร์ตัวเลข ชุดหนึ่งในพื้นที่หลายมิติ
- ข้อความที่มี ความหมายใกล้เคียงกัน จะถูกวางให้มี "พิกัด" อยู่ใกล้กันในพื้นที่นั้น แม้จะใช้คำคนละคำกันเลยก็ตาม
- ตัวอย่าง: ประโยค "แล็ปท็อปเปิดไม่ติด" กับ "คอมพิวเตอร์บูตไม่ขึ้น" ใช้คำต่างกันโดยสิ้นเชิง แต่ embedding ของทั้งสองจะอยู่ใกล้กันมาก เพราะความหมายใกล้เคียงกัน
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
Embeddings คือหัวใจของ Semantic Search
🔍 ค้นหาด้วยความหมาย ไม่ใช่คำตรงตัว
ต่างจากการค้นหาแบบคีย์เวิร์ดเดิม ๆ semantic search ใช้ embedding เปรียบเทียบ "ความใกล้เคียงทางความหมาย" ทำให้หาเจอแม้ผู้ใช้ไม่ได้พิมพ์คำที่ตรงกับเอกสารเป๊ะ ๆ
🧩 รากฐานของระบบ RAG
ระบบ RAG ใช้ embedding แปลงคำถามผู้ใช้และเอกสารทั้งหมดเป็นเวกเตอร์ แล้วค้นหาเอกสารที่ "ใกล้เคียง" ที่สุดมาป้อนให้ AI ใช้ตอบ — ไปดูรายละเอียดบทถัดไป
09
บทที่ 9 · คำนิยาม
RAG (Retrieval-Augmented Generation)
RAG = ค้นก่อน แล้วค่อยให้ AI ตอบ
- RAG (Retrieval-Augmented Generation) คือเทคนิคที่รวม 2 ขั้นตอนเข้าด้วยกัน: ค้นหา (Retrieval) เอกสารที่เกี่ยวข้องจากฐานข้อมูลของเรา แล้ว ส่งเอกสารนั้นเข้าไปใน context ให้ AI ใช้ประกอบการตอบ (Generation)
- ขั้นตอนคร่าว ๆ: แปลงคำถามผู้ใช้เป็น embedding → ค้นหาเอกสารที่ embedding ใกล้เคียงที่สุดในฐานข้อมูลเวกเตอร์ → แนบเนื้อหาที่เจอเข้าไปใน prompt → ให้ AI สร้างคำตอบโดยอ้างอิงเนื้อหานั้น
- ต่างจากการ fine-tune ตรงที่ RAG ไม่ได้แก้ไขตัวโมเดลเลย แค่ "ยืมข้อมูล" มาใส่ใน context ชั่วคราวตอนตอบแต่ละครั้ง
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
RAG แก้ปัญหาอะไรให้เรา
- ลด Hallucination — เพราะ AI มีเอกสารจริงให้ยึด ไม่ต้องเดาจากความจำเก่า ๆ ตอนฝึกอย่างเดียว
- ข้อมูลอัปเดตได้ตลอดเวลา — แค่อัปเดตฐานข้อมูลเอกสาร ไม่ต้องฝึกโมเดลใหม่ จึงเหมาะกับข้อมูลที่เปลี่ยนบ่อย เช่น นโยบายบริษัท ราคาสินค้า คู่มือภายใน
- ใช้กับข้อมูลส่วนตัว/องค์กรได้ — ให้ AI ตอบจากเอกสารภายในที่โมเดลไม่เคยเห็นตอนฝึก โดยไม่ต้องส่งข้อมูลไปฝึกโมเดลใหม่
10
บทที่ 10 · เปรียบเทียบ
Fine-tuning vs Prompting vs RAG
จุดตัดสินใจสำคัญที่สุดสำหรับคนสร้างงานด้วย AI — เลือกวิธีไหนดีกับงานแบบไหน
| วิธี | ทำอะไร | เหมาะกับ |
| Prompting | ปรับคำสั่ง/คำถามที่ป้อนให้ AI ให้ชัดเจนขึ้น ไม่แตะต้องตัวโมเดล | เริ่มต้นเสมอ ง่าย เร็ว ไม่ต้องลงทุนอะไรเพิ่ม แก้ปัญหาการสื่อสาร/รูปแบบคำตอบ |
| RAG | ดึงเอกสารภายนอกมาแนบใน context ก่อนให้ AI ตอบ | ต้องการความแม่นยำ/ข้อมูลอัปเดต หรือใช้ข้อมูลเฉพาะองค์กรที่โมเดลไม่เคยเห็น |
| Fine-tuning | ฝึกโมเดลเพิ่มเติมด้วยข้อมูลเฉพาะทาง ปรับพฤติกรรม/สไตล์ของโมเดลเอง | ต้องการโทน/รูปแบบ/ทักษะเฉพาะทางที่ทำซ้ำ ๆ จำนวนมาก และวิธีอื่นทำไม่ได้ผลแล้ว |
ทำไมสำคัญ / ใช้ยังไงในทางปฏิบัติ
กฎง่าย ๆ ในการตัดสินใจ
- เริ่มจาก Prompting เสมอ — ราคาถูกที่สุด เร็วที่สุด แก้ปัญหาได้ส่วนใหญ่ในทางปฏิบัติแล้ว
- ถ้าต้องการความรู้ใหม่หรือข้อมูลที่อัปเดตตลอด ให้ไปทาง RAG แทนที่จะฝึกโมเดลใหม่ทุกครั้งที่ข้อมูลเปลี่ยน
- Fine-tuning ควรเป็นตัวเลือกสุดท้าย ใช้ทรัพยากรและเวลามากที่สุด เหมาะเมื่อ prompting และ RAG ยังไม่พอสำหรับพฤติกรรม/สไตล์เฉพาะที่ต้องการจริง ๆ
- ในทางปฏิบัติ 3 วิธีนี้ ไม่ได้แยกจากกันเด็ดขาด มักใช้ผสมกันได้ เช่น prompt ที่ดี + RAG ที่แม่น มักเพียงพอสำหรับงานส่วนใหญ่ของ BooAI BootCamp
สรุปให้จำง่าย
10 อุปมาช่วยจำ
- LLM = เครื่องทำนายคำถัดไปที่อ่านหนังสือมาเยอะมาก
- Token = คำเงินที่ AI ใช้จ่ายความคิด
- Context window = ขนาดโต๊ะทำงานที่ AI มองเห็นได้ตอนนั้น
- Parameters = จำนวนเซลล์สมองที่ AI มีไว้จดจำรูปแบบภาษา
- Training vs Inference = เรียนจบมหาลัย vs ออกไปทำงานจริง
- Temperature = ปุ่มหมุนความกล้าเสี่ยงตอนเลือกคำตอบ
- Hallucination = เพื่อนที่มั่นใจเกินร้อย ทั้งที่จำผิด
- Embeddings = พิกัด GPS ของความหมายในแผนที่ภาษา
- RAG = ให้ AI เปิดหนังสืออ่านสอบ แทนท่องจำล้วน ๆ
- Fine-tune vs Prompt vs RAG = ฝึกนิสัยใหม่ vs สั่งงานให้ชัด vs ยื่นเอกสารให้อ่าน
อยากไปต่อให้เร็วขึ้น?
เรียนสดกับโค้ช BooAI BootCamp
🏔 Vibe Code Sprint + BootCamp Chiang Mai
เวิร์กช็อปสด 1 วัน (10:00–16:00) ลงมือสร้าง AI Agent + Workflow ใช้งานจริง กลับไปใช้ได้ทันที ไม่ต้องมีพื้นฐานโค้ด
รอบเชียงใหม่ 17–18 และ 24–25 ก.ค. 2026 · Early Bird เริ่ม 7,599 บาท · รอบกรุงเทพฯ ส.ค. 2026
💻 คอร์สออนไลน์ BooAI BootCamp
เรียนได้ทุกที่ทุกเวลา — Vibe Code (Basic → Builder → Advanced), Prompt Mastery, OpenClaw DIY และ n8n Zero To Hero