รัน AI แบบโลคัล — และจุดที่คำว่า “โลคัล” เป็นเพียงตำนาน
วันนี้ลองพิมพ์ ollama ในเทอร์มินัลของคุณดู สิ่งที่เริ่มทำงานไม่ใช่โมเดลโลคัล
ตั้งแต่เวอร์ชัน 0.32.0 เมื่อวันที่ 11 กรกฎาคม 2026 คำสั่งเปล่าๆ นี้จะเปิดเอเจนต์ตัวหนึ่งขึ้นมา — และในบันทึกการอัปเดตของ Ollama เองก็บอกไว้ว่าเปิดด้วยอะไร: “Chat, Code, & Work (glm-5.2:cloud)” นั่นคือโมเดลคลาวด์ เครื่องมือที่นิยมที่สุดสำหรับ AI แบบโลคัลกลับส่งคุณขึ้นเน็ตตั้งแต่การเรียกใช้งานเริ่มต้น
นี่ไม่ใช่เรื่องอื้อฉาว แต่เป็นการตัดสินใจด้านผลิตภัณฑ์ และคุณปิดมันได้ แต่มันคือจุดเปิดเรื่องที่สมบูรณ์แบบสำหรับบทความนี้ เพราะคำว่า “โลคัล” กลายเป็นคำที่ต้องตรวจสอบ ไม่ใช่คำที่เชื่อได้ทันที
ทำไมถึงต้องทำแบบนี้เลย
เริ่มจากสิ่งที่ยืนหยัดได้จริง — และนั่นไม่ใช่เรื่องเงิน
ถ้าคุณรัน AI บนเซิร์ฟเวอร์ของตัวเองเพื่อวัตถุประสงค์ของตัวเองเท่านั้น ตามความเห็นของหน่วยงานคุ้มครองข้อมูลส่วนบุคคลของเยอรมนี (Datenschutzkonferenz) ความสัมพันธ์แบบ ผู้ประมวลผลข้อมูล (Auftragsverarbeitung) จะหายไปเลย คุณกลายเป็นผู้ควบคุมข้อมูลแต่เพียงผู้เดียว ไม่มีสัญญาประมวลผลข้อมูลตามมาตรา 28 วรรค 3 ของ GDPR ไม่มีห่วงโซ่ผู้รับช่วงประมวลผล ไม่มีการส่งข้อมูลไปประเทศที่สาม ไม่มีคำวินิจฉัยความเพียงพอ (adequacy decision) ที่อาจถูกล้มในปีหน้า
นี่คือประเด็นที่ต้องเข้าใจ: การประมวลผลแบบโลคัลไม่ใช่การลดความเสี่ยง แต่เป็นการตัดออกทั้งห่วงโซ่ของภาระผูกพันในเชิงโครงสร้าง หน่วยงานกำกับดูแลแนะนำอย่างชัดเจนให้ใช้การประมวลผลแบบโลคัล เช่น สำหรับการฝึกฝนเพิ่มเติมและการไฟน์จูน
และความกังวลทั่วไปที่ว่าการรัน AI ของตัวเองจะดึงภาระทางกฎหมายเข้ามาในบ้าน ไม่ตรงกับผู้ใช้ส่วนบุคคลเลย เพราะตามมาตรา 2(10) กฎหมาย AI Act ไม่บังคับใช้กับการใช้งานส่วนตัวที่ไม่ใช่เชิงวิชาชีพเลย และมาตรา 2(12) ยกเว้นระบบโอเพนซอร์สที่ใช้งานฟรีโดยทั่วไป
(นี่คือการถ่ายทอดแนวทางของหน่วยงานและตัวบทกฎหมาย ณ วันที่ 24 กรกฎาคม 2026 — ไม่ใช่คำแนะนำทางกฎหมาย สำหรับกรณีธุรกิจจริง ควรปรึกษาเจ้าหน้าที่คุ้มครองข้อมูลส่วนบุคคลของคุณ)
อะไรที่ใส่ลงในการ์ดจอของคุณได้
ข้อมูล VRAM ที่ตรงไปตรงมาที่สุดเท่าที่มีอย่างเป็นทางการ คือขนาดไฟล์ในไลบรารีของ Ollama คร่าวๆ คือ: คุณต้องมีหน่วยความจำการ์ดจอเท่ากับขนาดไฟล์ บวกพื้นที่เผื่อไว้อีกนิดหน่อย
| โมเดล | ขนาด (Q4) | ใส่ได้บน |
|---|---|---|
| Gemma 4, 12B | 7.6 GB | การ์ด 8 GB, พอดีเป๊ะ |
| gpt-oss-20b | ออกแบบมาสำหรับ 16 GB | การ์ด 16 GB |
| Qwen3.6-27B | 17 GB | การ์ด 24 GB |
| Gemma 4, 31B | 20 GB | การ์ด 24 GB |
| Laguna XS 2.1 (q4) | 20 GB | การ์ด 24 GB |
| Qwen3.6-35B | 24 GB | 24 GB, ตึงมาก |
ดังนั้นจุดเริ่มต้นที่สมจริงคือการ์ด 16 GB ที่ร้านค้าปลีกรายใหญ่ในเยอรมนี RTX 5060 Ti ขนาด 16 GB วางขายอยู่ที่ €555.85 (ราคาโปรโมชัน) ส่วนการ์ด 16 GB ราคาปกติที่ถูกที่สุดอยู่ที่ €559.64 ส่วนการ์ด 32 GB (RTX 5090) มีราคาสูงกว่าหลายเท่าตัว อยู่ที่ €4,248.99
มีสองเรื่องที่มักถูกนำเสนอไม่ถูกต้อง:
การควอนไทซ์ไม่ได้แค่ทำให้โมเดลเล็กลง แต่ยังทำให้เร็วขึ้นด้วย ในตัวอย่างมาตรฐาน Llama-3.1-8B เวอร์ชัน 4-บิตสร้างโทเคนได้ 71.93 โทเคนต่อวินาที เทียบกับ 29.17 ของเวอร์ชัน 16-บิต — ต่างกันถึง 2.5 เท่า เหตุผลคือ: การสร้างข้อความถูกจำกัดด้วยแบนด์วิดท์หน่วยความจำ (memory-bandwidth-bound) บิตที่น้อยกว่าหมายถึงข้อมูลที่ต้องอ่านน้อยกว่า ความเข้าใจทั่วไปที่ว่าการควอนไทซ์เป็นเพียงการยอมลดคุณภาพเพื่อประหยัดพื้นที่เท่านั้น จึงไม่ถูกต้อง
ค่าไฟไม่ใช่ปัจจัยสำคัญ หากใช้งานเต็มกำลังวันละหนึ่งชั่วโมง 5060 Ti จะเสียค่าไฟประมาณ €2.22 ต่อเดือน ส่วน 5090 ประมาณ €7.09 — คำนวณจากราคาค่าไฟครัวเรือนอย่างเป็นทางการของเยอรมนีที่ 40.55 เซนต์ต่อกิโลวัตต์ชั่วโมง แม้จะใช้วันละสี่ชั่วโมง ก็ยังอยู่ที่ €8.88 และ €28.35 เท่านั้น ดังนั้นข้อโต้แย้งที่ว่า “AI แบบโลคัลไม่คุ้มเพราะค่าไฟ” จึงตกไป การตัดสินใจขึ้นอยู่กับราคาซื้อล้วนๆ
การคำนวณที่แทบไม่มีใครเขียนออกมา
และราคาซื้อนี่แหละที่ตัดสินไปในทางที่ไม่เป็นผลดีกับคุณ
€555.85 เทียบเท่ากับ — ตามอัตราแลกเปลี่ยน ณ วันที่ตรวจสอบ — ประมาณ 253 ล้านเอาต์พุตโทเคน บน Gemini 3.5 Flash-Lite บน Claude Haiku 4.5 อยู่ที่ 126 ล้าน บน Claude Sonnet 5 ยังคงอยู่ที่ 63 ล้าน และบน GPT-5.6 Sol อยู่ที่ 21 ล้าน ซึ่งก็ยังถือว่าไม่น้อย
ลองนึกดูว่ามันหมายความว่าอะไร คนที่สร้าง 5,000 โทเคนต่อวัน — ซึ่งถือว่าเป็นการใช้งานหนักในแต่ละวันอยู่แล้ว — จะต้องใช้เวลาประมาณ 138 ปี กว่าจะใช้โทเคนหมด 253 ล้านโทเคน
พูดในรูปจุดคุ้มทุน: การ์ดระดับเริ่มต้นจะคุ้มทุนหลังผ่านไปประมาณ 71 เดือน หรือหกปี หากใช้จ่าย API เดือนละ €10 ถ้าเป็น €25 ก็คุ้มทุนหลังผ่านไปสองปีกว่าๆ และจะน่าสนใจจริงๆ ก็ต่อเมื่อใช้จ่ายเดือนละ €50 ซึ่งคุ้มทุนในเวลาไม่ถึงสิบสองเดือน ส่วน 5090 ที่ €50 ต่อเดือน ต้องใช้เวลาประมาณ แปดปี
ในทางการเงิน AI แบบโลคัลแทบไม่เคยเป็นทางเลือกที่ถูกกว่าเลย ใครก็ตามที่ให้เหตุผลว่า “ในระยะยาวมันประหยัดเงิน” โดยทั่วไปแล้วคำนวณผิด คุณซื้อมันเพื่อความมีอธิปไตยเหนือข้อมูล (data sovereignty) — ซึ่งเป็นคุณค่าที่แท้จริง แต่เป็นคุณค่าคนละแบบ
มีข้อยกเว้นหนึ่งที่ต้องพูดตรงๆ: หากข้อกำหนดด้าน compliance บังคับให้ต้องเก็บข้อมูลในยุโรปอยู่แล้ว ผู้ให้บริการรายใหญ่จากสหรัฐฯ ทั้งสองราย คิดค่าธรรมเนียมเพิ่มพอดี 10% — OpenAI เรียกมันว่า “a 10% uplift” ส่วน Anthropic ใช้ตัวคูณ 1.1 นี่ทำให้การคำนวณเปลี่ยนไปเล็กน้อย แต่ไม่มากถึงขั้นพลิกผัน
ช่องว่างด้านความสามารถ — และกลลวงในตัวเลข
หลายเรื่องถูกปนกันในประเด็นนี้ และความแตกต่างนี้สำคัญมาก
“โมเดลโอเพนซอร์สตามทันเกือบหมดแล้ว” เป็นจริง — ใน Intelligence Index ของ Artificial Analysis, Kimi K2.6 และ MiMo V2.5 Pro อยู่ที่ 54 คะแนน DeepSeek V4 Pro อยู่ที่ 52 เทียบกับ GPT-5.5 ที่นำอยู่ที่ 60 คะแนน เมื่อปีก่อนช่องว่างนี้กว้างกว่านี้มาก
“ผมรันโมเดลนี้ที่บ้านได้” เป็นคนละเรื่องกับคนละโมเดลเลย Kimi K2.6 มีพารามิเตอร์หนึ่งล้านล้านตัว DeepSeek V4 Pro มี 1.6 ล้านล้านตัว นี่คือโมเดลระดับดาต้าเซ็นเตอร์ พวกมันเป็นโอเพนซอร์สก็จริง — แต่นั่นไม่ได้แปลว่ามันรันบนการ์ดจอของคุณได้
สิ่งที่ใส่ลงในการ์ดจอตัวเดียวได้จริงๆ นั้นตามหลังอยู่มาก: Qwen3.6-27B ได้ 37 คะแนนในดัชนี — อันดับ 1 ในกลุ่มขนาดของมัน แต่ก็ยังเป็น 37 เทียบกับ 60 ส่วน gpt-oss-20b อยู่ที่ 15
และการตรวจสอบไขว้ด้วยการเปรียบเทียบแบบไม่เห็นชื่อ (blind comparison) ยิ่งชัดเจนกว่านั้นอีก: ในตารางอันดับของ LMArena ไม่มีโมเดลโอเพนซอร์สแม้แต่ตัวเดียวติดใน 15 อันดับแรก โมเดลโอเพนซอร์สที่ดีที่สุดอยู่ที่อันดับ 29
เพื่อความเป็นธรรม: ระเบียบวิธีของ arena นี้เคยถูกวิจารณ์อย่างมีหลักฐาน (“The Leaderboard Illusion”) ส่วนหนึ่งเพราะข้อมูลส่วนใหญ่มาจากผู้ให้บริการเชิงพาณิชย์เพียงไม่กี่ราย แต่คำวิจารณ์นี้ก็มาจากผู้เขียนที่ใกล้ชิดกับผู้ให้บริการโมเดลรายหนึ่งเช่นกัน ทั้งสองด้านนี้ควรวางคู่กันไว้
ความเห็นของฉัน: สำหรับงานสรุปความ เรียบเรียงใหม่ จัดโครงสร้าง หรือเขียนโค้ดง่ายๆ โมเดล 27B บนการ์ด 24 GB เพียงพอมากแล้ว แต่สำหรับงานยากๆ — การให้เหตุผลยาวๆ งานที่ซับซ้อนซ้อนกัน หรืองานแบบเอเจนต์ — คุณจะรู้สึกถึงความต่าง 23 คะแนนนั้นได้ทันที
จุดที่ “โลคัล” ไม่ได้โลคัลจริง
นี่คือส่วนที่ไม่มีคู่มือไหนเขียนถึง เพราะมันไม่สะดวกใจนัก
การเรียกใช้งาน Ollama แบบค่าเริ่มต้น ดูด้านบน: ตั้งแต่ v0.32.0 คำสั่ง ollama จะเริ่มเอเจนต์บนโมเดลคลาวด์ โมเดลคลาวด์อยู่ในรายการไลบรารีเดียวกันกับโมเดลโลคัล แยกกันแค่ด้วยคำต่อท้ายในแท็ก — gemma4:31b รันบนเครื่องคุณ ส่วน gemma4:31b-cloud ไม่รัน ต่างกันแค่ตัวอักษรเดียว
การค้นหาเว็บของเอเจนต์ รันผ่านเซิร์ฟเวอร์ของ Ollama เอง และต้องมีบัญชีพร้อม API key
แม้จะใช้งานแบบโลคัลล้วนๆ ก็ยังมีเมทาดาต้าเกิดขึ้น นโยบายความเป็นส่วนตัวของ Ollama แยกเรื่องนี้ไว้ชัดเจน — เนื้อหาที่ประมวลผลแบบโลคัลจะไม่ถูกเก็บ ระบุตรงๆ ว่า: “We do not collect, store, transmit, or have access to your prompts, responses, model interactions, or other content you process locally.” แต่เมทาดาต้าของอุปกรณ์และการใช้งานนั้นถูกเก็บ
LM Studio ประกาศตัวเองว่าไม่มีการเก็บ telemetry และในขณะเดียวกันก็ระบุอย่างเปิดเผยถึงฟังก์ชันห้าอย่างที่ต้องใช้อินเทอร์เน็ต: การค้นหาโมเดล การดาวน์โหลดโมเดล สถิติแคตตาล็อก การดาวน์โหลด runtime และการตรวจสอบอัปเดต นี่คือตัวอย่างที่ดี — เส้นแบ่งถูกระบุไว้ในเอกสารชัดเจน
และสำหรับหนึ่งในโมเดลที่รู้จักกันดีที่สุด ขั้นแรกสู่ความมีอธิปไตยกลับกลายเป็นการมอบตัวตนของคุณไป: ในการดาวน์โหลดน้ำหนักโมเดล Llama 4 ที่ “เปิด” นั้น Meta เรียกร้องชื่อ-นามสกุลตามกฎหมายเต็มและวันเดือนปีเกิดของคุณ สัญญาอนุญาตของ Llama ไม่ใช่สัญญาอนุญาตแบบโอเพนซอร์สอยู่แล้วในทุกกรณี — หากมีผู้ใช้งานต่อเดือนเกิน 700 ล้านคน คุณต้องขออนุญาต Meta ซึ่งจะให้หรือไม่ให้ก็ขึ้นอยู่กับดุลยพินิจของบริษัทเอง
ควรเลือกโมเดลไหน ถ้าคุณให้ความสำคัญกับสัญญาอนุญาต
ถ้าคำว่า “เปิด” ควรหมายถึงเปิดจริงๆ สัญญาอนุญาตคือเกณฑ์แรกที่ต้องดู — และมีบางอย่างเปลี่ยนไปในเรื่องนี้ ซึ่งคู่มือเก่าๆ เกือบทั้งหมดยังเขียนผิดอยู่
Gemma 4 อยู่ภายใต้สัญญาอนุญาต Apache 2.0 ตั้งแต่เปิดตัวเมื่อวันที่ 31 มีนาคม 2026 — หน้าสัญญาอนุญาตมีข้อความเต็มแบบไม่ถูกแก้ไข โมเดล Gemma รุ่นก่อนหน้าทั้งหมดใช้สัญญาอนุญาตเฉพาะของบริษัทที่จำกัดสิทธิ์มากกว่า ซึ่ง Google ถึงขั้นสงวนสิทธิ์ในการจำกัดการใช้งานจากระยะไกลได้ด้วย เรื่องนี้ยังใช้กับ Gemma 3 และรุ่นก่อนหน้าอยู่ ถ้าคุณอ่านคู่มือที่บอกว่า “Gemma มีสัญญาอนุญาตของตัวเอง” แสดงว่าคุณกำลังอ่านคู่มือที่ล้าสมัยแล้ว
Qwen3.6-27B อยู่ภายใต้ Apache 2.0 แบบไม่ถูกแก้ไขและไม่มีเงื่อนไขเพิ่มเติมใดๆ — และในขณะเดียวกันก็เป็นโมเดลที่แข็งแกร่งที่สุดในกลุ่มขนาดของมัน ถ้าให้แนะนำสักตัวสำหรับการ์ด 24 GB ฉันจะแนะนำตัวนี้
gpt-oss-20b ก็อยู่ภายใต้ Apache 2.0 เช่นกัน และตามข้อมูลใน model card ก็ออกแบบมาสำหรับ 16 GB โดยตรง — จุดเริ่มต้นที่สบายที่สุดสำหรับการ์ดระดับเริ่มต้น
สิ่งที่คุณต้องแลกไป
เพื่อไม่ให้บทความนี้กลายเป็นโฆษณา นี่คือราคาที่ต้องจ่ายอย่างตรงไปตรงมา:
ความเร็ว การ์ดระดับเริ่มต้นไม่ใช่ดาต้าเซ็นเตอร์ เมื่อใช้คอนเท็กซ์ยาวๆ หรือให้โมเดลคิดนานๆ คุณต้องรอ
ความสามารถ 37 เทียบกับ 60 คะแนนดัชนี ไม่ใช่ความคลาดเคลื่อนเล็กน้อย โมเดลโลคัลของคุณจะรับมือกับงานยากๆ ได้แย่กว่า
การดูแลรักษา ไดรเวอร์ การควอนไทซ์ การอัปเดตโมเดล ดีเพนเดนซีที่พัง นี่คืองานที่ไม่มีใครเก็บเงินคุณเมื่อใช้ API เพราะมีคนอื่นทำให้แทน
และช่องว่างหนึ่งที่ฉันปิดไม่ได้: ฉันไม่พบข้อความใดในเอกสารทางการของทั้ง Ollama และ LM Studio ที่ระบุว่าน้ำหนักโมเดลที่ดาวน์โหลดมาถูกตรวจสอบที่มาด้วยวิธีเข้ารหัส (cryptographically) หรือไม่ สำหรับไฟล์ที่คุณรันบนเครื่องของตัวเอง นี่คือรายละเอียดที่ฉันอยากรู้
สรุปของฉัน
อย่าซื้อการ์ดจอเพื่อประหยัดเงิน การคำนวณแทบไม่เคยออกมาคุ้มค่า และใครก็ตามที่แสดงให้คุณเห็นเป็นอย่างอื่น คงปรุงแต่งตัวเลขการใช้งานหรือราคาการ์ดให้ดูดีเกินจริง
ซื้อมันถ้าสิ่งที่สำคัญกับคุณคือการที่เอกสารบางอย่างจะไม่มีวันออกจากบ้านคุณเลย — ข้อมูลลูกความ ข้อมูลผู้ป่วย ต้นฉบับงานเขียน สัญญา หรืออะไรก็ตามที่คำถาม “ตอนนี้มันอยู่ที่ไหน” ต้องการคำตอบที่แท้จริง สำหรับกรณีแบบนี้ AI แบบโลคัลไม่ใช่ทางออกที่ถูกกว่า แต่เป็นทางออกที่ สะอาด เพียงทางเดียว เพราะไม่มีบุคคลที่สามอยู่ในห่วงโซ่เลย
และถ้าคุณกำลังจะเริ่มต้น: เริ่มจากเล็กๆ ก่อน การ์ด 16 GB, gpt-oss-20b หรือ Gemma 4 ขนาดกลาง แล้วใช้เวลาสักหนึ่งสัปดาห์สังเกตอย่างตรงไปตรงมาว่าคุณใช้อะไรจริงๆ บ้าง หลังจากนั้นคุณจะรู้ว่าการ์ด 24 GB คุ้มค่าหรือไม่ — ดีกว่าการเดาไปก่อนล่วงหน้า
เครื่องมือต่างๆ ที่เกี่ยวข้องอยู่ใน ดัชนีเครื่องมือ AI 137 รายการ ที่ฉันอัปเดตต่อเนื่อง ส่วนโมเดลเชิงพาณิชย์ตัวไหนเหมาะกับงานแบบไหน อยู่ใน การเปรียบเทียบ ChatGPT, Claude และ Gemini
แหล่งอ้างอิง
ตรวจสอบทั้งหมดเมื่อวันที่ 24 กรกฎาคม 2026 ราคา สถานะโมเดล และสัญญาอนุญาตอาจเปลี่ยนแปลงได้ ราคาฮาร์ดแวร์เป็นราคาร้านค้าปลีก ณ วันที่ตรวจสอบ
- Qwen3.6 · Gemma 4 · gpt-oss-20b — การ์ดข้อมูลโมเดลและข้อความสัญญาอนุญาต
- สัญญาอนุญาตและเงื่อนไขการดาวน์โหลด Llama — Meta
- ไลบรารีโมเดล (ขนาดไฟล์ตามการควอนไทซ์) · บันทึกการอัปเดต v0.32.0 · นโยบายความเป็นส่วนตัว — Ollama
- เอกสารประกอบ (การใช้งานออฟไลน์, telemetry) — LM Studio
- การเปรียบเทียบการควอนไทซ์ — llama.cpp
- สเปก GeForce RTX 50 — NVIDIA
- ราคาค่าไฟฟ้าสำหรับครัวเรือน — สำนักงานสถิติแห่งชาติเยอรมนี (40.55 เซนต์/kWh, ครึ่งปีหลัง 2025)
- Intelligence Index — Artificial Analysis · ตารางอันดับ — LMArena
- แนวทางเกี่ยวกับปัญญาประดิษฐ์และการคุ้มครองข้อมูลส่วนบุคคล — Datenschutzkonferenz เยอรมนี (DSK)
- AI Act: ระเบียบ (EU) 2024/1689 มาตรา 2(10) และมาตรา 2(12)
- ราคา API: OpenAI · Google · Anthropic
ถ้ามีอะไรในนี้ที่ดูล้าสมัยหรือผิดพลาด: ติดต่อฉันได้เลย
ความคิดเห็น
เข้าสู่ระบบเพื่อแสดงความคิดเห็น ถูกใจ และบันทึก เข้าสู่ระบบ →
ยังไม่มีความคิดเห็น มาเป็นคนแรกกันเถอะ