AMD เปิดตัว Instella-MoE-16B-A3B — โมเดล AI ที่เทรนด้วย GPU ของตัวเอง ไม่พึ่ง Nvidia
AMD เปิดตัว Instella-MoE-16B-A3B — โมเดล AI ที่เทรนด้วย GPU ของตัวเอง ไม่พึ่ง Nvidia โดย Nokka (นก-กา) | 5 สิงหาคม 2569 AMD เพิ่งปล่อยโมเดล AI ตัวใหม่ที่สร้างความฮือฮาในวงการ เพราะไม่ได้เป็นเพียง "โมเดลฟรีอีกตัว" แต่มันคือการพิสูจน์ว่า GPU ของ AMD ก็เทรน AI ระดับท็อปได้จริง โดยไม่ต้องพึ่ง Nvidia [

AMD เปิดตัว Instella-MoE-16B-A3B — โมเดล AI ที่เทรนด้วย GPU ของตัวเอง ไม่พึ่ง Nvidia โดย Nokka (นก-กา) | 5 สิงหาคม 2569 AMD เพิ่งปล่อยโมเดล AI ตัวใหม่ที่สร้างความฮือฮาในวงการ เพราะไม่ได้เป็นเพียง "โมเดลฟรีอีกตัว" แต่มันคือการพิสูจน์ว่า GPU ของ AMD ก็เทรน AI ระดับท็อปได้จริง โดยไม่ต้องพึ่ง Nvidia [1][2] โมเดลชื่อ Instella-MoE-16B-A3B มีขนาด 16 พันล้านพารามิเตอร์ แต่จุดเด่นคือไม่ได้ใช้ทั้งหมดพร้อมกันทุกครั้งที่ประมวลผล ใช้จริงแค่ 2.8 พันล้านตัวต่อคำ [1][2] นี่คือหัวใจของสถาปัตยกรรมแบบ Mixture-of-Experts (MoE) เปรียบง่ายๆ เหมือนบริษัทที่มีผู้เชี่ยวชาญหลายแผนก แต่ละงานจะถูกส่งไปให้แผนกที่เกี่ยวข้องเท่านั้น ไม่ต้องเรียกทุกแผนกมาประชุมทุกครั้ง ทำให้ประมวลผลเร็วขึ้นโดยที่โมเดลยังมีความรู้กว้างเหมือนเดิม [2] ในบทความนี้ผมจะพาคุณไปทำความเข้าใจว่าโมเดลนี้คืออะไร ทำไม AMD ถึงต้องทำแบบนี้ และถ้าคุณเป็นนักวิจัยหรือคนสนใจ AI ควรรู้เรื่องอะไรบ้าง ประเด็นหลักไม่ได้อยู่ที่ตัวเลขสเปก แต่อยู่ที่ AMD เทรนโมเดลนี้ตั้งแต่ต้นจนจบด้วย GPU ของตัวเอง (Instinct MI300X และ MI325X) โดยไม่ใช้ Nvidia เลย [1][2] ปกติงานระดับนี้ต้องพึ่ง CUDA ของ Nvidia แทบทั้งหมด การที่ AMD ทำได้สำเร็จจึงเป็นสัญญาณว่าทางเลือกที่ไม่ใช่ Nvidia เริ่มเป็นไปได้จริง แถม AMD ยังเปิดให้ดาวน์โหลด weight ของทุกขั้นตอนการเทรน พร้อมโค้ดเทรน และสูตรผสมข้อมูลแบบเปิดหมด [1][2] นี่คือสิ่งที่ทำให้เรื่องนี้กลายเป็นข่าวใหญ่ เพราะเป็นการ "เปิดไพ่ทั้งหมด" ให้วงการตรวจสอบและต่อยอดได้ โมเดลนี้ใช้การออกแบบแบบ decoder-only MoE ที่มีส่วนผสมของนวัตกรรมทางสถาปัตยกรรมและระบบ [1] รายละเอียด ค่า Parameters รวม 16B Parameters active ต่อ token 2.8B Decoder layers 27 Hidden size 2048 Shared experts 2 Routed experts (เลือก 6 จาก 64) 6/64 ต่อ token Pre-training tokens 7.1T Context window 4K → 64K Gated Multi-head Latent Attention (Gated MLA) — เพิ่ม output gate แบบเรียนรู้ได้ให้กับ attention ทำให้โมเดลเลือก "ลดทอน" คำตอบของ attention ที่มีประโยชน์ต่ำสำหรับแต่ละ token ได้ เพิ่มความสามารถในการแสดงออกของโมเดลด้วยต้นทุนต่ำ FarSkip-Collective — ปรับการเชื่อมต่อของ MoE ให้ซ้อนทับการสื่อสารกับการคำนวณระหว่างการเทรนแบบ expert-parallel ส่งผลให้ [1]: Pre-training เร็วขึ้น 12.7% — ลดช่องว่างการสื่อสาร Inference TTFT ลดลง 39.2% — เมื่อ serve ด้วย SGLang แบบ expert parallelism โมเดลใช้เทคนิคสอนให้ทำนายคำหลายคำพร้อมกัน แทนที่จะทีละคำ ช่วยให้เรียนรู้รูปแบบภาษาได้ดีขึ้น [1][2] AMD ปล่อย checkpoint ของทุกขั้นตอนการเทรน เพื่อให้คนอื่นเห็นภาพและทำซ้ำได้ [1] Checkpoint ขั้นตอน คำอธิบาย Pretrain Pre-training เทรนจากศูนย์บนคลังข้อมูลขนาดใหญ่ Midtrain Mid-training เทรนต่อด้วยข้อมูลคุณภาพสูง Base Long-context ขยายความสามารถประมวลผลข้อความยาว (เป็น base หลัก) SFT Supervised fine-tuning สอนให้ทำตามคำสั่ง + ให้เหตุผลแบบ chain-of-thought DPO Direct preference optimization ปรับปรุงด้วยข้อมูล preference Think RL (final) ปรับปรุงรอบสุดท้ายด้วย reinforcement learning การเปิดทุก checkpoint แบบนี้ช่วยให้ทีมวิจัยสามารถทำซ้ำ (reproduce) และศึกษาการพัฒนาความสามารถในแต่ละช่วงได้ [1] ในแง่ต้นทุน โมเดล 16B พารามิเตอร์แบบ BF16 ใช้หน่วยความจำประมาณ 32GB เท่านั้น [2] การ์ดจอระดับสูงตัวเดียวก็รันได้ ไม่จำเป็นต้องกระจายข้าม GPU หลายตัวเสมอไป ลองนึกภาพทีมวิจัยในมหาวิทยาลัยที่ไม่มีงบซื้อ GPU คลัสเตอร์แพงๆ แต่มีเครื่องเดียวที่มี VRAM 32GB พวกเขาก็ยังพอจะโหลดโมเดลนี้มาศึกษาโครงสร้างและทดลองได้ ซึ่งเป็นจุดที่ทำให้ทีมวิจัยขนาดเล็กเข้าถึงได้ มากกว่าที่จะเป็นของบริษัทใหญ่เท่านั้น สำหรับคนที่อยากลองเอาไปรันหรือศึกษาโค้ด ต้องรู้ข้อจำกัดเรื่องลิขสิทธิ์ก่อน [2][3] ResearchRAIL License (ใช้กับ weight ของโมเดล): ใช้ได้เฉพาะงานวิจัยและการศึกษา เอาไปทำโปรดักต์เชิงพาณิชย์ตรงๆ ไม่ได้ MIT License (ใช้กับโค้ดฝั่ง training): เปิดกว้างกว่ามาก เอาไปดัดแปลงต่อยอดได้เต็มที่ ข้อกำหนดในการรันจริง: ต้องใช้ Docker image เฉพาะของ AMD ต้องมี GPU ที่รองรับ ROCm (สถาปัตยกรรมซอฟต์แวร์คู่แข่ง CUDA) [2] เรื่องนี้สะท้อนภาพใหญ่กว่าตัวโมเดลเดียว ตอนนี้การแข่งขันชิป AI ไม่ได้อยู่แค่ว่าใครผลิตชิปแรงกว่า แต่อยู่ที่ว่าใครมี "ระบบนิเวศซอฟต์แวร์" ที่นักพัฒนาอยากใช้จริง [2] ลองดูตัวอย่างง่ายๆ ถ้านักพัฒนาคนหนึ่งชินกับการเขียนโค้ดด้วย CUDA อยู่แล้ว เขาจะลังเลที่จะย้ายไป ROCm เพราะต้องเรียนรู้ใหม่ทั้งหมด นี่คือสิ่งที่ Nvidia ชนะมาหลายปี AMD จึงต้องเอาชนะด้วยการปล่อยทั้งโมเดลและเครื่องมือเปิดให้คนมาทดลองใช้ ROCm จริงๆ เพื่อพิสูจน์ว่าทำได้จริง และค่อยๆ สร้างความมั่นใจให้วงการหันมาใช้ทางเลือกที่ไม่ใช่ Nvidia มากขึ้น [2] ผู้เชี่ยวชาญร่วม (Shared Expert) — ผู้เชี่ยวชาญที่ทำงานทุกครั้งไม่ว่าคำถามจะเป็นเรื่องอะไร ต่างจากผู้เชี่ยวชาญที่ถูกเลือกมาเฉพาะเรื่อง [2] Multi-Token Prediction — เทคนิคสอนโมเดลให้ทำนายคำหลายคำพร้อมกัน แทนที่จะทีละคำ ช่วยให้เรียนรู้รูปแบบภาษาได้ดีขึ้น [2] สัญญาอนุญาต (License) — กฎการใช้งานชิ้นงาน MIT อนุญาตใช้ทุกอย่างรวมถึงเชิงพาณิชย์ ส่วน ResearchRAIL จำกัดเฉพาะงานวิจัย [2] AMD Instella-MoE-16B-A3B เป็นก้าวสำคัญของวงการ เพราะมันพิสูจน์ว่า GPU ของ AMD เทรน AI ระดับท็อปได้จริง ไม่ต้องพึ่ง Nvidia ด้วยการเปิดทุกอย่างแบบถ้วนหน้า ทั้ง weight ทุกขั้นตอน โค้ดเทรน และสูตรข้อมูล แม้ weight จะจำกัดไว้เฉพาะงานวิจัย (ResearchRAIL) แต่โค้ด training เปิดแบบ MIT และเรื่องนี้สะท้อนทิศทางใหญ่ที่ว่า การแข่ง AI กำลังย้ายไปสู่การแข่ง "ระบบนิเวศซอฟต์แวร์" ใครมี ecosystem ที่นักพัฒนาอยากใช้ ยิ่งได้เปรียบในระยะยาว ถ้าคุณเป็นนักวิจัยหรือทีมที่อยากศึกษาโมเดล MoE แบบเปิดๆ นี่คือโอกาสดีที่จะได้เรียนรู้โครงสร้างและเทคนิคการเทรนจริงจากค่ายที่ต้องการพิสูจน์ตัวเองที่สุดตอนนี้ ลองแวะไปดูโค้ดและ checkpoint บน Hugging Face ดูได้ เริ่มจากศึกษาสถาปัตยกรรม Gated MLA แล้วค่อยลองรันดูกับเครื่องที่มี ROCm [1] AMD ROCm Blogs. "Introducing Instella-MoE: A State-of-the-Art Fully Open Mixture-of-Experts Language Model". 24 กรกฎาคม 2026. https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html [2] MarkTechPost. "AMD Releases Instella-MoE-16B-A3B: A Fully Open Mixture-of-Experts LLM With 2.8B Active Parameters Trained On Instinct GPUs". 1 สิงหาคม 2026. https://www.marktechpost.com/2026/08/01/amd-instella-moe-16b-a3b-fully-open-mixture-of-experts-llm/ [3] Hugging Face. "amd/Instella-MoE-16B-A3B-Think". 23 กรกฎาคม 2026. https://huggingface.co/amd/Instella-MoE-16B-A3B-Think คุณมองว่า AMD จะท้าทาย Nvidia ได้แค่ไหนในระยะยาว? หรือคิดว่า CUDA ยังได้เปรียบเกินกว่าจะตามทัน? แชร์มุมมองใต้บทความได้เลยครับ — Nokka ยินดีแลกเปลี่ยนความคิด
Key Takeaways
- •AMD เปิดตัว Instella-MoE-16B-A3B — โมเดล AI ที่เทรนด้วย GPU ของตัวเอง ไม่พึ่ง Nvidia โดย Nokka (นก-กา) | 5 สิงหาคม 2569 AMD เพิ่งปล่อยโมเดล AI ตัวใหม่ที่สร้างความฮือฮาในวงการ เพราะไม่ได้เป็นเพียง "โมเดลฟรีอีกตัว" แต่มันคือการพิสูจน์ว่า GPU ของ AMD ก็เทรน AI ระดับท็อปได้จริง โดยไม่ต้องพึ่ง Nvidia [
- •This story was reported by Dev.to, covering developments in the dev space.
- •AI advancements continue to reshape industries — read the full article on Dev.to for complete coverage.
📖 Continue reading the full article:
Read Full Article on Dev.to →


