โมเดล VibeThinker-3B ของ Weibo ท้าทายมาตรฐาน AI ด้วยประสิทธิภาพที่น่าทึ่ง
Photo: Google DeepMind / Pexels

เมื่อวันอาทิตย์ที่ผ่านมา ทีมวิจัยจำนวน 9 คนจาก Sina Weibo ได้เผยแพร่รายงานทางเทคนิคความยาว 14 หน้าใน arXiv ซึ่งสร้างความตื่นเต้นในวงการวิจัย AI อย่างมาก โมเดลที่พวกเขานำเสนอมีชื่อว่า VibeThinker-3B ซึ่งมีเพียง 3 พันล้านพารามิเตอร์ แต่สามารถทำคะแนนในการสอบ AIME 2026 ได้ถึง 94.3 คะแนน ซึ่งถือเป็นคะแนนที่สูงมากเมื่อเปรียบเทียบกับโมเดลอื่น ๆ ที่มีขนาดใหญ่กว่าอย่างเช่น DeepSeek V3.2 ที่มี 671 พันล้านพารามิเตอร์ และ Gemini 3 Pro จาก Google ที่ทำคะแนนได้เพียง 91.7 คะแนน

การใช้เทคนิคการประเมินความเชื่อถือได้ในระดับข้อเรียกร้อง (Claim-Level Reliability Assessment) ทำให้คะแนนของ VibeThinker-3B เพิ่มขึ้นไปถึง 97.1 คะแนน ซึ่งแซงหน้าโมเดลอื่น ๆ ที่มีอยู่ในบันทึกสาธารณะ โดยภายในไม่กี่ชั่วโมงหลังจากที่รายงานถูกเผยแพร่ โมเดลนี้ได้รับความสนใจอย่างมากในแพลตฟอร์ม Hugging Face โดยมีการกดถูกใจถึง 130 ครั้ง และ GitHub repository ของโมเดลนี้ได้รับดาวถึง 685 ดวง

อย่างไรก็ตาม ความตื่นเต้นนี้ไม่ได้เกิดขึ้นกับทุกคน ในโซเชียลมีเดียมีผู้ใช้หลายคนแสดงความสงสัยเกี่ยวกับความถูกต้องของผลการทดสอบ โดยเฉพาะอย่างยิ่งเมื่อมีผู้ใช้คนหนึ่งใน X ตั้งคำถามว่า “เกิดอะไรขึ้นกับ AI?” โดยระบุว่าโมเดลที่มีเพียง 3 พันล้านพารามิเตอร์นี้สามารถทำคะแนนได้เทียบเท่ากับ Claude Opus 4.5 ซึ่งสร้างความสงสัยว่าผลการทดสอบเหล่านี้มีความหมายจริงหรือไม่

ความตึงเครียดนี้ระหว่างการพัฒนาทางวิทยาศาสตร์ที่แท้จริงและความสงสัยที่เพิ่มขึ้นเกี่ยวกับความสามารถในการเล่นเกมของมาตรฐาน AI เป็นสิ่งที่ทำให้เกิดการถกเถียงกันในวงการ AI อย่างต่อเนื่อง การที่โมเดลขนาดเล็กสามารถทำคะแนนได้สูงเช่นนี้อาจทำให้เกิดการตั้งคำถามเกี่ยวกับความถูกต้องและความน่าเชื่อถือของการประเมินผลในวงการ AI ซึ่งอาจส่งผลกระทบต่อวิธีการที่นักวิจัยและองค์กรต่าง ๆ ใช้ในการประเมินโมเดลในอนาคต

การพัฒนา VibeThinker-3B อาจเป็นการเปลี่ยนแปลงที่สำคัญในวงการ AI โดยเฉพาะอย่างยิ่งในด้านความสามารถในการประมวลผลภาษาและการคิดเชิงเหตุผล ซึ่งอาจทำให้เกิดการเปลี่ยนแปลงในวิธีการที่นักพัฒนาและนักวิจัยมองเห็นและใช้ AI ในการแก้ปัญหาที่ซับซ้อนมากขึ้นในอนาคต


แหล่งข้อมูลอ้างอิง

บทความนี้สรุปและเขียนใหม่โดยทีมบรรณาธิการ อ้างอิงจาก michael.nunez@venturebeat.com (Michael Nuñez) ตามลิงก์ต้นฉบับด้านล่าง

อ่านต้นฉบับ: Why Weibo’s tiny VibeThinker-3B has the AI world arguing over benchmarks again

#Weibo #VibeThinker-3B #AI benchmarks #Machine Learning #Natural Language Processing