
เมื่อวันอาทิตย์ที่ผ่านมา ทีมวิจัยจำนวน 9 คนจาก Sina Weibo ซึ่งเป็นแพลตฟอร์มโซเชียลมีเดียที่มีชื่อเสียงในจีน ได้เผยแพร่รายงานทางเทคนิคความยาว 14 หน้าใน arXiv ที่สร้างความตื่นเต้นในวงการวิจัย AI โดยพวกเขาอ้างว่าโมเดลภาษาที่มีพารามิเตอร์เพียง 3 พันล้านตัวสามารถทำคะแนนการวิเคราะห์ได้เทียบเท่าหรือแม้กระทั่งสูงกว่าโมเดลชั้นนำจาก Google DeepMind, OpenAI, Anthropic และ DeepSeek ที่มีขนาดใหญ่กว่าหลายร้อยเท่า โมเดลนี้มีชื่อว่า VibeThinker-3B ซึ่งทำคะแนนได้ 94.3 ในการสอบ AIME 2026 (American Invitational Mathematics Examination) ซึ่งเป็นการแข่งขันคณิตศาสตร์ที่มีมาตรฐานสูงที่สุดในโลก ผลคะแนนนี้ทำให้มันอยู่ในระดับเดียวกับ DeepSeek V3.2 ซึ่งมีพารามิเตอร์ 671 พันล้านตัว และยังสูงกว่า Gemini 3 Pro ของ Google ที่ทำคะแนนได้ 91.7
ทีมงานได้ใช้เทคนิคการทดสอบที่เรียกว่า Claim-Level Reliability Assessment ซึ่งช่วยเพิ่มคะแนนของโมเดลขึ้นไปถึง 97.1 ทำให้ VibeThinker-3B สามารถเอาชนะระบบอื่น ๆ ที่มีอยู่ในบันทึกสาธารณะได้อย่างมีนัยสำคัญ ภายในไม่กี่ชั่วโมงหลังจากการเผยแพร่เอกสารนี้ มันได้รับการโหวต 62 ครั้งในฟีดเอกสารประจำวันของ Hugging Face และโมเดลนี้ยังสะสม 130 ไลค์ในที่เก็บข้อมูลของ GitHub และได้รับดาว 685 ดวงจากผู้ใช้อีกด้วย
อย่างไรก็ตาม การตอบสนองในโซเชียลมีเดียกลับไม่เป็นไปในทางที่ดีเสมอไป หลายคนแสดงความสงสัยต่อความถูกต้องและความน่าเชื่อถือของผลการทดสอบนี้ โดยผู้ใช้งานคนหนึ่งใน X ได้ตั้งคำถามว่า “เกิดอะไรขึ้นในวงการ AI?” และยังมีการพูดคุยกันอย่างกว้างขวางเกี่ยวกับความเป็นไปได้ที่การทดสอบเหล่านี้อาจถูกปรับเปลี่ยนเพื่อให้ได้ผลลัพธ์ที่ต้องการ ซึ่งสะท้อนให้เห็นถึงความตึงเครียดระหว่างความก้าวหน้าทางวิทยาศาสตร์ที่แท้จริงและความสงสัยที่เพิ่มขึ้นว่าเกณฑ์การทดสอบ AI อาจถูกทำให้ไร้ความหมายไปแล้ว
การพัฒนา VibeThinker-3B ของ Weibo อาจเป็นตัวอย่างที่แสดงให้เห็นถึงความสามารถในการแข่งขันในวงการ AI แม้จะมีขนาดเล็กกว่า แต่การที่มันสามารถทำคะแนนได้สูงในเกณฑ์การทดสอบที่มีชื่อเสียงทำให้เกิดการถกเถียงกันอย่างกว้างขวางในวงการวิจัย AI ว่าควรให้ความสำคัญกับโมเดลที่มีขนาดใหญ่เพียงอย่างเดียวหรือไม่ และทำให้เกิดคำถามเกี่ยวกับความน่าเชื่อถือของเกณฑ์การทดสอบที่มีอยู่ในปัจจุบัน โดยเฉพาะเมื่อโมเดลที่มีขนาดเล็กกว่าสามารถแสดงผลลัพธ์ที่น่าพอใจได้เช่นนี้
แหล่งข้อมูลอ้างอิง
บทความนี้สรุปและเขียนใหม่โดยทีมบรรณาธิการ อ้างอิงจาก michael.nunez@venturebeat.com (Michael Nuñez) ตามลิงก์ต้นฉบับด้านล่าง
อ่านต้นฉบับ: Why Weibo’s tiny VibeThinker-3B has the AI world arguing over benchmarks again
#Weibo #VibeThinker-3B #AI #Benchmark #DeepMind #OpenAI