
เมื่อวันอาทิตย์ที่ผ่านมา ทีมวิจัยจำนวน 9 คนจาก Sina Weibo ซึ่งเป็นบริษัทโซเชียลมีเดียของจีนที่มีชื่อเสียงในด้านแพลตฟอร์มไมโครบล็อกกิ้ง ได้เผยแพร่รายงานทางเทคนิคความยาว 14 หน้าใน arXiv ซึ่งสร้างความตื่นตระหนกในชุมชนการวิจัย AI โดยพวกเขาอ้างว่าโมเดลภาษา VibeThinker-3B ที่มีพารามิเตอร์เพียง 3 พันล้านตัว สามารถทำคะแนนด้านการให้เหตุผลได้เทียบเท่าหรือดีกว่าระบบชั้นนำจาก Google DeepMind, OpenAI, Anthropic และ DeepSeek ที่มีขนาดใหญ่กว่าหลายร้อยเท่า
โมเดลนี้ทำคะแนนได้ 94.3 ในการสอบ AIME 2026 ซึ่งเป็นการแข่งขันคณิตศาสตร์มาตรฐานที่มีความท้าทายสูงที่สุดแห่งหนึ่งในโลก โดยคะแนนนี้ทำให้ VibeThinker-3B อยู่ในระดับเดียวกับ DeepSeek V3.2 ซึ่งมีพารามิเตอร์ 671 พันล้านตัว และดีกว่า Gemini 3 Pro ซึ่งเป็นระบบการให้เหตุผลที่มีประสิทธิภาพสูงจาก Google ที่ทำคะแนนได้ 91.7 นอกจากนี้ ทีมวิจัยยังได้ใช้เทคนิคการปรับขนาดระหว่างการทดสอบที่เรียกว่า Claim-Level Reliability Assessment ซึ่งทำให้คะแนนเพิ่มขึ้นเป็น 97.1 ทำให้มันเป็นโมเดลที่มีคะแนนสูงที่สุดในบันทึกสาธารณะ
หลังจากการเผยแพร่เพียงไม่กี่ชั่วโมง รายงานนี้ได้รับการโหวต 62 ครั้งในฟีดเอกสารประจำวันของ Hugging Face และโมเดลได้สะสม 130 ไลค์ในที่เก็บโมเดล ขณะที่ที่เก็บ GitHub ได้รับดาว 685 ดวง อย่างไรก็ตาม ปฏิกิริยาบนโซเชียลมีเดียกลับไม่เป็นไปในทางบวกเสมอไป โดยมีผู้ใช้คนหนึ่งได้ตั้งคำถามว่า “เกิดอะไรขึ้นกับ AI?” ซึ่งโพสต์นี้มีการเข้าชมมากกว่า 161,000 ครั้ง โดยผู้ใช้ตั้งข้อสงสัยว่าโมเดลที่มีพารามิเตอร์เพียง 3 พันล้านตัวสามารถทำคะแนนได้ในระดับเดียวกับ Claude Opus 4.5 ได้อย่างไร
ความตึงเครียดระหว่างความก้าวหน้าทางวิทยาศาสตร์ที่แท้จริงและความสงสัยที่เพิ่มขึ้นว่าเกณฑ์การทดสอบ AI อาจถูกทำให้สามารถเล่นได้จนถึงจุดที่ไม่มีความหมาย เป็นสิ่งที่อยู่ในใจของนักวิจัยและผู้พัฒนาในวงการ AI ในปัจจุบัน การถกเถียงนี้ทำให้เกิดคำถามเกี่ยวกับความถูกต้องและความน่าเชื่อถือของมาตรฐานการทดสอบที่ใช้ในการประเมินประสิทธิภาพของโมเดล AI ต่างๆ ซึ่งอาจส่งผลกระทบต่อการพัฒนาในอนาคตของเทคโนโลยีนี้
ในเวลานี้ การตอบสนองต่อ VibeThinker-3B ยังคงเป็นที่น่าสนใจในวงการ AI และยังคงมีการติดตามผลการวิจัยและพัฒนาต่อไปในอนาคต เพื่อดูว่าโมเดลนี้จะสามารถพิสูจน์ความสามารถของมันได้อย่างไรในสภาพแวดล้อมที่แข่งขันกันอย่างดุเดือด
แหล่งข้อมูลอ้างอิง
บทความนี้สรุปและเขียนใหม่โดยทีมบรรณาธิการ อ้างอิงจาก michael.nunez@venturebeat.com (Michael Nuñez) ตามลิงก์ต้นฉบับด้านล่าง
อ่านต้นฉบับ: Why Weibo’s tiny VibeThinker-3B has the AI world arguing over benchmarks again
#AI #Weibo #VibeThinker-3B #Benchmark #Machine Learning