Google's Gemini 3 Deep Think ยกระดับครั้งใหญ่: ความสามารถในการวิเคราะห์เปรียบเทียบกับ Opus 4.6, GPT-5.2 เพื่อเป็น "AI ที่เก่งด้านงานวิจัยมากที่สุด"

動區BlockTempo
BTC-2.41%

กูเกิลประกาศอัปเดตใหญ่ Gemini 3 Deep Think ในวันที่ 13 โดยในชุดทดสอบ ARC-AGI-2 ซึ่งเป็นการทดสอบเชิงตรรกะที่เน้นความสามารถในการสรุปกฎเกณฑ์จากตัวอย่างหลายๆ ตัว Gemini 3 Deep Think ทำได้ถึง 84.6% ซึ่งสูงกว่าคู่แข่งอย่าง Claude Opus 4.6 (68.8%) และ GPT-5.2 (52.9%) อย่างมาก พร้อมทั้งยังได้ระดับ “ปรมาจารย์ตำนาน” ใน Codeforces
(เรื่องราวก่อนหน้า: การเรียนรู้ของ ChatGPT เปิดตัว: ยามรุ่งอรุณของครูสอนพิเศษ หรือยุคทองของการศึกษา?)
(ข้อมูลเสริม: กูเกิลเปิดตัวอย่างเป็นทางการ “Gemini 3”! ขึ้นเป็น AI ที่ฉลาดที่สุดในโลก จุดเด่นคืออะไร?)

สารบัญบทความ

  • ไม่ใช่แค่สอบได้ ยังจับผิดมนุษย์ได้ด้วย
  • การเปลี่ยนแปลงของส่วนแบ่งตลาด
  • ผลกระทบต่ออุตสาหกรรมคริปโต
  • การเริ่มต้นของยุทธศาสตร์วิทยาศาสตร์

กูเกิลในวันนี้ (13) ได้ประกาศอัปเกรดครั้งสำคัญของ Gemini 3 Deep Think ในชุดทดสอบ ARC-AGI-2 ซึ่งเป็นการทดสอบเชิงตรรกะที่เน้นความสามารถในการสรุปกฎเกณฑ์จากตัวอย่างหลายๆ ตัว Gemini 3 Deep Think ทำคะแนนได้ถึง 84.6%

เพื่อเปรียบเทียบ Claude Opus 4.6 (ในโหมด Thinking Max) ได้ 68.8% และ GPT-5.2 (ในโหมด Thinking xhigh) ได้ 52.9% ในขณะที่มนุษย์เฉลี่ยอยู่ที่ประมาณ 60%

ที่น่าทึ่งยิ่งกว่านั้น ในชุดทดสอบ ARC-AGI-1 รุ่นเดิม Deep Think ทำได้ถึง 96% ซึ่งถือเป็นการผลักดันขีดจำกัดของการทดสอบที่เคยถูกมองว่าเป็น “หนึ่งในข้อสอบที่ยากที่สุดของ AI” ไปจนถึงเพดานสูงสุด

Deep Think ขณะนี้เปิดให้สมาชิก Google AI Ultra ใช้งานผ่าน API สำหรับองค์กรในช่วงเบต้าแรก

ไม่ใช่แค่สอบได้ ยังจับผิดมนุษย์ได้ด้วย

นอกจากผลคะแนนแล้ว กูเกิลยังเผยรายละเอียดว่า Deep Think สามารถตรวจพบข้อผิดพลาดเชิงตรรกะในบทความวิชาการคณิตศาสตร์ที่ผ่านการรีวิวโดยเพื่อนนักวิจัย ซึ่งบทความนี้ได้รับการยืนยันจากนักคณิตศาสตร์จากมหาวิทยาลัย Rutgers

ความสำคัญของกรณีนี้อยู่ที่มันไม่ใช่แค่การแสดงความสามารถในข้อสอบมาตรฐาน แต่เป็นการแสดงความสามารถในสถานการณ์วิทยาศาสตร์จริง การรีวิวโดยเพื่อนนักวิจัยเป็นกลไกควบคุมคุณภาพที่สำคัญที่สุดในวงการวิชาการ หาก AI สามารถสนับสนุนในกระบวนการนี้อย่างมั่นคง มันจะเร่งรัดการวิจัยทางวิทยาศาสตร์ได้มากกว่าการวัดผลคะแนนใดๆ

Deep Think ยังสามารถทำคะแนนระดับเหรียญทองในข้อสอบเขียนของโอลิมปิกฟิสิกส์และเคมีระดับนานาชาติในปี 2025 โดยมีคะแนน Elo ใน Codeforces อยู่ที่ 3,455 ซึ่งเทียบเท่ากับ “ปรมาจารย์ตำนาน” ระดับโลก ซึ่งมีนักเขียนโปรแกรมมนุษย์เพียงไม่กี่คนเท่านั้นที่สามารถไปถึงระดับนี้ได้

และใน “การสอบสุดท้ายของมนุษยชาติ” ซึ่งเป็นข้อสอบที่ออกแบบโดยผู้เชี่ยวชาญจากหลายสาขา เพื่อให้ AI ทำได้ยากที่สุด Deep Think ก็ทำได้ 48.4% (โดยไม่ใช้เครื่องมือเสริม) ซึ่งเป็นสถิติใหม่

การเปลี่ยนแปลงของส่วนแบ่งตลาด

การแข่งขันด้านเทคโนโลยีของบริษัทยักษ์ใหญ่ด้าน AI กำลังเปลี่ยนแปลงภาพรวมตลาดอย่างรวดเร็ว ส่วนแบ่งตลาดของ ChatGPT ลดลงจากจุดสูงสุด 87% เหลือประมาณ 68% ขณะที่ Gemini ขึ้นมาเกิน 18% จากน้อยกว่า 5% และ Claude ของ Anthropic ก็ยังคงแย่งชิงตลาดระดับองค์กรอย่างต่อเนื่อง

จุดแข็งของกูเกิลในเกมนี้คือความสามารถในการกระจายสินค้า Gemini ถูกฝังอยู่ในระบบ Android เบราว์เซอร์ Chrome Google Workspace และเครื่องมือค้นหา ซึ่งหมายความว่าแม้ความสามารถของโมเดลจะเทียบเท่าคู่แข่ง แต่กูเกิลก็สามารถใช้ช่องทางการเข้าถึงเพื่อดึงดูดผู้ใช้ได้

แต่ข้อได้เปรียบด้านการกระจายสินค้าก็เป็นดาบสองคม หากประสบการณ์ใช้งาน Gemini ไม่ดีพอ ก็อาจทำให้เสียความเชื่อมั่นของผู้ใช้ได้เร็วกว่าใคร เพราะผู้ใช้เป็น “ผู้รับ” ที่ไม่ได้เลือกเอง ในขณะที่ผู้ใช้ของ OpenAI เป็นกลุ่มที่จ่ายเงินเอง จึงมีความอดทนและความผูกพันสูงกว่า

ผลกระทบต่ออุตสาหกรรมคริปโต

ทุกครั้งที่มีการอัปเกรดในสงครามอาวุธ AI ความต้องการโครงสร้างพื้นฐานด้านการคำนวณก็จะเพิ่มขึ้น ค่าใช้จ่ายในการฝึกโมเดลระดับแนวหน้าก็พุ่งสูงจากหลักร้อยล้านดอลลาร์ในปี 2024 ไปสู่หลักพันล้านในปี 2026 ซึ่งส่งผลต่อสองเรื่องหลัก

เรื่องแรก: การเปลี่ยนแปลงของเหมืองบิทคอยน์ เมื่อกำไรจากการขุดลดลง (เช่น มอร์แกน สแตนลีย์ คาดการณ์ว่าต้นทุนการผลิต BTC อยู่ที่ 77,000 ดอลลาร์ ขณะที่ราคาบิทคอยน์อยู่ราว 66,000 ดอลลาร์) เหมืองขนาดใหญ่ที่มีโครงสร้างพื้นฐานด้านคำนวณจำนวนมากก็เริ่มเปลี่ยนไปให้บริการด้าน AI แทน

ไม่ใช่การ “ถอนตัว” แต่เป็น “เปลี่ยนสายงาน” จากการขุดบิทคอยน์เป็นการให้บริการสัญญาเช่าใช้พลังคำนวณ AI

เรื่องที่สอง: การเล่าเรื่องของโทเคน AI ทุกครั้งที่กูเกิล, OpenAI หรือ Anthropic เปิดตัวอัปเกรดสำคัญ โทเคนที่เกี่ยวข้องกับ AI บนบล็อกเชน เช่น สัญญาเช่าใช้การคำนวณแบบกระจายศูนย์ ก็จะมีการเก็งกำไรระยะสั้น

แต่พื้นฐานของโทเคนเหล่านี้ยังคงมีปัญหาอยู่ คือ การคำนวณแบบกระจายศูนย์ในด้านดีเลย์และความสามารถในการรับส่งข้อมูล ยังห่างไกลจากความต้องการของการฝึก AI ระดับองค์กรอยู่มาก เรื่องราวอาจวิ่งเร็ว แต่โครงสร้างพื้นฐานยังตามไม่ทัน

การเริ่มต้นของยุทธศาสตร์วิทยาศาสตร์

การอัปเกรดของ Deep Think ทำให้กูเกิลกลับมาอยู่ในตำแหน่งผู้นำในการแข่งขัน AI อย่างน้อยในด้านการสรุปเชิงตรรกะและวิทยาศาสตร์ แต่ถ้าสังเกตคำประกาศของกูเกิลอย่างละเอียด จะพบว่ามีการเปลี่ยนทิศทางเล็กน้อยจากการเน้น “AI ที่ฉลาดที่สุด” ไปเป็น “AI ที่เกิดมาเพื่อวิทยาศาสตร์”

เมื่อข้อสอบมาตรฐานของ AI ยิ่งเต็มไปด้วยความแออัดและความแตกต่างยากขึ้น การอ้างว่า “AI ของฉันช่วยทำวิจัยทางวิทยาศาสตร์” กลายเป็นข้อเสนอที่น่าดึงดูดมากกว่าการเน้น “คะแนนสูงสุดในข้อสอบ” หาก Deep Think สามารถสนับสนุนการตรวจสอบโดยเพื่อนนักวิจัยอย่างมั่นคง เร่งการค้นพบยา หรือช่วยในโมเดลฟิสิกส์ที่มนุษย์มองข้าม ก็จะเป็นคุณค่าที่สำคัญกว่าการจัดอันดับในตารางคะแนนเสียอีก

คำถามคือ จาก “สามารถทำคะแนนสูงในข้อสอบ” ไปสู่ “สามารถสนับสนุนงานวิจัยทางวิทยาศาสตร์ในสถานการณ์จริง” ระยะห่างอาจไกลกว่าที่กูเกิลบอกไว้ เพราะข้อสอบมีคำตอบแน่นอน แต่ในวิทยาศาสตร์ไม่มีเสมอไป

ดูต้นฉบับ
news.article.disclaimer

btc.bar.articles

新台幣穩定幣應用場景待釐清!兆豐金實測:大額跨境匯款「銀行仍佔優」

兆豐銀行進行穩定幣與傳統銀行跨境匯款的比較實測。結果顯示,穩定幣在小額匯款上速度快且成本較低,但當金額超過約7,000美元時,銀行的成本優勢明顯。穩定幣跨境匯款受到多國監管限制影響,實際應用場景仍需探討。董瑞斌強調傳統銀行在資金清算與合規管理上具有不可取代的基礎設施。

区块客9 นาที ที่แล้ว

貝萊德「以太幣質押 ETF」重磅登場!上市首日成交額破 1,550 萬美元

貝萊德推出的「iShares 質押型以太幣信託 ETF(ETHB)」首日交易額突破1,550萬美元,成為機構資金進駐以太坊的里程碑。此ETF持有以太幣並進行質押,提供投資者價格波動及質押獎勵。ETHB預計將70%至95%的以太幣投入質押,82%的收益按月分配給持有者。

区块客1 ชั่วโมง ที่แล้ว

Strategy 本周或购入超 3 万枚 BTC,下一目标 80 万枚

Gate News 消息,3 月 14 日,据 MSTR 分析师透露,Michael Saylor 旗下的 Strategy(MicroStrategy)仅在本周或购入超过 3 万枚 BTC,公司下一个目标为持有 80 万枚 BTC。

GateNews1 ชั่วโมง ที่แล้ว

USDC 市值逼近 800 亿美元历史高位,稳定币总市值一周增长 0.93%

当前全网稳定币总市值为3159亿美元,USDC市值接近800亿美元。迪拜房价下跌27%,地产指数跌31%。阿联酋资本外流助推USDC需求增长,部分房产卖家开始接受加密货币付款,并提供折扣。

GateNews1 ชั่วโมง ที่แล้ว

对冲基金对布伦特原油看涨程度达2020年以来最高水平

3月14日,对冲基金对布伦特原油的看涨程度达到六年最高,净多头头寸增至351,032手。中东冲突导致霍尔木兹海峡交通停滞,供应中断,迫使主要生产国减产,期权交易受到影响。

GateNews2 ชั่วโมง ที่แล้ว

美国 SOL 现货 ETF 单日净流入 759.64 万美元

3月13日,美国SOL现货ETF单日净流入759.64万美元,主要由Bitwise Solana Staking ETF贡献。该ETF历史总净流入已达7.82亿美元,总资产净值为8.55亿美元。

GateNews3 ชั่วโมง ที่แล้ว
แสดงความคิดเห็น
0/400
ไม่มีความคิดเห็น