ทำไม HBM ถึงกลายเป็นหน่วยความจำตัวสำคัญ ที่ช่วยให้ชิป AI ทำงานได้เต็มกำลัง
ชิป AI เร็วแค่ไหน ก็แพ้คอขวดข้อมูลได้
ลองนึกภาพ GPU หรือชิปเร่ง AI เป็นครัวที่มีพ่อครัวนับพันคนพร้อมทำอาหารพร้อมกัน ปัญหาไม่ใช่ว่าพ่อครัวช้า แต่เป็นวัตถุดิบส่งมาไม่ทัน ต่อให้เพิ่มจำนวนหน่วยคำนวณอีกเท่าไร ถ้าต้องยืนรอข้อมูล ประสิทธิภาพที่ซื้อมาแพงก็หายไปตรงนั้น นี่คือเหตุผลที่ชื่อ HBM หรือ High Bandwidth Memory โผล่คู่กับชิป AI ระดับสูงแทบตลอดเวลา
HBM ต่างจากแรมที่คุ้นเคยตรงไหน
แรมทั่วไปมักวางชิปกระจายอยู่บนแผงแล้วส่งข้อมูลผ่านเส้นทางที่ค่อนข้างแคบ HBM เลือกอีกทาง คือเอา DRAM หลายชั้นมาซ้อนในแนวตั้ง แล้ววางหน่วยความจำไว้ใกล้ชิปประมวลผลมากขึ้น จุดเด่นจึงไม่ใช่การเร่งสัญญาณเส้นเดียวให้สุด แต่เป็นการเปิดทางให้ข้อมูลวิ่งพร้อมกันจำนวนมหาศาล
คำสำคัญคือ แบนด์วิดท์ ไม่ใช่แค่ความเร็วสัญญาณ
HBM หนึ่งสแตกสามารถมีอินเทอร์เฟซกว้างมาก ตัวอย่าง HBM รุ่นก่อน HBM4 ใช้อินเทอร์เฟซระดับ 1,024 บิต ขณะที่ HBM4 ขยายเป็น 2,048 บิตในมาตรฐานรุ่นใหม่ แนวคิดเหมือนเปลี่ยนจากถนนไม่กี่เลนที่รถทุกคันต้องวิ่งเร็วมาก ไปเป็นทางด่วนหลายสิบเลนที่ขนของพร้อมกันได้เยอะกว่า ผลคือชิปประมวลผลได้รับค่าน้ำหนักของโมเดล ข้อมูลอินพุต และผลลัพธ์ระหว่างชั้นคำนวณได้ต่อเนื่องขึ้น
แล้วชิปหลายชั้นเชื่อมกันยังไง
พระเอกอยู่ที่เทคโนโลยี TSV หรือ Through-Silicon Via ซึ่งสร้างทางเชื่อมแนวตั้งผ่านเนื้อซิลิคอน ทำให้ข้อมูลและสัญญาณไฟฟ้าเดินระหว่างชั้นได้โดยไม่ต้องอ้อมออกด้านข้างเหมือนแพ็กเกจแบบเก่า นึกภาพลิฟต์ที่เจาะทะลุทุกชั้นของอาคาร แทนการให้คนลงบันไดไปชั้นล่างแล้วเดินอ้อมกลับขึ้นมาใหม่
แต่การซ้อนชิปไม่ใช่แค่เอาแผ่น DRAM มาวางทับกันแล้วจบ แต่ละชั้นต้องบางมาก ตำแหน่งเชื่อมต่อจำนวนมากต้องตรงกัน การบอนดิ้งต้องแม่น ความร้อนต้องถูกจัดการ และถ้าชิปบางชั้นมีตำหนิ ความเสียหายอาจลากไปถึงสแตกทั้งชุดได้ นี่ทำให้ HBM มีต้นทุนด้านการผลิตและแพ็กเกจสูงกว่าแรมธรรมดาอย่างเห็นได้ชัด
จุดที่คนมักเข้าใจผิดคือ HBM ไม่ได้ทำให้การคำนวณฉลาดขึ้นเอง
โมเดลจะเก่งหรือไม่ยังขึ้นกับสถาปัตยกรรม อัลกอริทึม ข้อมูลฝึก และกำลังประมวลผล สิ่งที่ HBM ทำคือช่วยลดช่วงเวลาที่หน่วยคำนวณต้องรอข้อมูล งาน AI หลายชนิดต้องคูณเมทริกซ์จำนวนมหาศาล และต้องดึงพารามิเตอร์หรือข้อมูลกลางเข้าออกตลอด ถ้าหน่วยความจำส่งไม่ทัน หน่วยคำนวณที่แรงมากก็กลายเป็นเครื่องยนต์ที่น้ำมันไหลมาไม่พอ
HBM เคยเป็นของเฉพาะทาง ก่อน AI จะดันขึ้นเวทีใหญ่
ปี 2015 AMD เปิดตัว Radeon R9 Fury X ซึ่งเป็นการ์ดกราฟิกรุ่นแรกที่บริษัทนำ HBM มาใช้เชิงพาณิชย์ เทคโนโลยีนี้ตอนนั้นเด่นเรื่องแบนด์วิดท์สูงและพื้นที่แพ็กเกจที่กะทัดรัด ต่อมาเมื่อการประมวลผลแบบขนานโตขึ้น ทั้งงานซูเปอร์คอมพิวเตอร์ การเรียนรู้ของเครื่อง และโมเดลภาษาขนาดใหญ่ ความต้องการขนข้อมูลระหว่างหน่วยความจำกับตัวเร่ง AI ก็เพิ่มแบบก้าวกระโดด HBM จึงเปลี่ยนจากของแรงสำหรับตลาดเฉพาะมาเป็นชิ้นส่วนยุทธศาสตร์ของศูนย์ข้อมูล
ตัวเลขทำให้เห็นภาพชัดขึ้น Micron ระบุว่า HBM4 ของตนใช้อินเทอร์เฟซ 2,048 บิต และให้แบนด์วิดท์มากกว่า 2.8 เทราไบต์ต่อวินาทีต่อหนึ่งสแตก ตัวเลขระดับนี้ไม่ได้หมายความว่าไฟล์ขนาด 2.8 เทราไบต์จะถูกเปิดเสร็จในหนึ่งวินาที เพราะการใช้งานจริงยังขึ้นกับระบบทั้งหมด แต่มันบอกขนาดของทางด่วนข้อมูลที่ชิป AI สามารถใช้ได้
ทำไมไม่ใส่ HBM ให้คอมทุกเครื่องไปเลย
เพราะของแบบนี้แพงและซับซ้อนเกินความจำเป็นสำหรับงานทั่วไป HBM ต้องอาศัยแพ็กเกจขั้นสูง การวางหน่วยความจำใกล้ตัวประมวลผลมาก การเชื่อมต่อจำนวนมาก รวมถึงการจัดการความร้อนและผลผลิตจากโรงงานที่เข้มงวดกว่า เครื่องพีซีสำนักงานที่เปิดเว็บ พิมพ์งาน หรือเล่นวิดีโอไม่ได้ต้องการแบนด์วิดท์ระดับเดียวกับตัวเร่ง AI ราคาสูงสำหรับศูนย์ข้อมูล
• งานที่คำนวณหนักแต่ข้อมูลน้อย อาจไม่ได้ประโยชน์จาก HBM เต็มที่
• งาน AI ขนาดใหญ่ มักได้ประโยชน์มาก เพราะต้องเคลื่อนย้ายข้อมูลมหาศาลตลอดเวลา
• ความจุยังสำคัญพอๆ กับความเร็ว โมเดลใหญ่ขึ้น ค่าน้ำหนักของโมเดลและแคชต่างๆ ก็กินหน่วยความจำเพิ่ม
• พลังงานต่อบิตมีผลกับศูนย์ข้อมูล เพราะการย้ายข้อมูลเองกินไฟไม่น้อย โดยเฉพาะเมื่อทำซ้ำระดับมหาศาล
จุดน่าสนใจของยุค AI จึงไม่ใช่การแข่งขันว่าใครสร้างหน่วยคำนวณได้มากที่สุดอย่างเดียว แต่คือใครป้อนข้อมูลให้หน่วยคำนวณเหล่านั้นได้ทันด้วย ทุกครั้งที่เห็นชิป AI รุ่นใหม่มี HBM วางเรียงอยู่รอบตัวประมวลผล ภาพนั้นกำลังบอกตรงๆ ว่าโลกคอมพิวเตอร์มาถึงช่วงที่ การขนข้อมูลเร็วพอ สำคัญพอๆ กับการคำนวณเร็ว และพื้นที่ไม่กี่ตารางเซนติเมตรบนแพ็กเกจอาจเป็นตัวตัดสินว่าชิปทั้งระบบจะวิ่งได้เต็มกำลังหรือยืนรอข้อมูลอยู่เฉยๆ
https://www.micron.com/products/memory/hbm
https://www.micron.com/products/memory/hbm/hbm4
https://ir.amd.com/news-events/press-releases/detail/619/amd-ushers-in-a-new-era-of-pc-gaming-with-radeontm-r9-and-r7-300-series-graphics-line-up-including-worlds-first-graphics-family-with-revolutionary-hbm-technology
https://news.skhynix.com/sk-hynix-completes-worlds-first-hbm4-development-and-readies-mass-production/
สถิติหวยออก ย้อนหลัง 10 ปี เลขท้าย 2 ตัว งวด 16 สิงหาคม
ป่าหิมพานต์อยู่ที่ไหน? คำตอบไม่ได้อยู่บนแผนที่ แต่ซ่อนอยู่ในจักรวาลคติของคนโบราณ
เสียงแรกของโลกที่มนุษย์บันทึกไว้คืออะไร? ย้อนฟังเสียงจากปี 1860
สีเสื้อประจำวันมาจากไหน? ทำไมวันจันทร์ต้องสีเหลือง วันอังคารต้องสีชมพู
จังหวัดที่มีคนญี่ปุ่นอาศัยอยู่มากที่สุดในประเทศไทย
เลขท้าย 2 ตัวที่ออกเพียงครั้งเดียวในรอบ 20 ปี
ส่องเลข 'วิ่งตาม' เลขท้ายงวดก่อน ก่อน 16 ส.ค. 69 — หาความสัมพันธ์ผสมการคำนวณและสัญญาณ
ทำไมคนไทยไม่นิยมเอาคำบางคำมาตั้งชื่อลูก? เบื้องหลังชื่อที่ “ฟังแล้วไม่อยากใช้”
5 สำนัก เลขตรงกัน “5” ตัวเดียว งวด 16 ส.ค. 69
รูเล็กๆ ที่หน้ากล้องวงจรปิด เคยสังเกตกันไหมมีไว้ทำไม
10 โรงเรียนที่ขึ้นชื่อว่าสอบเข้ายากที่สุด
แหลม เพื่อนสนิทชาวมาเลเซีย บินด่วนร่วมงานศพ ฮลุน ยืนยันร่วมเป็นเจ้าภาพสวดอภิธรรม 9 ส.ค. นี้
"แอร์ไม่เย็น... อย่าเพิ่งโทษน้ำยา! ความลับที่ช่างแอร์(บางคน) ไม่เคยบอกคุณ"
ทำไมสตาร์ตอัปอเมริกันเกือบ 200 บริษัท ถึงค้านการปิดกั้น AI จากจีน
จากโทรศัพท์ก้อนอิฐ สู่สมาร์ตโฟน เครื่องเล็กที่เปลี่ยนทั้งการคุย การทำงาน การซื้อของ และการใช้ชีวิต
วันที่เอไอสหรัฐเจาะระบบจริง และทีมป้องกันกลับต้องใช้โมเดลจีนช่วยวิเคราะห์
Harman Kardon ไม่ได้หายไปไหน แต่กลายเป็นหมากสำคัญของอาณาจักร Samsung