AI เข้าใจสิ่งที่เราพูดได้อย่างไร
เวลาเราพูดกับโทรศัพท์ว่า “พรุ่งนี้ฝนตกไหม” แล้วมันตอบกลับมาได้ตรงคำถาม ความรู้สึกแรกคือ AI คงฟังภาษาไทยออกและเข้าใจเราเหมือนคนอีกคน แต่สิ่งที่เกิดอยู่ข้างในไม่ได้เริ่มจากการฟังเป็นคำ ไม่ได้มีใครตัวจิ๋วนั่งแปลประโยค และไม่ได้เข้าใจด้วยประสบการณ์ชีวิตแบบมนุษย์ มันเป็นกระบวนการหลายชั้นที่เปลี่ยนเสียงให้กลายเป็นตัวเลข แล้วใช้รูปแบบที่เรียนรู้มาเพื่อคาดเดาว่าเรากำลังสื่ออะไร
ขั้นแรกต้องแยกก่อนว่าเราพิมพ์หรือเราพูด ถ้าพิมพ์ ข้อความก็เข้าสู่ระบบได้โดยตรง แต่ถ้าพูด ไมโครโฟนจะรับแรงสั่นสะเทือนของอากาศมาเป็นสัญญาณเสียง สัญญาณนี้มีทั้งเสียงคน เสียงพัดลม เสียงรถ และจังหวะเงียบ ระบบรู้จำเสียงพูดจึงต้องวิเคราะห์ลักษณะของเสียงตามช่วงเวลา แล้วหาลำดับคำที่มีโอกาสตรงกับเสียงนั้น เช่น เสียง “ไข่” กับ “ไก่” อาจใกล้กัน แต่คำรอบข้างช่วยชี้ว่าประโยคน่าจะหมายถึงอะไร
การรู้จำเสียงจึงไม่เหมือนเครื่องอัดเสียงที่เพียงเก็บคลื่นไว้ มันต้องผ่านการฝึกจากตัวอย่างเสียงกับข้อความจำนวนมาก เพื่อเรียนรู้ความสัมพันธ์ระหว่างเสียงพูด หน่วยเสียง คำ สำเนียง และบริบท เมื่อแปลงสำเร็จ เราจึงได้ข้อความประมาณว่า “พรุ่งนี้ฝนตกไหม” ส่งต่อไปยังโมเดลภาษา หากถอดคำผิดตั้งแต่ชั้นนี้ ความหมายในชั้นถัดไปก็อาจผิดตามไปด้วย นี่เป็นเหตุผลว่าทำไมเสียงรบกวน สำเนียงที่ระบบพบไม่บ่อย หรือชื่อเฉพาะบางชื่อทำให้ผู้ช่วยเสียงตอบคนละเรื่องได้
เมื่อข้อความมาถึงโมเดล มันยังไม่ถูกอ่านเป็นประโยคแบบที่ตาเราเห็น ระบบจะแบ่งข้อความเป็นชิ้นเล็ก ๆ ที่เรียกว่าโทเคน ชิ้นหนึ่งอาจเป็นคำเต็ม ส่วนของคำ เครื่องหมาย หรืออักขระบางชุด ภาษาไทยซึ่งเขียนคำติดกันและมีรูปแบบการเว้นวรรคต่างจากภาษาอังกฤษ อาจถูกแบ่งเป็นหลายชิ้นตามตัวแบ่งคำของแต่ละโมเดล จากนั้นโทเคนแต่ละชิ้นจะถูกแทนด้วยหมายเลข เพราะโครงข่ายประสาทคำนวณกับตัวเลข ไม่ได้จับตัวอักษรไปคิดโดยตรง
หมายเลขเหล่านี้ไม่ได้มีไว้เรียงลำดับคำอย่างเดียว แต่จะถูกแปลงเป็นเวกเตอร์หรือชุดตัวเลขหลายมิติที่เรียกว่า embedding ระหว่างการฝึก ระบบจะปรับตัวเลขเหล่านี้จนคำหรือข้อความที่ใช้ในบริบทคล้ายกันมีความสัมพันธ์กันในพื้นที่คณิตศาสตร์ จึงพอแยกได้ว่า “แมว” เกี่ยวข้องกับสัตว์ ส่วน “ฝน” เกี่ยวข้องกับสภาพอากาศ ที่สำคัญคือความหมายของคำหนึ่งคำขึ้นกับคำรอบข้างด้วย เช่น “ธนาคาร” ในประโยคเรื่องฝากเงินกับ “ธนาคารเวลา” ในบริบทเฉพาะย่อมต้องตีความจากข้อความประกอบ ไม่ใช่ดูคำเดี่ยว ๆ
หัวใจของโมเดลภาษาสมัยใหม่จำนวนมากคือสถาปัตยกรรม Transformer ซึ่งใช้กลไก attention ให้แต่ละตำแหน่งในข้อความชั่งน้ำหนักว่าควรสนใจคำอื่นตำแหน่งไหน ประโยคว่า “น้องวางแก้วบนโต๊ะเพราะมันเปียก” คำว่า “มัน” อาจกำกวม ระบบจึงอาศัยคำทั้งหมดและรูปแบบที่เคยเรียนรู้มาประเมินว่ากำลังอ้างถึงอะไร Attention ไม่ได้เป็นดวงตาหรือสมาธิแบบคน แต่เป็นการคำนวณความสัมพันธ์ระหว่างตัวแทนของโทเคนต่าง ๆ
แล้วมันเรียนรู้มาจากไหน ในช่วงฝึก โมเดลภาษาได้รับข้อความจำนวนมากและทำงานพื้นฐานคล้ายเกมทายคำ เช่น เมื่อเห็นข้อความบางส่วนก็พยายามทำนายโทเคนถัดไป คำตอบที่ทายถูกหรือผิดจะถูกใช้ปรับค่าน้ำหนักภายในเครือข่าย ทำซ้ำมหาศาลจนจับรูปแบบไวยากรณ์ ความสัมพันธ์ของคำ รูปแบบคำถาม และข้อมูลที่ปรากฏในชุดฝึกได้ โมเดลไม่ได้เก็บหนังสือทุกเล่มเป็นตู้เอกสารให้เปิดหน้าเดิมเสมอไป แต่ความรู้จำนวนหนึ่งถูกบีบอยู่ในค่าน้ำหนักและความสัมพันธ์ทางตัวเลข
ตอนเราถาม ระบบจึงไม่ได้ค้นหาคำตอบที่เขียนรอไว้ทุกครั้ง มันคำนวณความน่าจะเป็นของโทเคนที่จะตามมา เลือกคำหนึ่ง แล้วใช้ข้อความทั้งหมดรวมคำที่เพิ่งสร้างเพื่อคาดเดาคำถัดไปต่อกันจนเป็นประโยค การตอบได้ลื่นจึงเกิดจากการทำนายต่อเนื่องที่คำนึงถึงบริบท ไม่ใช่การมีสติอยู่หลังหน้าจอ บางระบบอาจเชื่อมกับเครื่องมือค้นข้อมูล ฐานข้อมูล เครื่องคิดเลข หรือระบบอื่นเพิ่มเติม แต่ส่วนการเรียบเรียงภาษายังคงอาศัยการประมวลผลรูปแบบของโมเดล
คำว่า AI “เข้าใจ” จึงต้องใช้ด้วยความระวัง ถ้าหมายถึงจับเจตนา แยกหัวข้อ เชื่อมคำกับบริบท และตอบกลับได้เหมาะสม มันทำสิ่งเหล่านี้ได้ดีในหลายงาน แต่ถ้าหมายถึงรู้สึกถึงความหมาย มีความทรงจำชีวิต หรือรับรู้โลกแบบมนุษย์ ก็ยังเป็นคนละเรื่อง โมเดลอาจอธิบายความเสียใจได้อย่างเป็นธรรมชาติจากรูปแบบภาษา โดยไม่ได้รู้สึกเสียใจจริง ๆ
จุดที่น่าสนใจคือความคล่องทางภาษาไม่ได้รับประกันว่าข้อเท็จจริงถูกต้อง เมื่อถูกบังคับให้ตอบเรื่องที่ข้อมูลไม่พอ โมเดลอาจสร้างประโยคที่ฟังน่าเชื่อแต่ผิด เพราะหน้าที่พื้นฐานของมันคือสร้างข้อความที่มีแนวโน้มเข้ากับบริบท ไม่ใช่ตรวจความจริงทุกประโยคโดยอัตโนมัติ คำถามที่ชัดเจน การให้ข้อมูลประกอบ การขอแหล่งอ้างอิง และการตรวจเรื่องสำคัญกับแหล่งต้นทาง จึงยังจำเป็น โดยเฉพาะเรื่องสุขภาพ เงิน กฎหมาย และความปลอดภัย
สรุปแบบเห็นภาพ กระบวนการเริ่มจากเสียงถูกแปลงเป็นข้อความ ข้อความถูกแบ่งเป็นโทเคน โทเคนกลายเป็นตัวเลข กลไกในโมเดลเชื่อมความสัมพันธ์ของบริบท แล้วระบบทำนายคำตอบทีละชิ้น สิ่งที่ดูเหมือนการคุยกันง่าย ๆ หนึ่งประโยค จึงมีทั้งการประมวลผลเสียง คณิตศาสตร์ โครงข่ายประสาท และการเรียนรู้จากตัวอย่างซ่อนอยู่ข้างหลัง ความเก่งของ AI ไม่ได้มาจากการได้ยินเหมือนหูคน แต่มาจากการเรียนรู้รูปแบบจนแปลงสิ่งที่เราพูดให้เป็นการคำนวณที่ตอบกลับเป็นภาษาได้
อ้างอิงข้อมูล
https://developers.google.com/machine-learning/crash-course/embeddings
https://developers.google.com/machine-learning/crash-course/llm/transformers
https://platform.openai.com/tokenizer
https://arxiv.org/abs/1706.03762
ลิซ่า-บลู พงศ์ทิวัตถ์ เจอข่าวลือภาพปริศนาที่ลอนดอน ก่อนฝ่ายชายโพสต์แคปชั่นชวนคิด
ฝนระลอกใหม่มาแล้ว 23–27 ก.ย. บ้านใครเริ่มมีน้ำท่วมกันบ้าง?
บางบาลน้ำมาเร็ว ภาพเดียวเห็นชัด น้ำท่วมบ้านเกือบมิดตัวในคืนเดียว
โรงเรียนที่มีนักเรียนมากที่สุดในไทย
5 คณะที่เรียนจบมาแล้ว มีอาชีพรองรับมากกว่าที่คิด
ฮ่องเต้จีนทำไมต้องมี สายลูกปัดบังหน้า เหตุผลแท้จริงไม่ใช่แค่ความสวยงาม
กระจกไม่ได้สลับซ้ายกับขวา — สิ่งที่มันกลับจริง ๆ คืออีกอย่างหนึ่ง
อำเภอที่มีชื่ออำเภอสั้นที่สุด 3 อำเภอเท่านั้นในประเทศไทย
รู้หรือไม่? เปิดรายได้พนักงานส่งพัสดุของแต่ละแอป วันหนึ่งได้เท่าไร
“Greenovia dodrantalis” กุหลาบที่ไม่ได้เกิดจากดอกไม้ แต่เป็นพืชอวบน้ำที่รู้จักวิธีหุบตัวหนีความร้อน
อุโมงค์กัวเลี่ยงที่ชาวบ้านขุดหน้าผาด้วยมือ
5 เมนูอาหารไทยโบราณที่หาทานยาก ชื่อคุ้นหู แต่คนรุ่นใหม่อาจไม่เคยชิม
กบฏไท่ผิงเริ่มจากหงซิ่วฉวนได้อย่างไร
บางบาลน้ำมาเร็ว ภาพเดียวเห็นชัด น้ำท่วมบ้านเกือบมิดตัวในคืนเดียว
อุโมงค์กัวเลี่ยงที่ชาวบ้านขุดหน้าผาด้วยมือ
กระจกไม่ได้สลับซ้ายกับขวา — สิ่งที่มันกลับจริง ๆ คืออีกอย่างหนึ่ง
ฝนระลอกใหม่มาแล้ว 23–27 ก.ย. บ้านใครเริ่มมีน้ำท่วมกันบ้าง?
ดาบโกวเจี้ยนรอดจากกาลเวลาได้อย่างไร



