การปรับแต่งและการปรับใช้โมเดล AI ขนาดใหญ่: การเลือกและการวางแผนต้นทุนของ Alibaba Cloud GPU/ประเภทคอมพิวเตอร์ประสิทธิภาพสูง
ในช่วงเวลาที่แอพพลิเคชั่น AI รุ่นใหญ่กำลังระเบิดบริษัทและนักพัฒนาจำนวนมากกำลังเผชิญกับปัญหาที่เป็นจริงอย่างยิ่ง:
หลังจากเลือกแบบจำลองแล้วจะสร้างสภาพแวดล้อมการคำนวณได้อย่างไร? ควบคุมต้นทุนอย่างไร?
การปรับแต่งแบบจำลองขนาดใหญ่และการปรับใช้เหตุผลมีข้อกำหนดที่แตกต่างกันอย่างมากสำหรับทรัพยากรฮาร์ดแวร์การเลือกข้อมูลจำเพาะของพลังการคำนวณที่ไม่ถูกต้องอาจเป็นหน่วยความจำวิดีโอล้นโดยตรง (OOM) ของ "รถลากม้าขนาดเล็ก" หรือ "รถลากม้าขนาดใหญ่" ทำให้สิ้นเปลืองพลังงานในการประมวลผลอย่างมาก
จากมุมมองของการต่อสู้จริงบทความนี้จะช่วยให้คุณถอดชิ้นส่วนวิธีการเลือกตัวอย่างการประมวลผล GPU/ประสิทธิภาพสูงที่เหมาะสมที่สุดสำหรับการปรับแต่งและการปรับใช้โมเดลขนาดใหญ่บน Alibaba Cloud และให้คำแนะนำในการหลีกเลี่ยงการวางแผนต้นทุนแบบลงดิน
1.ทำความเข้าใจจุดเจ็บปวดหลักก่อน: ความแตกต่างของข้อกำหนดพลังงานคอมพิวเตอร์ระหว่างการปรับแต่งและการปรับใช้
ก่อนการเลือกเราต้องชี้แจงความแตกต่างของข้อกำหนดฮาร์ดแวร์ระหว่างการปรับแต่งและการปรับใช้
อย่าใช้ความคิดในการปรับใช้เพื่อเลือกพลังการประมวลผลที่ปรับแต่งอย่างละเอียดและในทางกลับกัน
-----------------------------------------------------------------
| การเปรียบเทียบความต้องการฮาร์ดแวร์รุ่นใหญ่ |
-----------------------------------------------------------------
| ฉาก | คอขวดหลัก | ตัวบ่งชี้ฮาร์ดแวร์ที่สำคัญ | ตัวอย่างข้อกำหนดโมเดลทั่วไป |
-------- ----------- -------------------- -------------------------
| การปรับจูน | พลังการประมวลผลหน่วยความจำวิดีโอ | หน่วยความจำวิดีโอขนาดใหญ่แบนด์วิดท์หน่วยความจำวิดีโอสูง | Llama-3-70B, Qwen2-72B |
| การปรับใช้ | ความล่าช้าของหน่วยความจำวิดีโอ | ปริมาณงานสูง, ความล่าช้าต่ำและ IO สูง | DeepSeek-R1-Distill, 7B |
-----------------------------------------------------------------
1.Fine-tuning: ปริมาณหน่วยความจำวิดีโอเป็นคำสุดท้าย
การปรับแต่งอย่างละเอียด (แม้แต่การปรับแต่งแบบเบาๆเช่น LoRA/QLoRA) นอกเหนือจากการบันทึกน้ำหนักของโมเดลในระหว่างขั้นตอนการฝึกอบรมแล้วยังต้องจัดเก็บ
การไล่ระดับสี (Gradients) สถานะเครื่องมือเพิ่มประสิทธิภาพ (Optimizer States) และค่าการเปิดใช้งานระดับกลาง (Activations)
。
การปรับแต่งพารามิเตอร์เต็มรูปแบบ: การใช้หน่วยความจำวิดีโอมักจะเป็น4 ~ ของพารามิเตอร์แบบจำลอง6ครั้ง
LoRA / QLoRA: ลดความต้องการหน่วยความจำวิดีโอลงอย่างมากแต่ยังจำเป็นต้องมีหน่วยความจำวิดีโอเพียงพอ
รองรับส่วนขยายที่นำโดยความยาวบริบท (Context Length)
2.รูปแบบการปรับใช้ (Inference): ปริมาณงานสูงและความล่าช้าต่ำ
การปรับใช้มุ่งเน้นไปที่การจัดการ KV Cache (Key-value cache) และความสามารถพร้อมกันในขั้นตอนการให้เหตุผลแกนหลักคือ
แบนด์วิดท์หน่วยความจำ (Memory Bandwidth) และการใช้พลังงานคอมพิวเตอร์
。เพื่อลดต้นทุนเรามักจะรวมการวัดปริมาณ (เช่น INT4/FP8), vLLM, TGI และกรอบการเร่งความเร็วอื่นๆ
2.คู่มือการเลือก GPU/คอมพิวเตอร์ประสิทธิภาพสูงแบบพาโนรามาของ Alibaba Cloud
การตั้งชื่ออินสแตนซ์ GPU ของ Alibaba Cloud ดูเหมือนจะซับซ้อนแต่ตราบใดที่คุณเข้าใจกฎของตัวอักษรการเลือกก็ชัดเจนมาก:
1.การปรับใช้น้ำหนักเบาและการปรับแต่งแบบจำลองขนาดเล็ก (7B ~ พารามิเตอร์14B)
หากคุณใช้แบบจำลองของพารามิเตอร์7B ถึง14B เป็นหลัก (เช่น Qwen2-7B, Llama-3-8B) หรือการปรับแต่ง QLoRA น้ำหนักเบา:
รุ่นที่ต้องการ: gn7i / gn8is ซีรีส์การกำหนดค่า GPU: โดยปกติจะติดตั้ง NVIDIA A10หรือ Tensor Core GPU ประสิทธิภาพสูงในระดับเดียวกัน (24GB ~ หน่วยความจำวิดีโอ48GB) สถานการณ์ที่ใช้งานได้: การปรับใช้การให้เหตุผลพร้อมกันสูงการปรับแต่ง QLoRA ภาพขนาดเล็กและขนาดกลางและการสร้างข้อความข้อดี: ประสิทธิภาพด้านต้นทุนสูงมากการ์ดใบเดียวสามารถเรียกใช้เหตุผล FP16รุ่น7B หรือการให้เหตุผลแบบกลุ่ม INT4ได้อย่างง่ายดาย
2.การปรับขนาดกลางเต็มรูปแบบและการปรับใช้โมเดลขนาดใหญ่ (14B ~ พารามิเตอร์72B)
สำหรับ14B ~ ด้วยรูปแบบขนาด72B ความต้องการหน่วยความจำวิดีโอเพิ่มขึ้นอย่างรวดเร็วหน่วยความจำวิดีโอ24GB แบบการ์ดเดียวไม่เพียงพอต้องใช้การ์ดหลายใบแบบขนานหรือหน่วยความจำวิดีโอขนาดใหญ่แบบการ์ดเดียว
รุ่นที่ต้องการ: การกำหนดค่า GPU ebmgn7ex / gn7e series: ติดตั้ง GPU ประสิทธิภาพสูงเช่น NVIDIA A100 / V100 (หน่วยความจำวิดีโอ40GB/80GB) สถานการณ์ที่ใช้งานได้: การปรับแต่งแบบเต็มพารามิเตอร์/LoRA ของรุ่น13B/70B การปรับใช้พร้อมกันสูงสำหรับรุ่นขนาดใหญ่ข้อดี: มาพร้อมกับการเชื่อมต่อโครงข่าย NVLink แบนด์วิดท์สูงประสิทธิภาพการสื่อสารแบบหลายการ์ดสูงมากหลีกเลี่ยงการหยุดระหว่างการฝึกอบรมแบบกระจาย
3.การฝึกอบรมล่วงหน้าขนาดใหญ่พิเศษและการปรับคลัสเตอร์อย่างละเอียด (100พันล้านพารามิเตอร์/ไฮบริดผู้เชี่ยวชาญรุ่น MoE)
สำหรับแบบจำลองพารามิเตอร์ระดับ100พันล้าน (เช่นการ DeepSeek-R1เวอร์ชันเต็มการปรับแต่ง Qwen-2.5-72B เต็มรูปแบบ):
รุ่นที่ต้องการ: คลัสเตอร์คอมพิวเตอร์ที่แตกต่างกันประสิทธิภาพสูง (SCC/Lingjun Smart Computing) การกำหนดค่า GPU: NVIDIA H800/H100/Alibaba Cloud พัฒนาคลัสเตอร์พลังงานคอมพิวเตอร์ประสิทธิภาพสูงการสนับสนุนเครือข่าย: ติดตั้งเครือข่าย RDMA (การเข้าถึงหน่วยความจำโดยตรงระยะไกล) ให้แบนด์วิดท์การเชื่อมต่อโครงข่ายแบบไม่ปิดกั้น200Gbps สถานการณ์ที่ใช้งานได้: การปรับแต่งแบบกระจายขนาดใหญ่การฝึกอบรมแบบขนานหลายเครื่องและหลายการ์ด
3.คู่มือการวางแผนต้นทุนการคำนวณและการหลีกเลี่ยงหลุมของ Alibaba Cloud Model
พลังการคำนวณมีราคาแพงเป็นจุดเจ็บปวดที่ได้รับการยอมรับในอุตสาหกรรมทั้งหมดหากไม่มีการวางแผนทางวิทยาศาสตร์ค่าใช้จ่ายหลายหมื่นหรือหลายแสนต่อเดือนจะทำให้ทีมใดๆเจ็บปวดต่อไปนี้เป็นกลยุทธ์การประหยัดเงินสี่ประการที่สรุปไว้ในการต่อสู้จริง:
1.การใช้รูปแบบการเรียกเก็บเงินอย่างยืดหยุ่น: ตัวอย่างตามปริมาณการสมัครสมาชิกรายเดือนและการยึด
ขั้นตอนการพัฒนาและการดีบัก: อย่าลืมใช้ Spot Instance ตัวอย่างการยึดของ Alibaba Cloud สามารถเพลิดเพลินได้ถึง1 ~ ส่วนลดพิเศษ30% ในขั้นตอนของการเขียนโค้ดและการปรับเปลี่ยน Pipeline อินสแตนซ์การยึดสามารถช่วยให้คุณประหยัดค่าใช้จ่ายในการทดลองและข้อผิดพลาดได้มากกว่า70%
งานปรับแต่งที่เสถียร: โดยปกติการปรับแต่งจะใช้เวลาหลายชั่วโมงถึงหลายวันขอแนะนำให้ใช้แผนประหยัดแบบจ่ายต่อปริมาณหรือสมัครสมาชิกรายสัปดาห์/รายเดือน
การปรับใช้การผลิตออนไลน์: สภาพแวดล้อมการผลิตต้องการความพร้อมใช้งานสูง7 × 24ชั่วโมงและเลือกการสมัครสมาชิกรายปีและรายเดือนโดยตรงรวมกับส่วนลดการต่ออายุของ Alibaba Cloud ต้นทุนโดยรวมสามารถควบคุมได้มากที่สุด
2.การเพิ่มประสิทธิภาพระบบบัญชีและนโยบายส่วนลด (ทักษะการประหยัดเงินหลัก)
เมื่อบริษัทต่างๆซื้อทรัพยากรคอมพิวเตอร์ของ Alibaba Cloud การซื้อโดยตรงบนเว็บไซต์อย่างเป็นทางการในราคาเดิมมาตรฐานมักเป็นวิธีที่ไม่คุ้มทุนที่สุด
เมื่อสร้างโครงการโมเดลขนาดใหญ่ทีมงานขององค์กรจำนวนมากจะผ่านการปฏิบัติตาม
การซื้อบัญชี Alibaba Cloud
ช่องทางหรือติดต่อผู้ให้บริการระดับองค์กรของ Alibaba Cloud (บัตรกำนัล/ส่วนลดช่องทาง) สำหรับการยื่นบัญชีและการซื้อจำนวนมากด้วยวิธีนี้บริษัทต่างๆมักจะได้รับเงินคืนเพิ่มเติมการหักบัตรกำนัลหรือโควต้ารุ่นพิเศษนอกเหนือจากนโยบายอย่างเป็นทางการ
เคล็ดลับ: โดยเฉพาะอย่างยิ่งเมื่อสมัครโควต้า GPU ระดับไฮเอนด์ (Quotas) เช่น H800/A100ผ่านการซื้อและการกำหนดค่าบัญชี Alibaba Cloud ที่รายงานไม่เพียงแต่คุณจะได้รับโควต้าพลังงานการประมวลผลที่สูงขึ้นเท่านั้นแต่คุณยังสามารถรับสัญญาการชำระเงินรายปีได้มากขึ้นอีกด้วยราคาดี.
3.เทคโนโลยีการบีบอัดแบบจำลอง (การวัดปริมาณ + การตัดแต่งกิ่ง)
หน่วยความจำวิดีโอลดลงครึ่งหนึ่ง = ต้นทุนลดลงครึ่งหนึ่ง
เมื่อปรับใช้พยายามอย่าใช้น้ำหนักดั้งเดิมของ FP16โดยตรงใช้ AWQ, GPTQ หรือ FP8เพื่อหาปริมาณโมเดลรุ่น70B ต้องใช้หน่วยความจำวิดีโอ140GB (อย่างน้อย2 A100) ภายใต้ FP16แต่หลังจากวัดปริมาณเป็น INT4แล้วจะต้องใช้หน่วยความจำวิดีโอประมาณ40GB ซึ่งลดลงโดยตรงจาก2ใบเป็น1ใบและค่าใช้จ่ายจะลดลง50% ทันที
4.การเพิ่มประสิทธิภาพการจัดเก็บและการส่งข้อมูล
รุ่นใหญ่มีน้ำหนักหลายสิบ GB และการอ่านและเขียนบ่อยครั้งและการส่งข้ามภูมิภาคจะทำให้เกิดต้นทุนที่ซ่อนอยู่:
ระบบไฟล์แบบขนานประสิทธิภาพสูง NAS/CPFS: ชุดข้อมูลจะอ่านบ่อยในระหว่างการปรับแต่งขอแนะนำให้ใช้ Alibaba Cloud CPFS เพื่อป้องกันไม่ให้ GPU อยู่ในสถานะ Idle ที่รอข้อมูล
การปรับใช้ในพื้นที่เดียวกัน: ตรวจสอบให้แน่ใจว่าอินสแตนซ์ OSS (ที่เก็บวัตถุ) และ ECS/GPU ของคุณอยู่ในพื้นที่เดียวกัน (ภูมิภาค) และพื้นที่ว่าง (AZ) การส่งผ่านเครือข่ายภายในไม่เพียงแต่ฟรีแต่ยังเร็วกว่าเครือข่ายภายนอกหลายสิบเท่า
4.ผังงานการตัดสินใจเลือก (นำไปใช้โดยตรง)
เพื่อช่วยให้คุณตัดสินใจได้อย่างรวดเร็วคุณสามารถอ้างถึงเส้นทางต่อไปนี้:
เพียงแค่ต้องการปรับใช้7B/8B
รูปแบบการบริการลูกค้า/ถาม-ตอบ?👉เลือก gn8is หรือ gn7i (การ์ดเดี่ยว A10/24G) และหาปริมาณด้วยกรอบ VLLM INT4。ค่าใช้จ่ายจะถูกควบคุมที่ระดับพันหยวนต่อเดือน
ต้องการ14B ~ รุ่น32B ทำ LoRA/ฟิลด์ปรับแต่ง?👉เลือก gn7i (การ์ดคู่) หรือ ebmgn7ex (การ์ดเดี่ยว A100) รวมกับเทคโนโลยี QLoRA ตัวอย่างการชำระเงิน/การยึดตามปริมาณการชำระเงินเป็นรายชั่วโมง
ต้องการปรับแต่งพารามิเตอร์เต็มรูปแบบของรุ่น70B หรือปรับใช้บริการ API ประสิทธิภาพสูงหรือไม่?👉เลือก ebmgn7ex (คลัสเตอร์8การ์ด A100/H800) เพื่อเปิดการเร่งความเร็วเครือข่าย RDMA รวมแผนการซื้อบัญชี Alibaba Cloud ระดับองค์กรเพื่อรับโควต้าและส่วนลดและใช้แผนรายเดือนหรือประหยัด
สรุป
ไม่มี "ดีที่สุดแน่นอน" ในการเลือกพลังคอมพิวเตอร์รุ่นใหญ่มีเพียง "เหมาะสมที่สุดสำหรับปัจจุบัน" เท่านั้น
ในช่วงเริ่มต้นของโครงการ
น้ำหนักเบาการปรับแต่งเชิงปริมาณการปรับใช้เชิงปริมาณตัวอย่างการยึด
เป็นการผสมผสานที่ดีที่สุดสำหรับการตรวจสอบ MVP (ผลิตภัณฑ์ที่มีความเป็นไปได้น้อยที่สุด) อย่างรวดเร็วและเมื่อธุรกิจเข้าสู่ขั้นตอนของปริมาณการทำงาน
ประเมินแบนด์วิดท์การเชื่อมต่อโครงข่ายของโมเดลอย่างสมเหตุสมผลและร่วมมือกับส่วนลดการซื้อและการต่ออายุบัญชี Alibaba Cloud ระดับองค์กร
, เป็นกุญแจสำคัญในการสร้างผลกำไรอย่างต่อเนื่องและการดำเนินงานที่ดีต่อสุขภาพของโครงการ AI

