ตั้งแต่การเข้าถึงข้อมูลไปจนถึงการตัดสินใจอย่างชาญฉลาด: คู่มือการสร้างพาโนรามาของห่วงโซ่ผลิตภัณฑ์ข้อมูลขนาดใหญ่ของ Alibaba Cloud
ในยุคของเศรษฐกิจดิจิทัลข้อมูลได้กลายเป็นปัจจัยการผลิตหลักขององค์กรวิธีเปลี่ยนข้อมูลจำนวนมหาศาลที่กระจัดกระจายอยู่ในระบบธุรกิจต่างๆให้เป็นการตัดสินใจทางธุรกิจที่มีประสิทธิภาพเป็นความท้าทายทั่วไปที่สถาปนิกองค์กรและวิศวกรข้อมูลต้องเผชิญ
Alibaba Cloud ได้สร้างความครอบคลุมเกี่ยวกับวงจรชีวิตทั้งหมดของข้อมูล
การเข้าถึงข้อมูลการประมวลผลการจัดเก็บการวิเคราะห์แบบเรียลไทม์การสร้างแบบจำลอง AI และการตัดสินใจด้วยภาพ
เมทริกซ์ผลิตภัณฑ์ข้อมูลขนาดใหญ่แบบครบวงจรบทช่วยสอนนี้จะวิเคราะห์ตรรกะทางสถาปัตยกรรมพื้นฐานของห่วงโซ่ผลิตภัณฑ์ข้อมูลขนาดใหญ่ของ Alibaba Cloud อย่างลึกซึ้งและจะนำคุณไปสร้างแพลตฟอร์มข้อมูลที่ทันสมัยพร้อมความพร้อมใช้งานสูงเวลาแฝงต่ำและปรับขนาดได้ (Data Lakehouse / Real-time Data Platform)
1.พิมพ์เขียวสถาปัตยกรรมพาโนรามาข้อมูลขนาดใหญ่ของ Alibaba Cloud
ก่อนที่จะสร้างผลิตภัณฑ์เฉพาะเราจำเป็นต้องชี้แจงการแบ่งชั้นเชิงตรรกะของแพลตฟอร์มข้อมูลทั้งหมดแพลตฟอร์มข้อมูลขนาดใหญ่ระดับองค์กรที่เป็นผู้ใหญ่มักแบ่งออกเป็นสี่ระดับหลัก:
-----------------------------------------------------------------------
| การตัดสินใจที่ชาญฉลาดและชั้นแอปพลิเคชัน (Quick BI / PAI) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| บริการข้อมูลและการเร่งความเร็ว (Hologres / AnalyticDB) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| ออฟไลน์และชั้นการคำนวณแบบเรียลไทม์ (MaxCompute / Realti
Me Compute) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| การจัดเก็บข้อมูลแบบรวมและชั้นคลังสินค้าทะเลสาบ (OSS-HDFS / DLF) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| การเข้าถึงข้อมูลและชั้นการขนส่ง (SLS / DataHub / DTS) |
-----------------------------------------------------------------------
ตารางตรวจสอบฟังก์ชันผลิตภัณฑ์หลักอย่างรวดเร็ว
ระดับชั้น
ผลิตภัณฑ์ตัวแทน
การวางตำแหน่งหลักและข้อได้เปรียบทางเทคนิค
ชั้นการเข้าถึง
SLS/DataHub /DTS
การรวบรวมบันทึกการไหลของข้อมูลสตรีมแบบเรียลไทม์การซิงโครไนซ์ฐานข้อมูล CDC แบบเรียลไทม์
ชั้นจัดเก็บ
OSS-HDFS /DLF
การจัดเก็บวัตถุช่วยลดต้นทุนและเพิ่มประสิทธิภาพการสร้างทะเลสาบข้อมูลและการจัดการข้อมูลเมตาแบบรวม
ชั้นการคำนวณ
MaxCompute / Flink
ระดับองค์กรออฟไลน์ซูเปอร์คอมพิวเตอร์ (ระดับ EB) กับการคำนวณสตรีมสดในไม่กี่วินาที
ชั้นบริการ
Hologres
การวิเคราะห์เชิงโต้ตอบย่อยวินาทีสถาปัตยกรรม HSAP (การวิเคราะห์บริการแบบบูรณาการ)
ชั้นการตัดสินใจ
Quick Bic/PAI
รายงานอัจฉริยะขั้นสูงการเรียนรู้ของเครื่องและการตัดสินใจ AI รุ่นใหญ่
2.ขั้นตอนที่1: การเข้าถึงและการรวมข้อมูลปริมาณงานสูง (Data Ingestion)
การเข้าถึงข้อมูลเป็นทางเข้าของแพลตฟอร์มและจำเป็นต้องจัดการในเวลาเดียวกัน
แบทช์ออฟไลน์
ซิงโครไนซ์
กับ
การได้มาซึ่งสตรีมมิ่งแบบเรียลไทม์
สองฉากทั่วไป
1.ฐานข้อมูลธุรกิจ CDC การซิงโครไนซ์ที่เพิ่มขึ้น: DTS
สำหรับฐานข้อมูลทางธุรกิจเช่น MySQL, PostgreSQL, PolarDB ฯลฯให้ใช้
DTS (Data Transmission Service)
ทำการจับข้อมูลการเปลี่ยนแปลงแบบเรียลไทม์ (CDC) ในระดับ Binlog:
จุดกำหนดค่า: สร้างงานซิงโครไนซ์ DTS แบบเรียลไทม์โดยมีฐานข้อมูลเป็นต้นทางและ DataHub หรือ Hologres เป็นปลายทาง
ข้อดี: ไม่มีการบุกรุกไลบรารีหลักของธุรกิจรองรับการซิงโครไนซ์อัตโนมัติของการเปลี่ยนแปลง DDL
2.บันทึกและการเก็บรวบรวมข้อมูลจุดฝัง: SLS และ DataHub
SLS (Log Service): เหมาะสำหรับเซิร์ฟเวอร์ Log, บันทึกการเข้าถึง Nginx, ไคลเอนต์แอปฝังปรับใช้ไคลเอนต์ Logtail บนโหนดและสามารถรวบรวมบันทึกหลายสิบล้านรายการในไม่กี่วินาทีผ่านการกำหนดค่าที่เรียบง่าย
DataHub: ในฐานะทางเลือก Kafka ดั้งเดิมของ Alibaba Cloud ถือว่าเป็นบัฟเฟอร์สำหรับข้อมูลสตรีมพร้อมกันสูงและยังคงจ่ายน้ำให้กับ Flink หรือ MaxCompute ปลายน้ำ
3.ขั้นตอนที่2: การคำนวณและการจัดเก็บแบบบูรณาการ (Compute & Storage)
หลังจากการตกตะกอนของข้อมูลจำนวนมากจำเป็นต้องสร้างกลไกการประมวลผลแบบ dual-track ของ "การประมวลผลแบทช์ออฟไลน์" และ "การประมวลผลการไหลแบบเรียลไทม์" และรวมกับทะเลสาบข้อมูลเพื่อให้เกิดการลดต้นทุนที่ยืดหยุ่น
1.ออฟไลน์จำนวนคลังสินค้าและการสร้างแบบจำลองจำนวนคลังสินค้า: MaxCompute DataWorks
MaxCompute (เดิม ODPS)
เป็นคลังข้อมูลบนคลาวด์ Serverless ที่โฮสต์โดย Alibaba Cloud รวมกัน
DataWorks
, สามารถใช้การสร้างแบบจำลองชั้นข้อมูลคลังสินค้ามาตรฐาน (ODS -> DWD -> DWS -> ADS)
การสร้างแบบจำลองคลังสินค้าดิจิทัลที่เป็นมาตรฐานการต่อสู้จริง: เลเยอร์ ODS (เลเยอร์การวางแหล่งที่มา): ผ่านการรวมข้อมูล DataWorks ข้อมูลที่บันทึกโดย DTS/SLS จะถูกแบ่งพาร์ติชันเป็นประจำและเขียนลงใน MaxCompute ทุกวัน/ชั่วโมงชั้น DWD (ชั้นรายละเอียด): เรียกใช้ SQL สำหรับการทำความสะอาดการลดความไวแสงและการบำรุงรักษาตาราง Join เลเยอร์ DWS (เลเยอร์รวม): การรวมเป็นระยะตามผู้ใช้ผลิตภัณฑ์และขนาดอนุภาคเพื่อสร้างตารางกว้าง
2.การคำนวณสตรีมสดในไม่กี่วินาที: Realtime Compute for Flink
สำหรับการควบคุมความเสี่ยงแบบเรียลไทม์และฉากหน้าจอขนาดใหญ่แบบเรียลไทม์ให้ใช้
Alibaba Cloud Flink เวอร์ชันโฮสติ้งเต็มรูปแบบ
。
ลิงค์การประมวลผลสตรีมทั่วไป: ตารางแหล่งที่มา: ประกาศ topic ใน DataHub หรือ Kafka Lookup: โปรไฟล์ผู้ใช้หรือตารางการกำหนดค่าใน Hologres ที่เกี่ยวข้องตารางผลลัพธ์ (Sink): เขียนตัวบ่งชี้หน้าต่างที่คำนวณแล้วลงใน Hologres แบบเรียลไทม์
4.ขั้นตอนที่3: การรวมการวิเคราะห์บริการ (Serving & Analytics)
ในสถาปัตยกรรมแบบดั้งเดิม "การวิเคราะห์ (OLAP)" และ "บริการออนไลน์ (แบบสอบถาม KV)" มักจะแยกจากกันซึ่งนำไปสู่ความซ้ำซ้อนของข้อมูล Alibaba Cloud ผ่าน
โฮโลแกรส
ตระหนัก
HSAP(Hybrid Serving/Analysis Processing)
ความคิด
ข้อดีของสถาปัตยกรรม Hologres
เชื่อมต่อกับ MaxCompute ได้อย่างราบรื่น: รองรับการสืบค้นโดยตรงของตารางออฟไลน์ MaxCompute โดยไม่ต้องส่งคืนข้อมูล ETL ที่ซับซ้อน
การตรวจสอบจุดพร้อมกันสูงและ OLAP ที่ซับซ้อนมีทั้ง: ไม่เพียงแต่รองรับการสืบค้นคีย์หลักของ API ส่วนหน้าที่มี QPS นับแสนต่อวินาทีเท่านั้นแต่ยังรองรับเครื่องมือ BI สำหรับการวิเคราะห์ข้ามหลายมิติในระดับที่สอง
ข้อเสนอแนะทางสถาปัตยกรรม: ซิงโครไนซ์ตารางผลลัพธ์สุดท้ายของเลเยอร์ ADS ที่สร้างโดยการคำนวณแบบออฟไลน์กับ Hologres และรับข้อมูลที่เขียนโดย Flink แบบเรียลไทม์และรวมเป็นฐานข้อมูลของ BI และ API ระดับบน
ห้าขั้นตอนที่สี่: จากข้อมูลไปสู่การตัดสินใจที่ชาญฉลาด (AI & Decision)
คุณค่าสูงสุดของข้อมูลคือการชี้นำการดำเนินการทางธุรกิจผ่าน
Quick BI
กับ
แพลตฟอร์ม PAI
, สามารถแปลงสินทรัพย์ข้อมูลที่ฝากเป็นอำนาจในการตัดสินใจอัตโนมัติ
1.ความคล่องตัวในการสร้างภาพและการวิเคราะห์ธุรกิจ: Quick BI
Quick BI เป็นผลิตภัณฑ์ BI อัจฉริยะที่สร้างขึ้นโดย Alibaba Cloud สำหรับผู้มีอำนาจตัดสินใจและพนักงานขาย:
การเชื่อมต่อข้อมูล: เพิ่ม Hologres หรือ MaxCompute โดยตรงเป็นแหล่งข้อมูล
การวิเคราะห์แบบทันควันและแดชบอร์ด: ลากและวางเพื่อสร้างหน้าจอขนาดใหญ่ KPI และรายงานเทอร์มินัลมือถือ
AI Intelligent Exploration: การใช้ฟังก์ชัน NL2SQL (ภาษาธรรมชาติเป็น SQL) ในตัวนักธุรกิจจะต้องถามว่า "ผลิตภัณฑ์สิบอันดับแรกในจีนตะวันออกเมื่อเดือนที่แล้วคืออะไร" ระบบสามารถสร้างแผนภูมิโดยอัตโนมัติ
2.การตัดสินใจของ AI เชิงคาดการณ์: PAI (Platform for AI)
เมื่อรายงานพื้นฐานไม่สามารถตอบสนองความต้องการในการคาดการณ์ที่ซับซ้อนได้ให้เข้าถึง
PAI (แพลตฟอร์มการเรียนรู้ของเครื่อง)
สร้างวงปิดอัจฉริยะ:
การเตรียมข้อมูล: อ่านข้อมูลคุณลักษณะใน MaxCompute/OSS โดยตรง
การฝึกอบรมแบบจำลอง: ใช้ PAI-Designer หรือ PAI-DSW สำหรับการคาดการณ์อัตราการสูญเสียคำแนะนำในการกรองร่วมกันและการพัฒนาแบบจำลองคะแนนเครดิต
การปรับใช้โมเดล: คลิกเดียวเพื่อปรับใช้โมเดลที่ได้รับการฝึกฝนเป็น PAI-EAS (API บริการการให้เหตุผลพร้อมกันที่ยืดหยุ่นสูง) สำหรับการโทรแบบเรียลไทม์จากฝั่งธุรกิจ
6.สถานการณ์จริง: สร้างลิงก์เต็มรูปแบบของอีคอมเมิร์ซ "การควบคุมความเสี่ยงและคำแนะนำแบบเรียลไทม์"
เพื่อช่วยให้เข้าใจการทำงานร่วมกันของห่วงโซ่ผลิตภัณฑ์ได้ดีขึ้นเราจึงใช้ก
การควบคุมความเสี่ยงแบบเรียลไทม์และระบบคำแนะนำส่วนบุคคล
ตัวอย่างเช่นจัดเรียงเส้นทางการไหลของข้อมูลที่สมบูรณ์:
คอลเลกชัน (S
LS/DTS): บันทึกการคลิกของผู้ใช้จะถูกรวบรวมผ่าน SLS แบบเรียลไทม์และเหตุการณ์การทำธุรกรรมการสั่งซื้อจะถูกจับโดย DTS จาก PolarDB แบบเรียลไทม์
การส่งข้อมูล (DataHub): บันทึกและข้อมูล CDC จะถูกส่งไปยัง DataHub ผ่านช่องทางเวลาแบบรวม
Flink MaxCompute: Flink: อ่าน DataHub รวมกับตารางการบำรุงรักษาบัญชีดำใน Hologres เพื่อตรวจสอบว่าเป็นการรูดคำสั่งที่เป็นอันตรายหรือไม่ถ้าเป็นแบบเรียลไทม์ทริกเกอร์ API การเตือนภัยล่วงหน้าการเชื่อมโยงแบบออฟไลน์ (MaxCompute): สรุปข้อมูลพฤติกรรมทั้งหมดในอดีตแบบออฟไลน์ทุกคืนและคำนวณแท็กการตั้งค่าของผู้ใช้ใหม่
Model (PAI): เครื่องมือการเรียนรู้ของเครื่อง PAI อ่านแท็ก MaxCompute ในเวลากลางคืนเพื่อฝึกโมเดลที่แนะนำอีกครั้งและเขียนน้ำหนักการคาดการณ์กลับไปที่ Hologres
การตัดสินใจและการนำเสนอ (Quick BI/Business System): Business API ค้นหา Hologres ในไม่กี่วินาทีและแนะนำผลิตภัณฑ์ไปยังส่วนหน้าของแอปแบบเรียลไทม์หน้าจอขนาดใหญ่แบบเรียลไทม์ Quick BI แสดงอัตราการสกัดกั้นการควบคุมความเสี่ยงแบบไดนามิกและอัตราการแปลงที่แนะนำ
7.แนวทางปฏิบัติที่ดีที่สุดในการปรับแต่งประสิทธิภาพและการกำกับดูแลต้นทุน
เมื่อสร้างแพลตฟอร์มข้อมูลขนาดใหญ่ต้นทุนทรัพยากรและประสิทธิภาพในการดำเนินงานจะต้องสมดุลกัน
1.การจัดเก็บข้อมูลร้อนและเย็น (Tiered Storage)
ข้อมูลความร้อน (การตอบสนองต่อวินาที): บันทึกในหน่วยความจำ Hologres หรือ Realtime Compute เก็บไว้7 ~ ล่าสุด30วันสำหรับข้อมูลที่ดี
ข้อมูลอุณหภูมิ/ข้อมูลเย็น: ข้อมูลที่มีอายุมากกว่า30วันจะถูกเก็บถาวรโดยอัตโนมัติไปยังที่เก็บข้อมูลความถี่ต่ำ/ที่เก็บถาวร MaxCompute หรือ OSS ซึ่งช่วยลดต้นทุนการจัดเก็บได้มากกว่า60%
2.การจัดกำหนดการทรัพยากรคอมพิวเตอร์ตามความต้องการ
โหมดการเรียกเก็บเงินแบบไฮบริด MaxCompute: สำหรับงาน ETL แบบออฟไลน์ประจำวันโหมดการสมัครสมาชิกรายปีและรายเดือน (CU สงวนไว้) จะถูกนำมาใช้เพื่อให้แน่ใจว่าประสิทธิภาพพื้นฐานสำหรับการวิเคราะห์ขนาดใหญ่อย่างกะทันหันและชั่วคราวให้เปิดการชำระเงินตามปริมาณ (Pay-as-you-go) การขยายตัวที่ยืดหยุ่น
ความยืดหยุ่นของ Flink Auto-scaling: เปิด Flink เพื่อขยายและหดตัวโดยอัตโนมัติเพื่อรับมือกับผลกระทบของการจราจรในช่วงที่มีธุรกิจสูงสุดเช่นส่วนลดโปรโมชั่นอีคอมเมิร์ซ
แปดสรุป
การสร้างห่วงโซ่ผลิตภัณฑ์ข้อมูลขนาดใหญ่ของ Alibaba Cloud ไม่ใช่แค่ "ซ้อนเครื่องมือ" แต่ต้องปฏิบัติตาม
"Unified Collection-> Lake Warehouse Bottom-> Real-time Computing-> Speed Service-> AI Empowerment"
ระบบวงปิด
ผ่าน
SLS/DataHub + DataWorks/MaxCompute + Flink + Hologres + QuickBI/PAI
ด้วยการผสมผสานสีทองของบริษัทบริษัทต่างๆสามารถกำจัดหล่มของสถาปัตยกรรมปล่องไฟแบบเดิมๆได้ไม่เพียงแต่ตระหนักถึง "การมองเห็นและการค้นหาที่รวดเร็ว" ของสินทรัพย์ข้อมูลทั้งหมดเท่านั้นแต่ยังสามารถใช้ปัญญาประดิษฐ์ได้อีกด้วย
สามารถบรรลุ "การตัดสินใจที่ถูกต้องและการตอบสนองที่รวดเร็ว" และเพิ่มมูลค่าสูงสุดของผลผลิตดิจิทัลอย่างแท้จริง

