ตั้งแต่การเข้าถึงข้อมูลไปจนถึงการตัดสินใจอย่างชาญฉลาด: คู่มือการสร้างพาโนรามาของห่วงโซ่ผลิตภัณฑ์ข้อมูลขนาดใหญ่ของ Alibaba Cloud

เมฆ 2026-07-20 阅读 7
1

ในยุคของเศรษฐกิจดิจิทัลข้อมูลได้กลายเป็นปัจจัยการผลิตหลักขององค์กรวิธีเปลี่ยนข้อมูลจำนวนมหาศาลที่กระจัดกระจายอยู่ในระบบธุรกิจต่างๆให้เป็นการตัดสินใจทางธุรกิจที่มีประสิทธิภาพเป็นความท้าทายทั่วไปที่สถาปนิกองค์กรและวิศวกรข้อมูลต้องเผชิญ

Alibaba Cloud ได้สร้างความครอบคลุมเกี่ยวกับวงจรชีวิตทั้งหมดของข้อมูล

การเข้าถึงข้อมูลการประมวลผลการจัดเก็บการวิเคราะห์แบบเรียลไทม์การสร้างแบบจำลอง AI และการตัดสินใจด้วยภาพ

เมทริกซ์ผลิตภัณฑ์ข้อมูลขนาดใหญ่แบบครบวงจรบทช่วยสอนนี้จะวิเคราะห์ตรรกะทางสถาปัตยกรรมพื้นฐานของห่วงโซ่ผลิตภัณฑ์ข้อมูลขนาดใหญ่ของ Alibaba Cloud อย่างลึกซึ้งและจะนำคุณไปสร้างแพลตฟอร์มข้อมูลที่ทันสมัยพร้อมความพร้อมใช้งานสูงเวลาแฝงต่ำและปรับขนาดได้ (Data Lakehouse / Real-time Data Platform)

1.พิมพ์เขียวสถาปัตยกรรมพาโนรามาข้อมูลขนาดใหญ่ของ Alibaba Cloud

ก่อนที่จะสร้างผลิตภัณฑ์เฉพาะเราจำเป็นต้องชี้แจงการแบ่งชั้นเชิงตรรกะของแพลตฟอร์มข้อมูลทั้งหมดแพลตฟอร์มข้อมูลขนาดใหญ่ระดับองค์กรที่เป็นผู้ใหญ่มักแบ่งออกเป็นสี่ระดับหลัก:

-----------------------------------------------------------------------

| การตัดสินใจที่ชาญฉลาดและชั้นแอปพลิเคชัน (Quick BI / PAI) |

-----------------------------------------------------------------------

-----------------------------------------------------------------------

| บริการข้อมูลและการเร่งความเร็ว (Hologres / AnalyticDB) |

-----------------------------------------------------------------------

-----------------------------------------------------------------------

| ออฟไลน์และชั้นการคำนวณแบบเรียลไทม์ (MaxCompute / Realti

Me Compute) |

-----------------------------------------------------------------------

-----------------------------------------------------------------------

| การจัดเก็บข้อมูลแบบรวมและชั้นคลังสินค้าทะเลสาบ (OSS-HDFS / DLF) |

-----------------------------------------------------------------------

-----------------------------------------------------------------------

| การเข้าถึงข้อมูลและชั้นการขนส่ง (SLS / DataHub / DTS) |

-----------------------------------------------------------------------

ตารางตรวจสอบฟังก์ชันผลิตภัณฑ์หลักอย่างรวดเร็ว

ระดับชั้น

ผลิตภัณฑ์ตัวแทน

การวางตำแหน่งหลักและข้อได้เปรียบทางเทคนิค

ชั้นการเข้าถึง

SLS/DataHub /DTS

การรวบรวมบันทึกการไหลของข้อมูลสตรีมแบบเรียลไทม์การซิงโครไนซ์ฐานข้อมูล CDC แบบเรียลไทม์

ชั้นจัดเก็บ

OSS-HDFS /DLF

การจัดเก็บวัตถุช่วยลดต้นทุนและเพิ่มประสิทธิภาพการสร้างทะเลสาบข้อมูลและการจัดการข้อมูลเมตาแบบรวม

ชั้นการคำนวณ

MaxCompute / Flink

ระดับองค์กรออฟไลน์ซูเปอร์คอมพิวเตอร์ (ระดับ EB) กับการคำนวณสตรีมสดในไม่กี่วินาที

ชั้นบริการ

Hologres

การวิเคราะห์เชิงโต้ตอบย่อยวินาทีสถาปัตยกรรม HSAP (การวิเคราะห์บริการแบบบูรณาการ)

ชั้นการตัดสินใจ

Quick Bic/PAI

รายงานอัจฉริยะขั้นสูงการเรียนรู้ของเครื่องและการตัดสินใจ AI รุ่นใหญ่

2.ขั้นตอนที่1: การเข้าถึงและการรวมข้อมูลปริมาณงานสูง (Data Ingestion)

การเข้าถึงข้อมูลเป็นทางเข้าของแพลตฟอร์มและจำเป็นต้องจัดการในเวลาเดียวกัน

แบทช์ออฟไลน์

ซิงโครไนซ์

กับ

การได้มาซึ่งสตรีมมิ่งแบบเรียลไทม์

สองฉากทั่วไป

1.ฐานข้อมูลธุรกิจ CDC การซิงโครไนซ์ที่เพิ่มขึ้น: DTS

สำหรับฐานข้อมูลทางธุรกิจเช่น MySQL, PostgreSQL, PolarDB ฯลฯให้ใช้

DTS (Data Transmission Service)

ทำการจับข้อมูลการเปลี่ยนแปลงแบบเรียลไทม์ (CDC) ในระดับ Binlog:

จุดกำหนดค่า: สร้างงานซิงโครไนซ์ DTS แบบเรียลไทม์โดยมีฐานข้อมูลเป็นต้นทางและ DataHub หรือ Hologres เป็นปลายทาง

ข้อดี: ไม่มีการบุกรุกไลบรารีหลักของธุรกิจรองรับการซิงโครไนซ์อัตโนมัติของการเปลี่ยนแปลง DDL

2.บันทึกและการเก็บรวบรวมข้อมูลจุดฝัง: SLS และ DataHub

SLS (Log Service): เหมาะสำหรับเซิร์ฟเวอร์ Log, บันทึกการเข้าถึง Nginx, ไคลเอนต์แอปฝังปรับใช้ไคลเอนต์ Logtail บนโหนดและสามารถรวบรวมบันทึกหลายสิบล้านรายการในไม่กี่วินาทีผ่านการกำหนดค่าที่เรียบง่าย

DataHub: ในฐานะทางเลือก Kafka ดั้งเดิมของ Alibaba Cloud ถือว่าเป็นบัฟเฟอร์สำหรับข้อมูลสตรีมพร้อมกันสูงและยังคงจ่ายน้ำให้กับ Flink หรือ MaxCompute ปลายน้ำ

3.ขั้นตอนที่2: การคำนวณและการจัดเก็บแบบบูรณาการ (Compute & Storage)

หลังจากการตกตะกอนของข้อมูลจำนวนมากจำเป็นต้องสร้างกลไกการประมวลผลแบบ dual-track ของ "การประมวลผลแบทช์ออฟไลน์" และ "การประมวลผลการไหลแบบเรียลไทม์" และรวมกับทะเลสาบข้อมูลเพื่อให้เกิดการลดต้นทุนที่ยืดหยุ่น

1.ออฟไลน์จำนวนคลังสินค้าและการสร้างแบบจำลองจำนวนคลังสินค้า: MaxCompute DataWorks

MaxCompute (เดิม ODPS)

เป็นคลังข้อมูลบนคลาวด์ Serverless ที่โฮสต์โดย Alibaba Cloud รวมกัน

DataWorks

, สามารถใช้การสร้างแบบจำลองชั้นข้อมูลคลังสินค้ามาตรฐาน (ODS -> DWD -> DWS -> ADS)

การสร้างแบบจำลองคลังสินค้าดิจิทัลที่เป็นมาตรฐานการต่อสู้จริง: เลเยอร์ ODS (เลเยอร์การวางแหล่งที่มา): ผ่านการรวมข้อมูล DataWorks ข้อมูลที่บันทึกโดย DTS/SLS จะถูกแบ่งพาร์ติชันเป็นประจำและเขียนลงใน MaxCompute ทุกวัน/ชั่วโมงชั้น DWD (ชั้นรายละเอียด): เรียกใช้ SQL สำหรับการทำความสะอาดการลดความไวแสงและการบำรุงรักษาตาราง Join เลเยอร์ DWS (เลเยอร์รวม): การรวมเป็นระยะตามผู้ใช้ผลิตภัณฑ์และขนาดอนุภาคเพื่อสร้างตารางกว้าง

2.การคำนวณสตรีมสดในไม่กี่วินาที: Realtime Compute for Flink

สำหรับการควบคุมความเสี่ยงแบบเรียลไทม์และฉากหน้าจอขนาดใหญ่แบบเรียลไทม์ให้ใช้

Alibaba Cloud Flink เวอร์ชันโฮสติ้งเต็มรูปแบบ

ลิงค์การประมวลผลสตรีมทั่วไป: ตารางแหล่งที่มา: ประกาศ topic ใน DataHub หรือ Kafka Lookup: โปรไฟล์ผู้ใช้หรือตารางการกำหนดค่าใน Hologres ที่เกี่ยวข้องตารางผลลัพธ์ (Sink): เขียนตัวบ่งชี้หน้าต่างที่คำนวณแล้วลงใน Hologres แบบเรียลไทม์

4.ขั้นตอนที่3: การรวมการวิเคราะห์บริการ (Serving & Analytics)

ในสถาปัตยกรรมแบบดั้งเดิม "การวิเคราะห์ (OLAP)" และ "บริการออนไลน์ (แบบสอบถาม KV)" มักจะแยกจากกันซึ่งนำไปสู่ความซ้ำซ้อนของข้อมูล Alibaba Cloud ผ่าน

โฮโลแกรส

ตระหนัก

HSAP(Hybrid Serving/Analysis Processing)

ความคิด

ข้อดีของสถาปัตยกรรม Hologres

เชื่อมต่อกับ MaxCompute ได้อย่างราบรื่น: รองรับการสืบค้นโดยตรงของตารางออฟไลน์ MaxCompute โดยไม่ต้องส่งคืนข้อมูล ETL ที่ซับซ้อน

การตรวจสอบจุดพร้อมกันสูงและ OLAP ที่ซับซ้อนมีทั้ง: ไม่เพียงแต่รองรับการสืบค้นคีย์หลักของ API ส่วนหน้าที่มี QPS นับแสนต่อวินาทีเท่านั้นแต่ยังรองรับเครื่องมือ BI สำหรับการวิเคราะห์ข้ามหลายมิติในระดับที่สอง

ข้อเสนอแนะทางสถาปัตยกรรม: ซิงโครไนซ์ตารางผลลัพธ์สุดท้ายของเลเยอร์ ADS ที่สร้างโดยการคำนวณแบบออฟไลน์กับ Hologres และรับข้อมูลที่เขียนโดย Flink แบบเรียลไทม์และรวมเป็นฐานข้อมูลของ BI และ API ระดับบน

ห้าขั้นตอนที่สี่: จากข้อมูลไปสู่การตัดสินใจที่ชาญฉลาด (AI & Decision)

คุณค่าสูงสุดของข้อมูลคือการชี้นำการดำเนินการทางธุรกิจผ่าน

Quick BI

กับ

แพลตฟอร์ม PAI

, สามารถแปลงสินทรัพย์ข้อมูลที่ฝากเป็นอำนาจในการตัดสินใจอัตโนมัติ

1.ความคล่องตัวในการสร้างภาพและการวิเคราะห์ธุรกิจ: Quick BI

Quick BI เป็นผลิตภัณฑ์ BI อัจฉริยะที่สร้างขึ้นโดย Alibaba Cloud สำหรับผู้มีอำนาจตัดสินใจและพนักงานขาย:

การเชื่อมต่อข้อมูล: เพิ่ม Hologres หรือ MaxCompute โดยตรงเป็นแหล่งข้อมูล

การวิเคราะห์แบบทันควันและแดชบอร์ด: ลากและวางเพื่อสร้างหน้าจอขนาดใหญ่ KPI และรายงานเทอร์มินัลมือถือ

AI Intelligent Exploration: การใช้ฟังก์ชัน NL2SQL (ภาษาธรรมชาติเป็น SQL) ในตัวนักธุรกิจจะต้องถามว่า "ผลิตภัณฑ์สิบอันดับแรกในจีนตะวันออกเมื่อเดือนที่แล้วคืออะไร" ระบบสามารถสร้างแผนภูมิโดยอัตโนมัติ

2.การตัดสินใจของ AI เชิงคาดการณ์: PAI (Platform for AI)

เมื่อรายงานพื้นฐานไม่สามารถตอบสนองความต้องการในการคาดการณ์ที่ซับซ้อนได้ให้เข้าถึง

PAI (แพลตฟอร์มการเรียนรู้ของเครื่อง)

สร้างวงปิดอัจฉริยะ:

การเตรียมข้อมูล: อ่านข้อมูลคุณลักษณะใน MaxCompute/OSS โดยตรง

การฝึกอบรมแบบจำลอง: ใช้ PAI-Designer หรือ PAI-DSW สำหรับการคาดการณ์อัตราการสูญเสียคำแนะนำในการกรองร่วมกันและการพัฒนาแบบจำลองคะแนนเครดิต

การปรับใช้โมเดล: คลิกเดียวเพื่อปรับใช้โมเดลที่ได้รับการฝึกฝนเป็น PAI-EAS (API บริการการให้เหตุผลพร้อมกันที่ยืดหยุ่นสูง) สำหรับการโทรแบบเรียลไทม์จากฝั่งธุรกิจ

6.สถานการณ์จริง: สร้างลิงก์เต็มรูปแบบของอีคอมเมิร์ซ "การควบคุมความเสี่ยงและคำแนะนำแบบเรียลไทม์"

เพื่อช่วยให้เข้าใจการทำงานร่วมกันของห่วงโซ่ผลิตภัณฑ์ได้ดีขึ้นเราจึงใช้ก

การควบคุมความเสี่ยงแบบเรียลไทม์และระบบคำแนะนำส่วนบุคคล

ตัวอย่างเช่นจัดเรียงเส้นทางการไหลของข้อมูลที่สมบูรณ์:

คอลเลกชัน (S

LS/DTS): บันทึกการคลิกของผู้ใช้จะถูกรวบรวมผ่าน SLS แบบเรียลไทม์และเหตุการณ์การทำธุรกรรมการสั่งซื้อจะถูกจับโดย DTS จาก PolarDB แบบเรียลไทม์

การส่งข้อมูล (DataHub): บันทึกและข้อมูล CDC จะถูกส่งไปยัง DataHub ผ่านช่องทางเวลาแบบรวม

Flink MaxCompute: Flink: อ่าน DataHub รวมกับตารางการบำรุงรักษาบัญชีดำใน Hologres เพื่อตรวจสอบว่าเป็นการรูดคำสั่งที่เป็นอันตรายหรือไม่ถ้าเป็นแบบเรียลไทม์ทริกเกอร์ API การเตือนภัยล่วงหน้าการเชื่อมโยงแบบออฟไลน์ (MaxCompute): สรุปข้อมูลพฤติกรรมทั้งหมดในอดีตแบบออฟไลน์ทุกคืนและคำนวณแท็กการตั้งค่าของผู้ใช้ใหม่

Model (PAI): เครื่องมือการเรียนรู้ของเครื่อง PAI อ่านแท็ก MaxCompute ในเวลากลางคืนเพื่อฝึกโมเดลที่แนะนำอีกครั้งและเขียนน้ำหนักการคาดการณ์กลับไปที่ Hologres

การตัดสินใจและการนำเสนอ (Quick BI/Business System): Business API ค้นหา Hologres ในไม่กี่วินาทีและแนะนำผลิตภัณฑ์ไปยังส่วนหน้าของแอปแบบเรียลไทม์หน้าจอขนาดใหญ่แบบเรียลไทม์ Quick BI แสดงอัตราการสกัดกั้นการควบคุมความเสี่ยงแบบไดนามิกและอัตราการแปลงที่แนะนำ

7.แนวทางปฏิบัติที่ดีที่สุดในการปรับแต่งประสิทธิภาพและการกำกับดูแลต้นทุน

เมื่อสร้างแพลตฟอร์มข้อมูลขนาดใหญ่ต้นทุนทรัพยากรและประสิทธิภาพในการดำเนินงานจะต้องสมดุลกัน

1.การจัดเก็บข้อมูลร้อนและเย็น (Tiered Storage)

ข้อมูลความร้อน (การตอบสนองต่อวินาที): บันทึกในหน่วยความจำ Hologres หรือ Realtime Compute เก็บไว้7 ~ ล่าสุด30วันสำหรับข้อมูลที่ดี

ข้อมูลอุณหภูมิ/ข้อมูลเย็น: ข้อมูลที่มีอายุมากกว่า30วันจะถูกเก็บถาวรโดยอัตโนมัติไปยังที่เก็บข้อมูลความถี่ต่ำ/ที่เก็บถาวร MaxCompute หรือ OSS ซึ่งช่วยลดต้นทุนการจัดเก็บได้มากกว่า60%

2.การจัดกำหนดการทรัพยากรคอมพิวเตอร์ตามความต้องการ

โหมดการเรียกเก็บเงินแบบไฮบริด MaxCompute: สำหรับงาน ETL แบบออฟไลน์ประจำวันโหมดการสมัครสมาชิกรายปีและรายเดือน (CU สงวนไว้) จะถูกนำมาใช้เพื่อให้แน่ใจว่าประสิทธิภาพพื้นฐานสำหรับการวิเคราะห์ขนาดใหญ่อย่างกะทันหันและชั่วคราวให้เปิดการชำระเงินตามปริมาณ (Pay-as-you-go) การขยายตัวที่ยืดหยุ่น

ความยืดหยุ่นของ Flink Auto-scaling: เปิด Flink เพื่อขยายและหดตัวโดยอัตโนมัติเพื่อรับมือกับผลกระทบของการจราจรในช่วงที่มีธุรกิจสูงสุดเช่นส่วนลดโปรโมชั่นอีคอมเมิร์ซ

แปดสรุป

การสร้างห่วงโซ่ผลิตภัณฑ์ข้อมูลขนาดใหญ่ของ Alibaba Cloud ไม่ใช่แค่ "ซ้อนเครื่องมือ" แต่ต้องปฏิบัติตาม

"Unified Collection-> Lake Warehouse Bottom-> Real-time Computing-> Speed Service-> AI Empowerment"

ระบบวงปิด

ผ่าน

SLS/DataHub + DataWorks/MaxCompute + Flink + Hologres + QuickBI/PAI

ด้วยการผสมผสานสีทองของบริษัทบริษัทต่างๆสามารถกำจัดหล่มของสถาปัตยกรรมปล่องไฟแบบเดิมๆได้ไม่เพียงแต่ตระหนักถึง "การมองเห็นและการค้นหาที่รวดเร็ว" ของสินทรัพย์ข้อมูลทั้งหมดเท่านั้นแต่ยังสามารถใช้ปัญญาประดิษฐ์ได้อีกด้วย

สามารถบรรลุ "การตัดสินใจที่ถูกต้องและการตอบสนองที่รวดเร็ว" และเพิ่มมูลค่าสูงสุดของผลผลิตดิจิทัลอย่างแท้จริง

cloud
← 返回新闻中心