Dari akses data hingga pembuatan keputusan pintar: Panduan pembinaan panorama rantai produk data besar Alibaba Cloud

awan 2026-07-20 阅读 5
cloud

Dalam era ekonomi digital, data telah menjadi faktor pengeluaran utama bagi perusahaan. Cara mengubah sejumlah besar data yang tersebar di pelbagai sistem perniagaan menjadi keputusan perniagaan yang cekap adalah cabaran biasa yang dihadapi oleh arkitek perusahaan dan jurutera data.

Alibaba Cloud telah membina liputan

Akses data, pengiraan penyimpanan, analisis masa nyata, pemodelan AI dan pengambilan keputusan visual

Matriks produk data besar sehenti. Tutorial ini akan menganalisis secara mendalam logik seni bina yang mendasari rantai produk data besar Alibaba Cloud, dan akan membawa anda untuk membina platform data moden (Data Lakehouse / Real-time Platform) dengan ketersediaan tinggi, latensi rendah, dan pengembangan.

1. Rangka tindakan seni bina panorama data besar Alibaba Cloud

Sebelum membina produk tertentu, kita perlu menjelaskan stratifikasi logik keseluruhan platform data. Platform data besar peringkat perusahaan yang matang biasanya dibahagikan kepada empat tahap teras:

----------------------------------------------------------------------------------------

| Lapisan Keputusan dan Aplikasi Pintar (Quick BI / PAI) |

----------------------------------------------------------------------------------------

----------------------------------------------------------------------------------------

| Perkhidmatan Data dan Lapisan Percepatan (Hologres / AnalyticDB) |

----------------------------------------------------------------------------------------

----------------------------------------------------------------------------------------

| Lapisan Pengkomputeran Luar Talian dan Masa Nyata (MaxCompute / Realti

Saya Compute) |

-----------------------------------------------------------------------

-----------------------------------------------------------------------

| Penyimpanan data bersatu dan lapisan gudang tasik (OSS-HDFS / DLF) |

-----------------------------------------------------------------------

-----------------------------------------------------------------------

| Lapisan Akses dan Pengangkutan Data (SLS / DataHub / DTS) |

-----------------------------------------------------------------------

Jadual rujukan cepat fungsi produk teras

Tahap

Mewakili produk

Kedudukan teras dan kelebihan teknikal

Lapisan akses

SLS / DataHub / DTS

Pengumpulan log, aliran data masa nyata, penyegerakan masa nyata CDC pangkalan data

Lapisan simpanan

OSS-HDFS / DLF

Penyimpanan objek mengurangkan kos dan meningkatkan kecekapan, pembinaan tasik data dan pengurusan metadata yang disatukan

Lapisan pengiraan

MaxCompute / Flink

Pengkomputeran skala ultra besar luar talian peringkat perusahaan (tahap EB) dan pengiraan aliran masa nyata tahap kedua

Lapisan Perkhidmatan

Hologres

Analisis interaktif sub-detik, seni bina HSAP (Integrasi Analisis Perkhidmatan)

Lapisan membuat keputusan

Quick BI / PAI

Laporan pintar lanjutan, pembelajaran mesin dan pembuatan keputusan AI model besar

2. Tahap 1: Akses dan Integrasi Data Hasil Tinggi (Maklumat Data)

Akses data adalah pintu masuk platform dan perlu ditangani pada masa yang sama

Kumpulan luar talian

Penyegerakan

Dengan

Perolehan aliran masa nyata

Dua senario tipikal.

1. Pangkalan data perniagaan CDC penyegerakan tambahan: DTS

Untuk MySQL, PostgreSQL, PolarDB dan pangkalan data perniagaan lain, gunakan

DTS (Perkhidmatan Transmission Data)

Lakukan tangkapan data perubahan masa nyata (CDC) di peringkat Binlog:

Titik konfigurasi: Buat tugas penyegerakan masa nyata DTS, dengan pangkalan data sebagai sumber dan DataHub atau Hologres sebagai sasaran.

Kelebihan: pencerobohan sifar ke perpustakaan perniagaan utama, menyokong penyegerakan automatik perubahan DDL.

2. Pengumpulan data log dan titik terkubur: SLS dan DataHub

SLS (Log Service): Sesuai untuk log pelayan, log akses Nginx, titik penyisipan pelanggan Aplikasi. Gunakan klien Logtail di nod, dan kumpulkan puluhan juta log dalam beberapa saat melalui konfigurasi mudah.

DataHub: Sebagai alternatif Kafka asli Alibaba Cloud, ia mengambil peranan sebagai penyangga data aliran serentak tinggi dan terus membekalkan air ke hilir Flink atau MaxCompute.

3. Tahap 2: Compute & Storage (Compute & Storage)

Setelah pemendakan data besar-besaran, perlu mewujudkan mesin pengkomputeran selari dua jalur "pemprosesan kumpulan luar talian" dan "pemprosesan aliran masa nyata", dan menggabungkan tasik data untuk mencapai pengurangan kos yang fleksibel.

1. Gudang nombor luar talian dan pemodelan gudang nombor: MaxCompute DataWorks

MaxCompute (ODPS asal)

Ia adalah gudang data awan Serverless yang dihoskan sepenuhnya oleh Alibaba Cloud. Gabungan

DataWorks

, Dapat mewujudkan pemodelan hierarki kedudukan digital standard (ODS -> DWD -> DWS -> ADS).

Pemodelan gudang data standard: Lapisan ODS (lapisan sumber pelekat): Melalui penyatuan data DataWorks, data yang ditangkap oleh DTS/SLS secara berkala ditulis ke MaxCompute setiap hari/jam. Lapisan DWD (lapisan terperinci): Jalankan SQL untuk pembersihan, desensitisasi, dan jadual dimensi Join. Lapisan DWS (lapisan ringkasan): agregasi berkala mengikut pengguna, produk, dan butiran untuk menghasilkan jadual yang luas.

2. Pengiraan aliran masa nyata kedua: Realtime Compute for Flink

Untuk kawalan risiko masa nyata dan pemandangan skrin besar masa nyata, gunakan

Alibaba Cloud Flink versi yang dihoskan sepenuhnya

Pautan pemprosesan aliran biasa: Sumber: Menyatakan topic di DataHub atau Kafka. Jadual Dimensi: Menghubungkan potret pengguna atau jadual konfigurasi di Hologres. Jadual Hasil (Sink): Tulis penunjuk tetingkap yang dikira ke dalam Hologres dalam masa nyata.

4. Tahap 3: Integrasi Analisis Perkhidmatan (Perkhidmatan & Analisis)

Dalam seni bina tradisional, "analisis (OLAP)" dan "perkhidmatan dalam talian (pertanyaan KV)" sering dipisahkan, mengakibatkan kelebihan data berulang. Alibaba Cloud berlalu

Hologres

Mencapai

HSAP(Hybrid Serving/Analysis Processing)

Idea.

Kelebihan seni bina Hologres

Sambungan yang mendalam dan lancar dengan MaxCompute: Ia menyokong pertanyaan langsung pada jadual luar talian MaxCompute tanpa memerlukan pengembalian data ETL yang rumit.

Periksa titik serentak tinggi dan OLAP yang kompleks: ia dapat menyokong API front-end dengan ratusan ribu pertanyaan kunci utama QPS sesaat, dan juga menyokong alat BI untuk analisis silang multi-dimensi tahap kedua.

Cadangan seni bina: Segerakkan jadual hasil akhir lapisan ADS yang dihasilkan oleh pengkomputeran luar talian ke Hologres, dan terima data yang ditulis oleh Flink dalam masa nyata pada masa yang sama, dan bersatu sebagai pangkalan data BI dan API atas.

5. Tahap 4: Dari data hingga pembuatan keputusan pintar (AI & Decision)

Nilai utama data adalah untuk membimbing tindakan perniagaan. Melalui

Quick BI

Dengan

Platform PAI

, Dapat mengubah aset data yang disimpan menjadi kekuatan membuat keputusan automatik.

1. Visualisasi tangkas dan analisis perniagaan: Quick BI

Quick BI adalah produk BI pintar yang dibuat oleh Alibaba Cloud untuk pembuat keputusan korporat dan jurujual:

Sambungan data: Tambah Hologres atau MaxCompute secara langsung sebagai sumber data.

Analisis dan papan pemuka yang tidak tepat: seret dan lepas untuk membina skrin besar KPI, laporan mudah alih.

Eksplorasi pintar AI: Dengan menggunakan fungsi NL2SQL (Natural Language to SQL) terbina dalam, kakitangan perniagaan hanya perlu bertanya "Apakah sepuluh produk teratas yang dijual di China Timur bulan lalu?", Sistem dapat menghasilkan carta secara automatik.

2. Keputusan AI ramalan: PAI (Platform untuk AI)

Apabila laporan asas tidak dapat memenuhi keperluan ramalan yang kompleks, akses

PAI (platform pembelajaran mesin)

Buat gelung tertutup pintar:

Penyediaan data: Baca data ciri dalam MaxCompute/OSS secara langsung.

Latihan model: Gunakan PAI-Designer atau PAI-DSW untuk mengembangkan ramalan kadar kerugian, cadangan penyaringan kolaboratif, dan model skor kredit.

Penyebaran model: Penyebaran model terlatih sebagai PAI-EAS (API perkhidmatan penaakulan serentak tinggi yang fleksibel) dengan satu klik untuk panggilan masa nyata oleh pihak perniagaan.

Keenam, senario pertempuran sebenar: membina pautan penuh "kawalan risiko masa nyata dan cadangan" e-dagang

Untuk membantu memahami kolaborasi rantai produk dengan lebih baik, kami menggunakan a

Kawalan risiko masa nyata dan sistem cadangan yang diperibadikan

Sebagai contoh, selesaikan jalan aliran data yang lengkap:

Koleksi (S

LS/DTS): Log klik pengguna dikumpulkan dalam masa nyata melalui SLS, dan acara transaksi pesanan ditangkap dalam masa nyata dari PolarDB melalui DTS.

Penghantaran (DataHub): Data log dan CDC didorong ke DataHub melalui saluran masa yang bersatu.

Pengiraan (Flink MaxCompute): Pautan masa nyata (Flink): Baca DataHub, digabungkan dengan jadual dimensi senarai hitam di Hologres, untuk menentukan sama ada ia adalah tingkah laku pertukaran pesanan yang berniat jahat. Sekiranya demikian, API amaran awal dicetuskan dalam masa nyata. Pautan luar talian (MaxCompute): Kumpulkan data tingkah laku penuh sejarah di luar talian setiap malam, dan hitung semula tag pilihan pengguna.

Model (PAI): Mesin pembelajaran mesin PAI membaca tag MaxCompute pada waktu malam untuk melatih semula model yang disyorkan dan menulis berat ramalan kembali ke Hologres.

Keputusan dan persembahan (Quick BI/sistem perniagaan): API perniagaan memeriksa Hologres dalam beberapa saat, dan mengesyorkan produk ke bahagian depan Aplikasi dalam masa nyata. Quick BI paparan dinamik skrin besar masa nyata kadar pemantauan kawalan risiko dan kadar penukaran yang disyorkan.

7. Amalan terbaik untuk penalaan prestasi dan tadbir urus kos

Semasa membina platform data yang besar, kos sumber dan kecekapan operasi mesti seimbang.

1. Penyimpanan data sejuk dan panas (Penyimpanan Tiered)

Data panas (tindak balas tahap kedua): Simpan dalam memori Hologres atau Realtime Compute, simpan 7 ~ terakhir 30 hari data halus.

Data suhu/data sejuk: Data lebih dari 30 hari diarkibkan secara automatik ke penyimpanan frekuensi rendah/arkib MaxCompute atau OSS, mengurangkan kos penyimpanan lebih dari 60%.

2. Hitung penjadualan sumber atas permintaan

Mod penagihan hibrid MaxCompute: Untuk tugas ETL luar talian biasa setiap hari, mod langganan tahunan dan bulanan (CU) digunakan untuk memastikan kecekapan asas; untuk analisis skala besar secara tiba-tiba dan sementara, bayar-sebagai-anda-pergi (bayar-sebagai-anda-pergi) Sambungan fleksibel.

Flink Fleksibel Auto-scaping: Hidupkan Flink untuk mengembangkan kapasiti secara automatik untuk mengatasi kesan lalu lintas pada tempoh puncak perniagaan seperti promosi e-dagang dan potongan harga.

8. Ringkasan

Membangun rantaian produk data besar Alibaba Cloud bukan sekadar "alat susun", tetapi ikuti

"Koleksi Bersatu-> Hucang Bottoming-> Pengiraan Masa Nyata-> Perkhidmatan Kelajuan-> Pemberdayaan AI"

Sistem gelung tertutup.

Melalui

SLS/DataHub DataWorks/MaxCompute Flink Hologres QuickBI/PAI

Dengan gabungan emas, syarikat dapat menyingkirkan quagmire seni bina cerobong tradisional, tidak hanya menyedari "pengesanan yang dapat dilihat dan cepat" dari jumlah aset data penuh, tetapi juga bergantung pada kecerdasan buatan.

Ia dapat mencapai "pengambilan keputusan yang tepat dan tindak balas yang cepat" dan benar-benar memaksimumkan nilai produktiviti digital.

1
← 返回新闻中心