Dari akses data hingga pembuatan keputusan pintar: Panduan pembinaan panorama rantai produk data besar Alibaba Cloud
Dalam era ekonomi digital, data telah menjadi faktor pengeluaran utama bagi perusahaan. Cara mengubah sejumlah besar data yang tersebar di pelbagai sistem perniagaan menjadi keputusan perniagaan yang cekap adalah cabaran biasa yang dihadapi oleh arkitek perusahaan dan jurutera data.
Alibaba Cloud telah membina liputan
Akses data, pengiraan penyimpanan, analisis masa nyata, pemodelan AI dan pengambilan keputusan visual
Matriks produk data besar sehenti. Tutorial ini akan menganalisis secara mendalam logik seni bina yang mendasari rantai produk data besar Alibaba Cloud, dan akan membawa anda untuk membina platform data moden (Data Lakehouse / Real-time Platform) dengan ketersediaan tinggi, latensi rendah, dan pengembangan.
1. Rangka tindakan seni bina panorama data besar Alibaba Cloud
Sebelum membina produk tertentu, kita perlu menjelaskan stratifikasi logik keseluruhan platform data. Platform data besar peringkat perusahaan yang matang biasanya dibahagikan kepada empat tahap teras:
----------------------------------------------------------------------------------------
| Lapisan Keputusan dan Aplikasi Pintar (Quick BI / PAI) |
----------------------------------------------------------------------------------------
▲
│
----------------------------------------------------------------------------------------
| Perkhidmatan Data dan Lapisan Percepatan (Hologres / AnalyticDB) |
----------------------------------------------------------------------------------------
▲
│
----------------------------------------------------------------------------------------
| Lapisan Pengkomputeran Luar Talian dan Masa Nyata (MaxCompute / Realti
Saya Compute) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| Penyimpanan data bersatu dan lapisan gudang tasik (OSS-HDFS / DLF) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| Lapisan Akses dan Pengangkutan Data (SLS / DataHub / DTS) |
-----------------------------------------------------------------------
Jadual rujukan cepat fungsi produk teras
Tahap
Mewakili produk
Kedudukan teras dan kelebihan teknikal
Lapisan akses
SLS / DataHub / DTS
Pengumpulan log, aliran data masa nyata, penyegerakan masa nyata CDC pangkalan data
Lapisan simpanan
OSS-HDFS / DLF
Penyimpanan objek mengurangkan kos dan meningkatkan kecekapan, pembinaan tasik data dan pengurusan metadata yang disatukan
Lapisan pengiraan
MaxCompute / Flink
Pengkomputeran skala ultra besar luar talian peringkat perusahaan (tahap EB) dan pengiraan aliran masa nyata tahap kedua
Lapisan Perkhidmatan
Hologres
Analisis interaktif sub-detik, seni bina HSAP (Integrasi Analisis Perkhidmatan)
Lapisan membuat keputusan
Quick BI / PAI
Laporan pintar lanjutan, pembelajaran mesin dan pembuatan keputusan AI model besar
2. Tahap 1: Akses dan Integrasi Data Hasil Tinggi (Maklumat Data)
Akses data adalah pintu masuk platform dan perlu ditangani pada masa yang sama
Kumpulan luar talian
Penyegerakan
Dengan
Perolehan aliran masa nyata
Dua senario tipikal.
1. Pangkalan data perniagaan CDC penyegerakan tambahan: DTS
Untuk MySQL, PostgreSQL, PolarDB dan pangkalan data perniagaan lain, gunakan
DTS (Perkhidmatan Transmission Data)
Lakukan tangkapan data perubahan masa nyata (CDC) di peringkat Binlog:
Titik konfigurasi: Buat tugas penyegerakan masa nyata DTS, dengan pangkalan data sebagai sumber dan DataHub atau Hologres sebagai sasaran.
Kelebihan: pencerobohan sifar ke perpustakaan perniagaan utama, menyokong penyegerakan automatik perubahan DDL.
2. Pengumpulan data log dan titik terkubur: SLS dan DataHub
SLS (Log Service): Sesuai untuk log pelayan, log akses Nginx, titik penyisipan pelanggan Aplikasi. Gunakan klien Logtail di nod, dan kumpulkan puluhan juta log dalam beberapa saat melalui konfigurasi mudah.
DataHub: Sebagai alternatif Kafka asli Alibaba Cloud, ia mengambil peranan sebagai penyangga data aliran serentak tinggi dan terus membekalkan air ke hilir Flink atau MaxCompute.
3. Tahap 2: Compute & Storage (Compute & Storage)
Setelah pemendakan data besar-besaran, perlu mewujudkan mesin pengkomputeran selari dua jalur "pemprosesan kumpulan luar talian" dan "pemprosesan aliran masa nyata", dan menggabungkan tasik data untuk mencapai pengurangan kos yang fleksibel.
1. Gudang nombor luar talian dan pemodelan gudang nombor: MaxCompute DataWorks
MaxCompute (ODPS asal)
Ia adalah gudang data awan Serverless yang dihoskan sepenuhnya oleh Alibaba Cloud. Gabungan
DataWorks
, Dapat mewujudkan pemodelan hierarki kedudukan digital standard (ODS -> DWD -> DWS -> ADS).
Pemodelan gudang data standard: Lapisan ODS (lapisan sumber pelekat): Melalui penyatuan data DataWorks, data yang ditangkap oleh DTS/SLS secara berkala ditulis ke MaxCompute setiap hari/jam. Lapisan DWD (lapisan terperinci): Jalankan SQL untuk pembersihan, desensitisasi, dan jadual dimensi Join. Lapisan DWS (lapisan ringkasan): agregasi berkala mengikut pengguna, produk, dan butiran untuk menghasilkan jadual yang luas.
2. Pengiraan aliran masa nyata kedua: Realtime Compute for Flink
Untuk kawalan risiko masa nyata dan pemandangan skrin besar masa nyata, gunakan
Alibaba Cloud Flink versi yang dihoskan sepenuhnya
。
Pautan pemprosesan aliran biasa: Sumber: Menyatakan topic di DataHub atau Kafka. Jadual Dimensi: Menghubungkan potret pengguna atau jadual konfigurasi di Hologres. Jadual Hasil (Sink): Tulis penunjuk tetingkap yang dikira ke dalam Hologres dalam masa nyata.
4. Tahap 3: Integrasi Analisis Perkhidmatan (Perkhidmatan & Analisis)
Dalam seni bina tradisional, "analisis (OLAP)" dan "perkhidmatan dalam talian (pertanyaan KV)" sering dipisahkan, mengakibatkan kelebihan data berulang. Alibaba Cloud berlalu
Hologres
Mencapai
HSAP(Hybrid Serving/Analysis Processing)
Idea.
Kelebihan seni bina Hologres
Sambungan yang mendalam dan lancar dengan MaxCompute: Ia menyokong pertanyaan langsung pada jadual luar talian MaxCompute tanpa memerlukan pengembalian data ETL yang rumit.
Periksa titik serentak tinggi dan OLAP yang kompleks: ia dapat menyokong API front-end dengan ratusan ribu pertanyaan kunci utama QPS sesaat, dan juga menyokong alat BI untuk analisis silang multi-dimensi tahap kedua.
Cadangan seni bina: Segerakkan jadual hasil akhir lapisan ADS yang dihasilkan oleh pengkomputeran luar talian ke Hologres, dan terima data yang ditulis oleh Flink dalam masa nyata pada masa yang sama, dan bersatu sebagai pangkalan data BI dan API atas.
5. Tahap 4: Dari data hingga pembuatan keputusan pintar (AI & Decision)
Nilai utama data adalah untuk membimbing tindakan perniagaan. Melalui
Quick BI
Dengan
Platform PAI
, Dapat mengubah aset data yang disimpan menjadi kekuatan membuat keputusan automatik.
1. Visualisasi tangkas dan analisis perniagaan: Quick BI
Quick BI adalah produk BI pintar yang dibuat oleh Alibaba Cloud untuk pembuat keputusan korporat dan jurujual:
Sambungan data: Tambah Hologres atau MaxCompute secara langsung sebagai sumber data.
Analisis dan papan pemuka yang tidak tepat: seret dan lepas untuk membina skrin besar KPI, laporan mudah alih.
Eksplorasi pintar AI: Dengan menggunakan fungsi NL2SQL (Natural Language to SQL) terbina dalam, kakitangan perniagaan hanya perlu bertanya "Apakah sepuluh produk teratas yang dijual di China Timur bulan lalu?", Sistem dapat menghasilkan carta secara automatik.
2. Keputusan AI ramalan: PAI (Platform untuk AI)
Apabila laporan asas tidak dapat memenuhi keperluan ramalan yang kompleks, akses
PAI (platform pembelajaran mesin)
Buat gelung tertutup pintar:
Penyediaan data: Baca data ciri dalam MaxCompute/OSS secara langsung.
Latihan model: Gunakan PAI-Designer atau PAI-DSW untuk mengembangkan ramalan kadar kerugian, cadangan penyaringan kolaboratif, dan model skor kredit.
Penyebaran model: Penyebaran model terlatih sebagai PAI-EAS (API perkhidmatan penaakulan serentak tinggi yang fleksibel) dengan satu klik untuk panggilan masa nyata oleh pihak perniagaan.
Keenam, senario pertempuran sebenar: membina pautan penuh "kawalan risiko masa nyata dan cadangan" e-dagang
Untuk membantu memahami kolaborasi rantai produk dengan lebih baik, kami menggunakan a
Kawalan risiko masa nyata dan sistem cadangan yang diperibadikan
Sebagai contoh, selesaikan jalan aliran data yang lengkap:
Koleksi (S
LS/DTS): Log klik pengguna dikumpulkan dalam masa nyata melalui SLS, dan acara transaksi pesanan ditangkap dalam masa nyata dari PolarDB melalui DTS.
Penghantaran (DataHub): Data log dan CDC didorong ke DataHub melalui saluran masa yang bersatu.
Pengiraan (Flink MaxCompute): Pautan masa nyata (Flink): Baca DataHub, digabungkan dengan jadual dimensi senarai hitam di Hologres, untuk menentukan sama ada ia adalah tingkah laku pertukaran pesanan yang berniat jahat. Sekiranya demikian, API amaran awal dicetuskan dalam masa nyata. Pautan luar talian (MaxCompute): Kumpulkan data tingkah laku penuh sejarah di luar talian setiap malam, dan hitung semula tag pilihan pengguna.
Model (PAI): Mesin pembelajaran mesin PAI membaca tag MaxCompute pada waktu malam untuk melatih semula model yang disyorkan dan menulis berat ramalan kembali ke Hologres.
Keputusan dan persembahan (Quick BI/sistem perniagaan): API perniagaan memeriksa Hologres dalam beberapa saat, dan mengesyorkan produk ke bahagian depan Aplikasi dalam masa nyata. Quick BI paparan dinamik skrin besar masa nyata kadar pemantauan kawalan risiko dan kadar penukaran yang disyorkan.
7. Amalan terbaik untuk penalaan prestasi dan tadbir urus kos
Semasa membina platform data yang besar, kos sumber dan kecekapan operasi mesti seimbang.
1. Penyimpanan data sejuk dan panas (Penyimpanan Tiered)
Data panas (tindak balas tahap kedua): Simpan dalam memori Hologres atau Realtime Compute, simpan 7 ~ terakhir 30 hari data halus.
Data suhu/data sejuk: Data lebih dari 30 hari diarkibkan secara automatik ke penyimpanan frekuensi rendah/arkib MaxCompute atau OSS, mengurangkan kos penyimpanan lebih dari 60%.
2. Hitung penjadualan sumber atas permintaan
Mod penagihan hibrid MaxCompute: Untuk tugas ETL luar talian biasa setiap hari, mod langganan tahunan dan bulanan (CU) digunakan untuk memastikan kecekapan asas; untuk analisis skala besar secara tiba-tiba dan sementara, bayar-sebagai-anda-pergi (bayar-sebagai-anda-pergi) Sambungan fleksibel.
Flink Fleksibel Auto-scaping: Hidupkan Flink untuk mengembangkan kapasiti secara automatik untuk mengatasi kesan lalu lintas pada tempoh puncak perniagaan seperti promosi e-dagang dan potongan harga.
8. Ringkasan
Membangun rantaian produk data besar Alibaba Cloud bukan sekadar "alat susun", tetapi ikuti
"Koleksi Bersatu-> Hucang Bottoming-> Pengiraan Masa Nyata-> Perkhidmatan Kelajuan-> Pemberdayaan AI"
Sistem gelung tertutup.
Melalui
SLS/DataHub DataWorks/MaxCompute Flink Hologres QuickBI/PAI
Dengan gabungan emas, syarikat dapat menyingkirkan quagmire seni bina cerobong tradisional, tidak hanya menyedari "pengesanan yang dapat dilihat dan cepat" dari jumlah aset data penuh, tetapi juga bergantung pada kecerdasan buatan.
Ia dapat mencapai "pengambilan keputusan yang tepat dan tindak balas yang cepat" dan benar-benar memaksimumkan nilai produktiviti digital.

