データアクセスからスマートな意思決定まで: アリ雲大データ製品チェーンパノラマ構築ガイド
デジタル経済時代には、データは企業の中核的な生産要素となっている。どのようにして各ビジネスシステムに散らばっている大量のデータを効率的なビジネス意思決定に変えるかは、企業設計者とデータエンジニアが直面する共通の課題である。
阿里雲はデータの全ライフサイクルを中心に、カバーを構築した
データアクセス、ストレージコンピューティング、リアルタイム分析、AIモデリングと可視化の意思決定
のワンストップビッグデータ製品マトリックス。このチュートリアルでは、阿里雲大データ製品チェーンの基礎的なアーキテクチャロジックを深く分析し手を持って、高可用性、低遅延、拡張可能な現代化データプラットフォーム (Data Lakehouse / Real-time Data Platform) を構築します。
一、阿里雲大データパノラマ構造青写真
具体的な製品を構築する前に、データプラットフォーム全体の論理的な階層を明確にする必要がある。成熟した企業レベルの大規模なデータプラットフォームは、通常、次の4つのコアレベルに分けられます
-----------------------------------------------------------------------
| インテリジェントな意思決定とアプリケーション層 (Quick BI / PAI) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| データサービスとアクセラレーション層
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| オフラインとリアルタイム計算層 (MaxCompute/Realti)
Me Compute) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| データ統合ストレージと湖倉層 (OSS-HDFS / DLF) |
-----------------------------------------------------------------------
▲
│
-----------------------------------------------------------------------
| データアクセスとトランスポート層 (SLS / DataHub / DTS) |
-----------------------------------------------------------------------
コア製品機能速検表
階層
代表製品
コアポジショニングと技術的メリット
アクセス層
SLS / DataHub / DTS
ログ収集、リアルタイムストリーミングデータの流れ、データベースCDCリアルタイム同期
ストレージ層
OSS-HDFS / DLF
対象ストレージは本プラグインを減らし、データ湖の構築とメタデータの統一管理を行う
計算層
MaxCompute / Flink
企業レベルのオフライン超大規模コンピューティング (EBレベル) と秒レベルのリアルタイムストリーム計算
サービス層
Hologres
サブ秒レベルインタラクティブ分析、HSAP (サービス分析一体化) アーキテクチャ
意思決定層
Quick BI / PAI
高度なスマートレポート、機械学習、大モデルAI意思決定
二、段階一:高スループットデータアクセスと統合 (Data Ingestion)
データアクセスはプラットフォームの入り口で、同時に対応する必要がある
オフライン一括
同期
と
リアルタイムストリーミング収集
2つの典型的なシーン。
1.業務データベースCDC増分同期: DTS
MySQL、PostgreSQL、PolarDBなどの業務データベースには
DTS (Data Transmission Service)
Binlogレベルのリアルタイム変更データキャプチャ (CDC) を行います
構成のポイント: DTSリアルタイム同期タスクを作成し、データベースをソース側とし、DataHubまたはHologresをターゲット側とします。
メリット: 業務のメインライブラリに侵入がなく、DDL変更の自動同期をサポートします。
2.ログと埋め込み点データ収集: SLSとDataHub
SLS (Log Service): サーバLog、Nginxアクセスログ、Appクライアントの埋め込みに適しています。ノードにlogtleクライアントを導入すると、簡単な構成で千万レベルのログ秒レベルの収集を実現できます。
DataHub: 阿里雲の原始的なKafka代替案として、高同時ストリームデータのバッファの役割を担って、下流FlinkまたはMaxComputeに継続的に給水する。
三、段階二:湖倉一体計算と記憶 (Compute & Storage)
大量のデータが沈殿した後、「オフラインバッチ処理」と「リアルタイムストリーム処理」のバイレイル並列の計算エンジンを確立し、データ湖と結合して柔軟なコスト削減を実現する必要がある。
1.オフライン数倉と数倉モデリング: MaxCompute DataWorks
MaxCompute (旧ODPS)
阿里雲が完全にホストしているServerlessクラウドデータウェアハウスです。結合する
Data works
、標準的な数倉階層モデリング (ODS -> DWD -> DWS -> ADS) を実現できます。
標準化された数倉モデリング実戦: ODS層 (ソース層を貼る): DataWorksデータ統合により、DTS/SLSが取得したデータを日/時間ごとにMaxComputeに書き込む。DWD層 (明細層): SQLを実行して洗浄、脱感作、次元テーブルJoinを行う。DWS層 (集計層): ユーザー、商品、粒度別に周期的に集約し、ワイドテーブルを生成する。
2. 秒レベルのリアルタイムストリーム計算: Realtime Compute for Flink
リアルタイムの風制御、リアルタイムの大画面シーンに対して、採用します。
阿里雲Flink全管理版
。
一般的なフロー処理リンク: ソーステーブル (Source): DataHubまたはKafkaのtopicを宣言します。次元テーブル (Lookup): Hologres内のユーザー画像または構成テーブルを関連付けます。結果表(Sink): 計算済みのウィンドウ指標をリアルタイムでHologresに書き込む。
四、段階三: サービス分析一体化
従来のアーキテクチャでは、「分析(OLAP) 」と「オンラインサービス (KVクエリ) 」が分離され、データが重複して冗長になることが多い。Alibaba cloud通過
ホログレス
実現しました
HSAP
理念
Hologresアーキテクチャのメリット
MaxComputeとの深さがシームレスに通じている: MaxComputeオフラインテーブルの外部直接クエリをサポートし、複雑なETLデータのリフローを必要としない。
高同時点調査と複雑なOLAPは、フロントエンドAPIが毎秒数十万QPSのプライマリ・キー・クエリをサポートし、BIツールが秒レベルの多次元交差分析を行うことができる。
アーキテクチャの提案: オフライン計算で生成されたADS層の最終結果テーブルをHologresに同期し、同時にFlinkがリアルタイムで書き込んだデータを受信し、上位BIとAPIのデータベースとして統一する。
五、段階四: データからスマート意思決定 (AI & Decision)
データの究極の価値は業務行動を指導することにある。を通して
Quick BI
と
PAIプラットフォーム
を選択します。
1.アジャイル可視化と経営分析:Quick BI
Quick BIはアリババクラウドが企業の意思決定層と業務員のために作ったスマートBI製品です。
データ接続: HologresまたはMaxComputeをデータソースとして直接追加します。
アドホック分析とダッシュボード: KPI大画面、モバイルレポートをドラッグして構築します。
AIインテリジェント探索: 内蔵されたnl2 SQL(自然言語変換SQL) 機能を利用して、業務担当者は「先月華東区の売上上位10の商品は何ですか?」と質問するだけで、システムは自動的にグラフを生成することができる。
2.予測的AI意思決定: PAI (Platform for AI)
基礎レポートが複雑な予測ニーズを満たすことができない場合にアクセスします
PAI (機械学習プラットフォーム)
スマート閉ループを作る:
データ準備: MaxCompute/OSSの特徴データを直接読み取る。
モデルトレーニング: PAI-DesignerまたはPAI-DSWを使用して、流出率予測、共同フィルタリング推薦、信用評価モデルの開発を行います。
モデル配置: 訓練されたモデルをワンクリックでPAI-EAS (柔軟性の高い同時推論サービスAPI) に配置し、業務側がリアルタイムで呼び出す。
六、シーン実戦: 電気商「リアルタイムコントロールと推薦」の全リンクを構築する
製品チェーンの協力をよりよく理解するために、私たちは
リアルタイム風制御とパーソナライズ推薦システム
例えば、完全なデータフロー経路を整理する
収集 (S
LS/DTS): ユーザーのクリックログはSLSでリアルタイムに収集され、注文取引イベントはDTSでPolarDBからリアルタイムにキャプチャされます。
転送 (DataHub): ログとCDCデータの統一タイミングパイプがDataHubにプッシュされます。
計算 (Flink + MaxCompute): リアルタイムリンク (Flink): DataHubを読み取り、Hologresのブラックリスト次元表と結合して、悪意のある印刷行為かどうかを判断する。もしそうであれば、リアルタイムでアラートAPIをトリガーします。オフラインリンク (MaxCompute): 毎晩オフラインで履歴の全量の行動データを集計し、ユーザーの好みラベルを再計算します。
モデル (PAI): PAI機械学習エンジンは夜間にMaxComputeタグを読み取って推薦モデルを再訓練し、予測重みをHologresに書き戻す。
意思決定と提示 (Quick BI/業務システム): 業務API秒レベルでHologresを照会し、Appフロントエンドにリアルタイムで商品を推薦する。Quick BIリアルタイム大画面は、風制御ブロック率と推奨転化率を動的に示している。
七、性能調整とコスト管理のベストプラクティス
大規模なデータプラットフォームを構築するには、リソースコストと運用効率のバランスを保つ必要があります。
1.冷熱データ階層記憶 (tired Storage)
ホットデータ (秒レベル応答): HologresまたはRealtime Computeメモリに保存され、直近の7 ~ 30日間の細かいデータを保持します。
温度データ/コールドデータ: 30日を超えるデータをMaxComputeまたはOSSの低周波/アーカイブストレージに自動的にアーカイブし、ストレージコストを60% 以上削減します。
2.計算リソースは必要に応じてスケジューリングする
MaxComputeハイブリッド課金モード: 日常定時のオフラインETLタスクに対して、パッケージ年パッケージ月(CU予約) モードを採用してベースライン効率を保証する突発的、臨時的な大規模な分析はペイ-as-you-goの柔軟な拡張をオンにします。
Flinkの柔軟なAuto-scaling: Flinkの自動拡張容量をオンにして、電気商の販売促進割引などの業務ピークの流量衝撃に対応する。
八、まとめ
アリババクラウドのビッグデータ製品チェーンを構築するには、単に「ツールを積み上げる」のではなく、従うべきである
「統一収集-> 湖倉築底-> リアルタイム計算-> スピードサービス-> AIエネルギー」
の閉ループシステム。
を通して
SLS/DataHub + DataWorks/MaxCompute + Flink + Hologres + QuickBI/PAI
の黄金の組み合わせで、企業は伝統的な煙突式の構造の泥沼から抜け出すことができます。
「意思決定基準、応答が速い」を実現し、デジタル生産力の最大の価値を真に発揮できる。
