Dataphin
Dataphin は、Alibaba Group の OneData データガバナンス手法の内部実践をクラウドベースで提供するものです。ビッグデータのライフサイクル全体を通じて、データの統合、構築、管理、利用のワンストップソリューションを提供し、企業がデータガバナンスのレベルを大幅に向上させ、高品質で信頼性が高く、便利で安全かつ経 済的な生産を実現する企業レベルのデータミドルプラットフォームを構築することを目指しています。Dataphin は、さまざまな業界の企業のプラットフォーム技術アーキテクチャと特定の要件を満たすために、多様なコンピューティングプラットフォームのサポートと拡張可能なオープン機能を提供します。
Dataphin を StarRocks と統合する方法はいくつかあります。
-
データ統合のためのソースまたはデスティネーションデータソースとして。データは StarRocks から読み取られ、他のデータソースにプッシュされるか、他のデータソースからプルされて StarRocks に書き込まれます。
-
Flink SQL およびデータストリーム開発のソーステーブル(無制限スキャン)、ディメンションテーブル(制限スキャン)、または結果テーブル(ストリーミングシンクおよびバッチシンク)として。
-
データウェアハウスまたはデータマートとして。StarRocks はコンピュートソースとして登録でき、SQL スクリプトの開発、スケジューリング、データ品質検出、セキュリティ識別、その他のデータ調査およびガバナンスタスクに使用できます。
データ統合
StarRocks データソースを作成し、オフライン統合タスクでソースデータベースまたはデスティネーションデータベースとして使用できます。手順は以下の通りです。
StarRocks データソースの作成
基本情報

-
名前: 必須。データソース名を入力します。中国語の文字、アルファベット、数字、アンダースコア (_)、ハイフン (-) のみを含むことができます。長さは 64 文字を超えることはできません。
-
データソースコード: 任意。データソースコードを設定した後、
data source code.tableまたはdata source code.schema.table形式でデータソース内の Flink SQL を参照できます。対応する環境でデータソースに自動的にアクセスしたい場合は、${data source code}.tableまたは${data source code}.schema.table形式でアクセスします。注意
現在、MySQL、Hologres、MaxCompute のデータソースのみがサポートされています。
-
サポートシナリオ: データソースが適用されるシナリオ。
-
説明: 任意。データソースの簡単な説明を入力できます。最大 128 文字まで入力可能です。
-
環境: ビジネスデータソースがプロダクションデータソースと開発データソースを区別する場合は、Prod and Dev を選択します。ビジネスデータソースがプロダクションと開発データソースを区別しない場合は、Prod を選択します。
-
タグ: データソースにラベルを付けるためのタグを選択できます。
設定情報

-
JDBC URL: 必須。形式は
jdbc:mysql://<host>:<port>/<dbname>です。hostは StarRocks クラスター内の FE (Front End) ホストの IP アドレス、portは FE のクエリポート、dbnameはデータベース名です。 -
Load URL: 必須。形式は
fe_ip:http_port;fe_ip:http_portです。fe_ipは FE (Front End) のホスト、http_portは FE のポートです。 -
ユーザー名: 必須。データベースのユーザー名です。
-
パスワード: 必須。データベースのパスワードです。
高度な設定

-
connectTimeout: データベースの connectTimeout (ミリ秒単位)。デフォルト値は 900000 ミリ秒 (15 分) です。
-
socketTimeout: データベースの socketTimeout (ミリ秒単位)。デフォルト値は 1800000 ミリ秒 (30 分) です。
StarRocks データソースからデータを読み取り、他のデータソースにデータを書き込む
StarRocks 入力コンポーネントをオフライン統合タスクキャンバスにドラッグ

StarRocks 入力コンポーネントの設定

-
ステップ名: 現在のコンポーネントのシナリオと位置に基づいて適切な名前を入力します。
-
データソース: Dataphin で作成された StarRocks データソースまたはプロジェクトを選択します。データソースの読み取り権限が必要です。満足するデータソースがない場合は、データソースを追加するか、関連する権限を申請できます。
-
ソーステーブル: 入力として同じテーブル構造を持つ単一または複数のテーブルを選択します。
-
テーブル: ドロップダウンリストから StarRocks データソース内のテーブルを選択します。
-
スプリットキー: 同時実行設定と共に使用されます。ソースデータテーブルの列をスプリットキーとして使用できます。スプリットキーとしてプライマリキーまたはインデックス付き列を使用することをお勧めします。
-
バッチ番号: バッチで抽出されるデータレコードの数。
-
入力フィルタリング: 任意。
以下の 2 つの場合、フィルター情報を入力する必要があります。
- 特定のデータをフィルタリングしたい場合。
- 日次でデータを増分追加するか、完全なデータを取得する必要がある場合、Dataphin コンソールのシステム時間として設定された日付を入力する必要があります。たとえば、StarRocks のトランザクションテーブルで、トランザクション作成日が
${bizdate}として設定されている場合。
-
出力フィールド: 入力テーブル情報に基づいて関連フィールドをリストします。フィールドの名前変更、削除、追加、移動が可能です。一般的に、フィールドは下流データの可読性を高めるために名前が変更されるか、出力時のフィールドマッピングを容易にするために変更されます。アプリケーションシナリオで関連フィールドが必要ないため、入力段階でフィールドを削除することができます。複数の入力データがマージされるか、下流側で出力される際に、異なる名前のフィールドを同じ行でマッピングすることにより、データを効果的にマージまたはマッピングできるように、フィールドの順序が変更されます。