Apache Spark StreamingのtWriteXMLFieldsプロパティ

これらのプロパティは、Spark Streamingジョブのフレームワークで実行されているtWriteXMLFieldsを設定するために使われます。

Spark StreamingのtWriteXMLFieldsコンポーネントは、変換処理ファミリーに属しています。

このコンポーネントのストリーミングバージョンは、Talend Real Time Big Data PlatformおよびTalend Data Fabricで利用できます。

基本設定

[Output type] (出力タイプ)	対象ファイルに出力するデータの種類を選択します。[byte] (バイト)を選択すると、データはバイト配列になります。
[Schema] (スキーマ)と[Edit schema] (スキーマを編集)	スキーマとは行の説明のことです。処理して次のコンポーネントに渡すフィールド(カラム)数を定義します。Sparkジョブを作成する場合、フィールドの命名時は予約語の`line`を避けます。このコンポーネントのスキーマは読み取り専用です。[Edit schema] (スキーマを編集)をクリックすると、スキーマを表示できます。出力タイプがString (文字列)の場合、読み取り専用の単一カラムはmessageContentになります。このカラムは、tJMSOutputなどの出力コンポーネントに文字列を提供します。出力タイプが[byte] (バイト)の場合、読み取り専用の単一カラムはserializedValueになります。このカラムは、tKafkaOutputなどの出力コンポーネントにバイト配列を提供します。出力スキーマと読み取り専用カラムは、Row (行) > Output(出力)リンクから同じジョブの続くコンポーネントをクリックすると表示されます。[Component] (コンポーネント)ビューの[Basic settings] (基本設定)タブにスキーマが表示されます。
[Row tag] (行タグ)	行ごとにデータとストラクチャーをラップするタグを指定します。
[Custom encoding] (カスタムエンコーディング)	保管データを処理する際、エンコーディングの問題が発生することがあります。このような場合は、チェックボックスをオンにして[Encoding] (エンコーディング)リストを表示します。リストからエンコーディングを選択するか、[CUSTOM] (カスタム)を選択して、手動で定義します。このフィールドはデータベースデータ処理の必須フィールドです。サポートされるエンコーディングは、使用しているJVMに応じて異なります。詳細は、https://docs.oracle.com (英語のみ)をご覧ください。

詳細設定

[Root tags] (ルートタグ)	数値に使用する区切りを変更する場合は、このチェックボックスを選択します。デフォルトでは、桁区切りはコンマ(,)で、小数点区切りはピリオド(.)です。
Output format (出力形式)	出力フォーマットを定義します。 [Column] (カラム): 入力スキーマから取得されたカラム。 [As attribute] (属性として): XML出力で親エレメントの属性として使うカラムのチェックボックスをオンにします。情報メモ注: 同じカラムが[Output format] (出力フォーマット)テーブルで属性として、[Use dynamic grouping] (動的グルーピングの使用)設定で動的グルーピングの条件として、その両方で選択されている場合、そのカラムには動的グループ設定のみが有効になります。 [Use schema column name] (スキーマカラム名を使用): デフォルトでは、このチェックボックスはすべてのカラムに対してオンになっているため、入力スキーマのカラムラベルがデータラッピングタグとして使われます。カラムの入力スキーマとは異なるタグを使う場合は、そのカラムのこのチェックボックスをオフにし、[Label] (ラベル)フィールドで引用符の間にタグラベルを指定します。
[Use dynamic grouping] (動的グルーピングを使う)	出力カラムを動的にグルーピングする場合は、このチェックボックスを選択します。[+]ボタンをクリックして、1つ以上のグルーピング基準を[Group by] (グループ基準)テーブルに追加します。 [Column] (カラム): グルーピングされた出力行のラップエレメントとして使うカラムを選択します。 [Attribute] (属性ラベル): グループラップエレメントの属性ラベルを引用符の間に入力します。

[Root tags] (ルートタグ)

数値に使用する区切りを変更する場合は、このチェックボックスを選択します。デフォルトでは、桁区切りはコンマ(,)で、小数点区切りはピリオド(.)です。

Output format (出力形式)

出力フォーマットを定義します。

[Column] (カラム): 入力スキーマから取得されたカラム。
[As attribute] (属性として): XML出力で親エレメントの属性として使うカラムのチェックボックスをオンにします。

注:

同じカラムが[Output format] (出力フォーマット)テーブルで属性として、[Use dynamic grouping] (動的グルーピングの使用)設定で動的グルーピングの条件として、その両方で選択されている場合、そのカラムには動的グループ設定のみが有効になります。

[Use schema column name] (スキーマカラム名を使用): デフォルトでは、このチェックボックスはすべてのカラムに対してオンになっているため、入力スキーマのカラムラベルがデータラッピングタグとして使われます。カラムの入力スキーマとは異なるタグを使う場合は、そのカラムのこのチェックボックスをオフにし、[Label] (ラベル)フィールドで引用符の間にタグラベルを指定します。

[Use dynamic grouping] (動的グルーピングを使う)

出力カラムを動的にグルーピングする場合は、このチェックボックスを選択します。[+]ボタンをクリックして、1つ以上のグルーピング基準を[Group by] (グループ基準)テーブルに追加します。

[Column] (カラム): グルーピングされた出力行のラップエレメントとして使うカラムを選択します。

[Attribute] (属性ラベル): グループラップエレメントの属性ラベルを引用符の間に入力します。

使用方法

使用ルール	このコンポーネントは、中間ステップとして使用されます。このコンポーネントは、所属するSpark Streamingのコンポーネントのパレットと共に、Spark Streamingジョブを作成している場合にだけ表示されます。特に明記していない限り、このドキュメントのシナリオでは、標準ジョブ、つまり従来の Talend データ統合ジョブだけを扱います。
[Spark Connection] (Spark接続)	[Run] (実行)ビューの[Spark configuration] (Spark設定)タブで、ジョブ全体でのSparkクラスターへの接続を定義します。また、ジョブでは、依存jarファイルを実行することを想定しているため、Sparkがこれらのjarファイルにアクセスできるように、これらのファイルの転送先にするファイルシステム内のディレクトリーを指定する必要があります。 Yarnモード(YarnクライアントまたはYarnクラスター): Google Dataprocを使用している場合、[Spark configuration] (Spark設定)タブの[Google Storage staging bucket] (Google Storageステージングバケット)フィールドにバケットを指定します。 HDInsightを使用している場合、[Spark configuration] (Spark設定)タブの[Windows Azure Storage configuration] (Windows Azure Storage設定)エリアでジョブのデプロイメントに使用するブロブを指定します。 Altusを使用する場合は、[Spark configuration] (Spark設定)タブでジョブのデプロイにS3バケットまたはAzure Data Lake Storageを指定します。 Quboleを使用する場合は、ジョブにtS3Configurationを追加し、QuboleでS3システム内に実際のビジネスデータを書き込みます。tS3Configurationを使用しないと、このビジネスデータはQubole HDFSシステムに書き込まれ、クラスターをシャットダウンすると破棄されます。オンプレミスのディストリビューションを使用する場合は、クラスターで使われているファイルシステムに対応する設定コンポーネントを使用します。一般的に、このシステムはHDFSになるため、tHDFSConfigurationを使用します。 [Standalone mode] (スタンドアロンモード): クラスターで使われているファイルシステム(tHDFSConfiguration Apache Spark BatchやtS3Configuration Apache Spark Batchなど)に対応する設定コンポーネントを使用します。ジョブ内に設定コンポーネントがない状態でDatabricksを使用している場合、ビジネスデータはDBFS (Databricks Filesystem)に直接書き込まれます。この接続は、ジョブごとに有効になります。

使用ルール

このコンポーネントは、中間ステップとして使用されます。

このコンポーネントは、所属するSpark Streamingのコンポーネントのパレットと共に、Spark Streamingジョブを作成している場合にだけ表示されます。

特に明記していない限り、このドキュメントのシナリオでは、標準ジョブ、つまり従来の Talend データ統合ジョブだけを扱います。

[Spark Connection] (Spark接続)

[Run] (実行)ビューの[Spark configuration] (Spark設定)タブで、ジョブ全体でのSparkクラスターへの接続を定義します。また、ジョブでは、依存jarファイルを実行することを想定しているため、Sparkがこれらのjarファイルにアクセスできるように、これらのファイルの転送先にするファイルシステム内のディレクトリーを指定する必要があります。

Yarnモード(YarnクライアントまたはYarnクラスター):
- Google Dataprocを使用している場合、[Spark configuration] (Spark設定)タブの[Google Storage staging bucket] (Google Storageステージングバケット)フィールドにバケットを指定します。
- HDInsightを使用している場合、[Spark configuration] (Spark設定)タブの[Windows Azure Storage configuration] (Windows Azure Storage設定)エリアでジョブのデプロイメントに使用するブロブを指定します。
- Altusを使用する場合は、[Spark configuration] (Spark設定)タブでジョブのデプロイにS3バケットまたはAzure Data Lake Storageを指定します。
- Quboleを使用する場合は、ジョブにtS3Configurationを追加し、QuboleでS3システム内に実際のビジネスデータを書き込みます。tS3Configurationを使用しないと、このビジネスデータはQubole HDFSシステムに書き込まれ、クラスターをシャットダウンすると破棄されます。
- オンプレミスのディストリビューションを使用する場合は、クラスターで使われているファイルシステムに対応する設定コンポーネントを使用します。一般的に、このシステムはHDFSになるため、tHDFSConfigurationを使用します。
[Standalone mode] (スタンドアロンモード): クラスターで使われているファイルシステム(tHDFSConfiguration Apache Spark BatchやtS3Configuration Apache Spark Batchなど)に対応する設定コンポーネントを使用します。

ジョブ内に設定コンポーネントがない状態でDatabricksを使用している場合、ビジネスデータはDBFS (Databricks Filesystem)に直接書き込まれます。

この接続は、ジョブごとに有効になります。

このページは役に立ちましたか?

このページまたはコンテンツにタイポ、ステップの省略、技術的エラーなどの問題が見つかった場合はお知らせください。

こちらにフィードバックをお寄せください