TIS扩展点列表
扩展点:99,实现插件:343
- com.qlangtech.tis.manage.IAppSource
- com.qlangtech.tis.extension.NoStorePlaceholderPlugin
- 🔐com.qlangtech.tis.plugin.items.manager.SystemErrorListItemsDeleteManager
- com.qlangtech.tis.plugin.items.manager.ApplicationListItemsDeleteManager
- com.qlangtech.tis.plugin.ontology.impl.delete.GlossaryDeletion
- com.qlangtech.tis.plugin.ontology.impl.delete.LinkTypesDeletion
- com.qlangtech.tis.plugin.ontology.impl.delete.ObjectTypeDeletion
- com.qlangtech.tis.plugin.ontology.impl.delete.SharedPropertiesDeletion
- com.qlangtech.tis.plugin.ontology.impl.delete.ValueTypesDeletion
- com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeChangeBinding
- com.qlangtech.tis.plugin.datax.doris.CreateTable
- com.qlangtech.tis.plugin.tdfs.TDFSLinker
- com.qlangtech.tis.plugin.datax.transformer.UDFDefinition
- com.qlangtech.tis.plugin.datax.transformer.impl.AutoGenerateBigIntIDUDF
- com.qlangtech.tis.plugin.datax.transformer.impl.ConcatUDF
- com.qlangtech.tis.plugin.datax.transformer.impl.CopyConstantValUDF
- com.qlangtech.tis.plugin.datax.transformer.impl.CopyValUDF
- com.qlangtech.tis.plugin.datax.transformer.impl.DataMaskingUDF
- com.qlangtech.tis.plugin.datax.transformer.impl.JSONSplitterUDF
- com.qlangtech.tis.plugin.datax.transformer.impl.JoinerUDF
- com.qlangtech.tis.plugin.datax.transformer.impl.RegexPatternReplace
- com.qlangtech.tis.plugin.datax.transformer.impl.SubStrUDF
- com.qlangtech.tis.plugin.datax.seq.SeqKey
- com.qlangtech.tis.plugins.incr.flink.chunjun.script.ChunjunStreamScriptType
- com.qlangtech.plugins.incr.flink.cdc.mongdb.UpdateRecordComplete
- com.qlangtech.tis.datax.job.DataXJobWorker
- com.qlangtech.tis.plugin.paimon.datax.utils.PaimonConfig
- com.qlangtech.tis.plugin.incr.TISRateLimiter
- com.qlangtech.tis.plugin.ds.oracle.ConnEntity
- com.qlangtech.tis.plugin.paimon.catalog.CatalogCache
- com.qlangtech.tis.plugin.incr.TISSinkFactory
- com.qlangtech.plugins.incr.flink.chunjun.clickhouse.sink.ChunjunClickhouseSinkFactory
- com.qlangtech.plugins.incr.flink.chunjun.dameng.sink.ChunjunDamengSinkFactory
- com.qlangtech.plugins.incr.flink.chunjun.doris.sink.ChunjunDorisSinkFactory
- com.qlangtech.tis.plugins.incr.flink.cdc.pipeline.kafka.sink.KafkaPipelineSinkFactory
- com.qlangtech.tis.plugins.incr.flink.connector.kingbase.sink.KingBaseSinkFactory
- com.qlangtech.tis.plugins.incr.flink.connector.sink.MySQLSinkFactory
- com.qlangtech.tis.plugins.incr.flink.maria.sink.MariaDBSinkFactory
- com.qlangtech.plugins.incr.flink.chunjun.oracle.sink.ChunjunOracleSinkFactory
- com.qlangtech.plugins.incr.flink.chunjun.postgresql.sink.ChunjunPostgreSQLSinkFactory
- com.qlangtech.tis.plugins.incr.flink.connector.sink.SqlServerSinkFactory
- com.qlangtech.tis.plugins.incr.flink.chunjun.starrocks.sink.ChunjunStarRocksSinkFactory
- com.qlangtech.tis.plugins.incr.flink.pipeline.paimon.sink.PaimonPipelineSinkFactory
- com.qlangtech.tis.plugins.incr.flink.connector.elasticsearch7.ElasticSearchSinkFactory
- com.qlangtech.tis.plugin.ontology.chatbi.config.RetryConfig
- com.qlangtech.tis.plugin.incr.IncrStreamFactory
- com.qlangtech.tis.plugin.MemorySpecification
- com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.FormatFactory
- com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.canaljson.TISCanalJsonFormatFactory
- com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.canaljson.TISSourceCanalJsonFormatFactory
- com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.debeziumjson.TISSinkDebeziumJsonFormatFactory
- com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.debeziumjson.TISSourceDebeziumJsonFormatFactory
- com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.json.SourceJsonFormatFactory
- com.qlangtech.tis.offline.FileSystemFactory
- com.qlangtech.tis.plugin.ds.SplitTableStrategy
- com.qlangtech.tis.datax.impl.DataxReader
- com.qlangtech.tis.plugin.datax.dameng.reader.DataXDaMengReader
- com.qlangtech.tis.plugin.datax.DataXDFSReader
- com.qlangtech.tis.plugin.datax.kingbase.DataXKingBaseReader
- com.qlangtech.tis.plugin.datax.DataXMariaReader
- com.qlangtech.tis.plugin.datax.DataXMongodbReader
- com.qlangtech.tis.plugin.datax.DataXOracleReader
- com.qlangtech.tis.plugin.datax.DataXPostgresqlReader
- com.qlangtech.tis.plugin.datax.DataXSqlserverReader
- com.qlangtech.tis.plugin.datax.DataxMySQLReader
- com.qlangtech.tis.plugin.doris.DataXDorisReader
- com.qlangtech.tis.plugin.datax.kafka.reader.DataXKafkaReader
- com.qlangtech.tis.hive.reader.DataXHiveReader
- com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTarget
- com.qlangtech.tis.plugin.datax.powerjob.ServerPortExport
- com.qlangtech.tis.plugin.datax.format.FileFormat
- com.qlangtech.tis.plugin.ontology.impl.linker.LinkReference
- com.qlangtech.tis.plugin.paimon.datax.writemode.WriteMode
- com.qlangtech.tis.plugin.datax.meta.MetaDataWriter
- com.qlangtech.tis.plugin.ontology.OntologyProperty
- com.qlangtech.tis.plugin.ontology.chatbi.config.TraceConfig
- com.qlangtech.plugins.incr.flink.launch.CheckpointFactory
- com.qlangtech.tis.plugin.ds.DataSourceFactoryManipulate
- com.qlangtech.tis.plugin.paimon.datax.writebuffer.PaimonWriteBuffer
- com.qlangtech.plugins.incr.flink.launch.clustertype.ClusterType
- com.qlangtech.tis.datax.DataXJobSubmit
- com.qlangtech.tis.plugin.datax.kingbase.KingBaseCompatibleMode
- com.qlangtech.tis.async.message.client.consumer.impl.MQListenerFactory
- com.qlangtech.tis.plugin.kafka.consumer.KafkaMQListenerFactory
- com.qlangtech.plugins.incr.flink.cdc.kingbase.FlinkCDCKingBaseSourceFactory
- com.qlangtech.plugins.incr.flink.cdc.mongdb.FlinkCDCMongoDBSourceFactory
- com.qlangtech.tis.plugins.incr.flink.cdc.maria.FlinkCDCMariaDBSourceFactory
- com.qlangtech.tis.plugins.incr.flink.cdc.mysql.FlinkCDCMySQLSourceFactory
- com.qlangtech.plugins.incr.flink.cdc.oracle.FlinkCDCOracleSourceFactory
- com.qlangtech.plugins.incr.flink.cdc.postgresql.FlinkCDCPostreSQLSourceFactory
- com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.FlinkCDCSqlServerSourceFactory
- com.qlangtech.tis.datax.DefaultDataXProcessorManipulate
- com.qlangtech.tis.plugin.datax.mongo.UpsertSupport
- com.qlangtech.tis.plugin.datax.powerjob.PowerJobOMS
- com.qlangtech.plugins.incr.flink.cdc.pglike.PGLikeReplicaIdentity
- com.qlangtech.tis.plugin.datax.FSFormat
- com.qlangtech.tis.plugin.paimon.datax.compact.PaimonCompaction
- com.qlangtech.tis.plugin.k8s.K8sImage
- com.qlangtech.tis.plugin.paimon.datax.PaimonSequenceFields
- com.qlangtech.tis.plugin.paimon.datax.ChangelogProducer
- com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.CDCStartupOptions
- com.qlangtech.plugins.incr.flink.launch.StateBackendFactory
- com.qlangtech.tis.plugin.datax.powerjob.PowerJobOMSStorage
- com.qlangtech.tis.plugin.ontology.chatbi.config.ValidationConfig
- com.qlangtech.tis.plugins.incr.flink.chunjun.offset.StartLocation
- com.qlangtech.tis.plugin.datax.common.AutoCreateTable
- com.qlangtech.tis.plugin.datax.ClickhouseAutoCreateTable
- com.qlangtech.tis.plugin.datax.dameng.writer.DaMengAutoCreateTable
- com.qlangtech.tis.plugin.datax.doris.DorisAutoCreateTable
- com.qlangtech.tis.plugin.datax.OdpsAutoCreateTable
- com.qlangtech.tis.plugin.datax.OracleAutoCreateTable
- com.qlangtech.tis.plugin.paimon.datax.utils.PaimonAutoCreateTable
- com.qlangtech.tis.plugin.datax.PostgreSQLAutoCreateTable
- com.qlangtech.tis.plugin.datax.SqlServerAutoCreateTable
- com.qlangtech.tis.plugin.datax.starrocks.StarRocksAutoCreateTable
- com.qlangtech.tis.plugin.datax.KingBaseMySQLModeAutoCreateTable
- com.qlangtech.tis.plugin.datax.MySQLAutoCreateTable
- com.qlangtech.tis.plugin.datax.HiveAutoCreateTable
- com.qlangtech.tis.plugin.datax.common.AutoCreateTableColCommentSwitch
- com.qlangtech.tis.config.authtoken.UserToken
- com.qlangtech.tis.plugin.datax.transformer.impl.joiner.TargetRowsCache
- com.qlangtech.plugins.incr.flink.launch.RestartStrategyFactory
- com.qlangtech.tis.plugin.datax.format.guesstype.GuessFieldType
- com.qlangtech.tis.plugin.trigger.JobTrigger
- com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaProtocol
- com.qlangtech.tis.plugin.paimon.catalog.PaimonCatalog
- com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeBinding
- com.qlangtech.tis.plugins.incr.flink.chunjun.poll.Polling
- com.qlangtech.tis.plugin.ds.oracle.Authorized
- com.qlangtech.tis.config.hive.meta.PartitionFilter
- com.qlangtech.tis.hive.PartitionPathPattern
- com.qlangtech.tis.plugin.ontology.chatbi.config.RetrievalConfig
- com.qlangtech.tis.plugin.ds.DataSourceFactory
- com.qlangtech.tis.plugin.ds.clickhouse.ClickHouseDataSourceFactory
- com.qlangtech.tis.plugin.datax.dameng.ds.DaMengDataSourceFactory
- com.qlangtech.tis.plugin.ds.doris.DorisSourceFactory
- com.qlangtech.tis.plugin.ds.kingbase.KingBaseDataSourceFactory
- com.qlangtech.tis.plugin.datax.MariaDBDataSourceFactory
- com.qlangtech.tis.plugin.ds.mangodb.MangoDBDataSourceFactory
- com.qlangtech.tis.plugin.datax.odps.OdpsDataSourceFactory
- com.qlangtech.tis.plugin.ds.oracle.OracleDataSourceFactory
- com.qlangtech.tis.plugin.ds.postgresql.PGDataSourceFactory
- com.qlangtech.tis.plugin.ds.sqlserver.SqlServer2008DatasourceFactory
- 🔐com.qlangtech.tis.plugin.ds.sqlserver.SqlServer2019DatasourceFactory
- com.qlangtech.tis.plugin.ds.starrocks.StarRocksSourceFactory
- com.qlangtech.tis.plugin.ds.mysql.MySQLV5DataSourceFactory
- 🔐com.qlangtech.tis.plugin.ds.mysql.MySQLV8DataSourceFactory
- com.qlangtech.tis.hive.Hiveserver2DataSourceFactory
- com.qlangtech.tis.plugin.ontology.chatbi.config.ExecutionConfig
- com.qlangtech.tis.plugin.ontology.impl.aggregation.AggregationKind
- com.qlangtech.tis.plugin.ontology.impl.aggregation.ApproxCardinalityAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.AverageAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.CollectListAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.CollectSetAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.CountAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.CountDistinctAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.MaxAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.MinAgg
- com.qlangtech.tis.plugin.ontology.impl.aggregation.SumAgg
- com.qlangtech.tis.datax.impl.DataxWriter
- com.qlangtech.tis.plugin.datax.DataXClickhouseWriter
- com.qlangtech.tis.plugin.datax.dameng.writer.DataXDaMengWriter
- com.qlangtech.tis.plugin.datax.DataXDFSWriter
- com.qlangtech.tis.plugin.datax.doris.DataXDorisWriter
- com.qlangtech.tis.plugin.datax.DataXElasticsearchWriter
- com.qlangtech.tis.plugins.datax.kafka.writer.DataXKafkaWriter
- com.qlangtech.tis.plugin.datax.kingbase.DataXKingBaseWriter
- com.qlangtech.tis.plugin.datax.DataXMariaWriter
- com.qlangtech.tis.plugin.datax.DataXMongodbWriter
- com.qlangtech.tis.plugin.datax.DataXOdpsWriter
- com.qlangtech.tis.plugin.datax.DataXOracleWriter
- com.qlangtech.tis.plugin.paimon.datax.DataxPaimonWriter
- com.qlangtech.tis.plugin.datax.DataXPostgresqlWriter
- com.qlangtech.tis.plugin.datax.DataXSqlserverWriter
- com.qlangtech.tis.plugin.datax.starrocks.DataXStarRocksWriter
- com.qlangtech.tis.plugin.datax.DataxMySQLWriter
- com.qlangtech.tis.plugin.datax.DataXHiveWriter
- com.qlangtech.tis.plugin.datax.DataXSparkWriter
- com.qlangtech.tis.plugin.paimon.datax.PaimonPartition
- com.qlangtech.tis.config.spark.SparkConnStrategy
- com.qlangtech.tis.plugin.paimon.datax.bucket.PaimonBucketKeys
- com.qlangtech.tis.extension.OneStepOfMultiSteps
- com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep1
- com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep2Execute
- com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep2Prompt
- com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep3Execute
- com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep3Prompt
- com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeBackingObjectType
- com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeJoinTableDataset
- com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeObjectTypeForeignKeys
- com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeSetter
- com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeProfile
- com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeProperties
- com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypePropertiesRelevant
- com.qlangtech.tis.plugin.ontology.impl.valuetype.ConstraintsOfValueType
- com.qlangtech.tis.plugin.ontology.impl.valuetype.MetadataOfValueType
- com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSelectDataSource
- com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSelectTable
- com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSetMatchConditionAndCols
- com.qlangtech.tis.plugin.paimon.datax.bucket.PaimonBucket
- com.qlangtech.tis.config.kerberos.Krb5Res
- com.qlangtech.tis.plugin.ontology.BasicOntologyPropertyTypeRef
- com.qlangtech.tis.plugin.AuthToken
- com.qlangtech.tis.config.ParamsConfig
- 🔐com.qlangtech.tis.plugin.alert.impl.DingTalkAlertChannel
- 🔐com.qlangtech.tis.plugin.alert.impl.LarkAlertChannel
- 🔐com.qlangtech.tis.plugin.alert.impl.WeComAlertChannel
- com.qlangtech.tis.plugin.HttpEndpoint
- com.qlangtech.tis.plugin.aliyun.AliyunEndpoint
- com.qlangtech.tis.plugin.datax.DataXGlobalConfig
- com.qlangtech.tis.plugin.datax.server.FTPServer
- com.qlangtech.tis.plugin.datax.elastic.ElasticEndpoint
- com.qlangtech.tis.plugin.datax.LocalDataXJobSubmitParams
- com.qlangtech.tis.config.spark.impl.DefaultSparkConnGetter
- com.qlangtech.tis.config.yarn.YarnConfig
- com.qlangtech.tis.hive.DefaultHiveConnGetter
- com.qlangtech.tis.config.k8s.impl.DefaultK8sContext
- com.qlangtech.tis.kerberos.KerberosCfg
- com.qlangtech.plugins.incr.flink.common.FlinkCluster
- com.qlangtech.plugins.incr.flink.launch.clustertype.StandaloneFlinkDeployingAIAssistSupport
- com.qlangtech.tis.plugin.tdfs.DFSResMatcher
- com.qlangtech.tis.plugin.datax.kingbase.KingBaseDispatch
- com.qlangtech.tis.plugin.datax.kafka.reader.StartOffset
- com.qlangtech.tis.plugin.datax.kafka.reader.offsets.CommittedOffsets
- com.qlangtech.tis.plugin.datax.kafka.reader.offsets.EarliestOffsets
- com.qlangtech.tis.plugin.datax.kafka.reader.offsets.EarliestWhenNoneCommittedOffsets
- com.qlangtech.tis.plugin.datax.kafka.reader.offsets.LatestOffsets
- com.qlangtech.tis.plugin.datax.kafka.reader.offsets.TimestampOffsets
- com.qlangtech.tis.plugin.ds.DataSourceCatalog
- com.qlangtech.tis.hive.HiveMeta
- com.qlangtech.tis.plugin.ontology.Ontology
- com.qlangtech.tis.plugin.ontology.impl.glossary.DefaultOntologyGlossary
- com.qlangtech.tis.plugin.ontology.impl.linker.DefaultOntologyLinker
- com.qlangtech.tis.plugin.ontology.impl.objtype.DefaultOntologyObjectType
- com.qlangtech.tis.plugin.ontology.impl.sharedproperty.DefaultOntologySharedProperty
- com.qlangtech.tis.plugin.ontology.impl.valuetype.DefaultOntologyValueType
- com.qlangtech.tis.plugin.paimon.catalog.CatalogLock
- com.qlangtech.tis.plugin.datax.kafka.reader.subscriptionmethod.KafkaSubscriptionMethod
- com.qlangtech.tis.plugin.datax.SelectedTabExtend
- com.qlangtech.tis.plugins.incr.flink.connector.UpdateMode
- com.qlangtech.tis.plugin.ontology.OntologyDomain
- com.qlangtech.tis.plugins.incr.flink.cdc.mysql.startup.StartupOptions
- com.qlangtech.tis.plugin.ontology.impl.objtype.OntologyPrimaryKeySetter
- com.qlangtech.tis.plugin.ontology.OntologyDomainManipulate
- com.qlangtech.tis.plugin.paimon.datax.utils.PaimonSnapshot
- com.qlangtech.tis.plugin.datax.SelectedTab
- com.qlangtech.tis.plugin.ontology.impl.valuetype.ValueConstraint
- com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Enum4Integer
- com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Enum4String
- com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4Decimal
- com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4Integer
- com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4String
- com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4TimeStamp
- com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Regex
- com.qlangtech.plugins.incr.flink.cdc.mongdb.MongoCDCStartupOptions
- com.qlangtech.tis.plugin.ontology.PropertyRoleType
- com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilter
- com.qlangtech.tis.hive.Hms
com.qlangtech.tis.manage.IAppSource
com.qlangtech.tis.plugin.datax.DataFlowDataXProcessor
显示名: WorkflowProcessor
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
全局配置
- 类型: 单选
- 必须: 是
- 默认值: datax-global-config
- 说明: 无
com.qlangtech.tis.plugin.datax.DefaultDataxProcessor
显示名: DataxProcessor
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
全局配置
- 类型: 单选
- 必须: 是
- 默认值: datax-global-config
- 说明: 无
所属部门
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.manage.biz.dal.pojo.Department.dftDepartmentId()
- 说明: 无
接口人
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@6c8e5ac4
- 说明: 数据通道的业务联系人,如运行生命周期内有任何问题可以向他咨询
com.qlangtech.tis.extension.NoStorePlaceholderPlugin
🔐com.qlangtech.tis.plugin.items.manager.SystemErrorListItemsDeleteManager
显示名: SystemErrorRecord_delete
全路径名: com.qlangtech.tis.plugin.items.manager.SystemErrorListItemsDeleteManager
费用: 🔐
社区协作配置项说明:
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.items.manager.ApplicationListItemsDeleteManager
显示名: BuildHistoricalRecord_delete
全路径名: com.qlangtech.tis.plugin.items.manager.ApplicationListItemsDeleteManager
费用: 😄
社区版(免费)配置项说明:
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.ontology.impl.delete.GlossaryDeletion
显示名: OntologyGlossary_delete
全路径名: com.qlangtech.tis.plugin.ontology.impl.delete.GlossaryDeletion
费用: 😄
社区版(免费)配置项说明:
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.ontology.impl.delete.LinkTypesDeletion
显示名: OntologyLinkType_delete
全路径名: com.qlangtech.tis.plugin.ontology.impl.delete.LinkTypesDeletion
费用: 😄
社区版(免费)配置项说明:
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.ontology.impl.delete.ObjectTypeDeletion
显示名: OntologyObjectType_delete
全路径名: com.qlangtech.tis.plugin.ontology.impl.delete.ObjectTypeDeletion
费用: 😄
社区版(免费)配置项说明:
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.ontology.impl.delete.SharedPropertiesDeletion
显示名: OntologySharedProperty_delete
全路径名: com.qlangtech.tis.plugin.ontology.impl.delete.SharedPropertiesDeletion
费用: 😄
社区版(免费)配置项说明:
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.ontology.impl.delete.ValueTypesDeletion
显示名: OntologyValueType_delete
全路径名: com.qlangtech.tis.plugin.ontology.impl.delete.ValueTypesDeletion
费用: 😄
社区版(免费)配置项说明:
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeChangeBinding
显示名: OntologyObjectType_changeBinding
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeChangeBinding
费用: 😄
社区版(免费)配置项说明:
目标数据源
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 批量切换绑定的目标数据源
目标主键(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要删除的目标主键列表
com.qlangtech.tis.plugin.datax.doris.CreateTable
com.qlangtech.tis.plugin.datax.doris.datamodel.DuplicateCreateTable
显示名: Duplicate
全路径名: com.qlangtech.tis.plugin.datax.doris.datamodel.DuplicateCreateTable
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.doris.datamodel.UniqueCreateTable
显示名: Unique
全路径名: com.qlangtech.tis.plugin.datax.doris.datamodel.UniqueCreateTable
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.tdfs.TDFSLinker
com.qlangtech.tis.plugin.datax.aliyunoss.AliyunOSSTDFSLinker
显示名: AlyiunOSS
全路径名: com.qlangtech.tis.plugin.datax.aliyunoss.AliyunOSSTDFSLinker
费用: 😄
社区版(免费)配置项说明:
远端连接
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
bucket
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:OSS的bucket
rootPath
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 描述:TIS 查找可用资源文件会从该路径下遍历查找
com.qlangtech.tis.plugin.datax.tdfs.impl.FtpTDFSLinker
显示名: FTP
全路径名: com.qlangtech.tis.plugin.datax.tdfs.impl.FtpTDFSLinker
费用: 😄
社区版(免费)配置项说明:
远端连接
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: FTP服务端连接配置
path
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 描述:FTP文件系统的路径信息,FtpWriter会写入Path目录下属多个文件。
com.qlangtech.tis.plugin.datax.tdfs.impl.LocalFileDFSLinker
显示名: Local Files
全路径名: com.qlangtech.tis.plugin.datax.tdfs.impl.LocalFileDFSLinker
费用: 😄
社区版(免费)配置项说明:
path
类型: 单行文本
必须: 是
默认值: 无
说明:
描述:本地文件系统的路径(绝对路径),必须为目录路径,该目录下存放有目标资源文件
com.qlangtech.tis.plugin.datax.hdfs.HdfsTDFDLinker
显示名: Hdfs
费用: 😄
社区版(免费)配置项说明:
远端连接
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:Hadoop hdfs文件系统namenode节点地址。格式:hdfs://ip:端口;例如:hdfs://127.0.0.1:9000
path
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据文件保存的路径位置
com.qlangtech.tis.hive.reader.HiveDFSLinker
显示名: Hive
费用: 😄
社区版(免费)配置项说明:
远端连接
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
fsName
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:Hadoop hdfs文件系统namenode节点地址。格式:hdfs://ip:端口;例如:hdfs://127.0.0.1:9000
文件格式
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@59278072
- 说明: 目前支持三种存储格式:Text:普通文本,一行一条用分隔符分隔,HFile:HBase使用的存储格式,Parquet:最常用的列存格式文件,ORC文件格式
com.qlangtech.tis.plugin.datax.transformer.UDFDefinition
com.qlangtech.tis.plugin.datax.transformer.impl.AutoGenerateBigIntIDUDF
显示名: Create BigInt
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.AutoGenerateBigIntIDUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
valType
- 类型: 单选
- 必须: 是
- 默认值: base_on_snowflake
- 说明: 选择生成bigInt值的类型,一种是线程绑定的基于AtomicLong的自增类型,另外一种是基于Twitter snowflake algorithm的Long类型值生成
to
类型: 多选
必须: 是
默认值: 无
说明:
设置合并到的列,有两种执行模式:
- 可以新添加一列: 可以选择
Virtual Column,设置新列的名称,并且为新列设置类型 - 替换原有记录的值: 可以选择
Target Column,从下拉列表中选择原有记录中的某一列作为替换目标
- 可以新添加一列: 可以选择
com.qlangtech.tis.plugin.datax.transformer.impl.ConcatUDF
显示名: Concat Fields
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.ConcatUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
from
类型: 多选
必须: 是
默认值: 无
说明:
从下拉列表中选择记录中的某一列,作为需要转换的值来源。
TIS中某些数据端是支持上下文绑定参数,参数以
$开头,例如,兼容JDBC接口的数据端类型,TIS提供了$dbName,$tableName,$timestamp等上下文绑定参数,以下是绑定参数说明:$dbName:源端数据库名称$tableName:源端数据库表名称$timestamp:当前系统运行时间戳,类型为:TIMESTAMP(精确到毫秒,该值依赖于运行所在节点的系统时间,请校对正确)
以上
$dbName,$tableName参数 分别对应当前执行数据同步的数据库及数据表名称,供用户选择,参与当前Transformer算子中作为入参执行计算。
分隔符
- 类型: 单选
- 必须: 是
- 默认值: Empty
- 说明: 选择字段分隔符
to
类型: 多选
必须: 是
默认值: 无
说明:
设置合并到的列,有两种执行模式:
- 可以新添加一列: 可以选择
Virtual Column,设置新列的名称,并且为新列设置类型 - 替换原有记录的值: 可以选择
Target Column,从下拉列表中选择原有记录中的某一列作为替换目标
- 可以新添加一列: 可以选择
com.qlangtech.tis.plugin.datax.transformer.impl.CopyConstantValUDF
显示名: Copy Constant
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.CopyConstantValUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
常量值
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 用户设置常量内容,数据同步阶段会直接将该常量值同步到目标列中
to
类型: 多选
必须: 是
默认值: 无
说明:
设置拷贝到的列,有两种执行模式:
- 可以新添加一列: 可以选择
Virtual Column,设置新列的名称,并且为新列设置类型 - 替换原有记录的值: 可以选择
Target Column,从下拉列表中选择原有记录中的某一列作为替换目标
- 可以新添加一列: 可以选择
com.qlangtech.tis.plugin.datax.transformer.impl.CopyValUDF
显示名: Copy Field
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.CopyValUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
from
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 从下拉列表中选择记录中的某一列,作为需要转换的值来源
to
类型: 多选
必须: 是
默认值: 无
说明:
设置拷贝到的列,有两种执行模式:
- 可以新添加一列: 可以选择
Virtual Column,设置新列的名称,并且为新列设置类型 - 替换原有记录的值: 可以选择
Target Column,从下拉列表中选择原有记录中的某一列作为替换目标
- 可以新添加一列: 可以选择
com.qlangtech.tis.plugin.datax.transformer.impl.DataMaskingUDF
显示名: Data Masking
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.DataMaskingUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
from
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 从下拉列表中选择记录中的某一列,作为需要转换的值来源
开始位置
- 类型: 整型数字
- 必须: 是
- 默认值: 0
- 说明: 设置需要截取字段的开始位置
截取长度
- 类型: 整型数字
- 必须: 是
- 默认值: 9999
- 说明: 设置需要截取字段的长度
替换字符
- 类型: 单行文本
- 必须: 是
- 默认值: *
- 说明: 用于脱敏替换使用的字符,注意:替换字符只能由长度为1的字符构成
to
类型: 多选
必须: 是
默认值: 无
说明:
设置拷贝到的列,有两种执行模式:
- 可以新添加一列: 可以选择
Virtual Column,设置新列的名称,并且为新列设置类型 - 替换原有记录的值: 可以选择
Target Column,从下拉列表中选择原有记录中的某一列作为替换目标
- 可以新添加一列: 可以选择
com.qlangtech.tis.plugin.datax.transformer.impl.JSONSplitterUDF
显示名: JSON Splitter
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.JSONSplitterUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
from
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 从下拉列表中选择记录中的某一列,作为需要转换的值来源
prefix
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 设置新拆分目标列的前缀,达到方便用户识别和避免与原有记录的列重复的目的
to
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 设置json数据结构中的列名及数据类型
skipError
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 解析json过程中如发生解析错误的情况,是否直接跳过,或抛出异常最终会导致导入程序执行终止
com.qlangtech.tis.plugin.datax.transformer.impl.JoinerUDF
显示名: Joiner Outer Table
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.JoinerUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
com.qlangtech.tis.plugin.datax.transformer.impl.RegexPatternReplace
显示名: Regex Replace
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.RegexPatternReplace
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
from
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 从下拉列表中选择记录中的某一列,作为需要转换的值来源
模式
类型: 单行文本
必须: 是
默认值: 无
说明:
使用正则式匹配目标字段内容,例如,现有数据列为
yyyy-MM-dd格式,用户希望将内容格式变成yyyy-MM,则可以进行如下设置:将
模式内容设置为^(\d{4}-\d{2})-\d{2}$,替换内容内容设置为$1
替换内容
类型: 单行文本
必须: 是
默认值: 无
说明:
例如,现有数据列为
yyyy-MM-dd格式,用户希望将内容格式变成yyyy-MM,则可以进行如下设置:将
模式内容设置为^(\d{4}-\d{2})-\d{2}$,替换内容内容设置为$1
throwErrorNotMatch
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 如果模式没有匹配,则主动抛出异常终止处理
com.qlangtech.tis.plugin.datax.transformer.impl.SubStrUDF
显示名: SubStr
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.SubStrUDF
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
from
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 从下拉列表中选择记录中的某一列,作为需要转换的值来源
开始位置
- 类型: 整型数字
- 必须: 是
- 默认值: 0
- 说明: 设置需要截取字段的开始位置
截取长度
- 类型: 整型数字
- 必须: 是
- 默认值: 9999
- 说明: 设置需要截取字段的长度
to
类型: 多选
必须: 是
默认值: 无
说明:
设置拷贝到的列,有两种执行模式:
- 可以新添加一列: 可以选择
Virtual Column,设置新列的名称,并且为新列设置类型 - 替换原有记录的值: 可以选择
Target Column,从下拉列表中选择原有记录中的某一列作为替换目标
- 可以新添加一列: 可以选择
com.qlangtech.tis.plugin.datax.seq.SeqKey
com.qlangtech.tis.plugin.datax.seq.OffSeqKey
显示名: off
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.seq.OnSeqKey
显示名: on
费用: 😄
社区版(免费)配置项说明:
seqKey
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugins.incr.flink.chunjun.script.ChunjunStreamScriptType
com.qlangtech.tis.plugins.incr.flink.chunjun.script.ChunjunSqlType
显示名: SQL
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.script.ChunjunSqlType
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.chunjun.script.StreamApiScript
显示名: StreamAPI
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.script.StreamApiScript
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.cdc.mongdb.UpdateRecordComplete
com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.updatecomplete.FullChangelog
显示名: FULL_CHANGE_LOG
全路径名: com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.updatecomplete.FullChangelog
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.updatecomplete.UpdateLookup
显示名: UPDATE_LOOKUP
全路径名: com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.updatecomplete.UpdateLookup
费用: 😄
社区版(免费)
com.qlangtech.tis.datax.job.DataXJobWorker
🔐com.qlangtech.plugins.incr.flink.cluster.FlinkK8SClusterManager
显示名: flink-cluster
全路径名: com.qlangtech.plugins.incr.flink.cluster.FlinkK8SClusterManager
提供者: TIS
费用: 🔐
社区协作配置项说明:
clusterId
类型: 单行文本
必须: 是
默认值: tis-flink-cluster-1
说明:
The cluster-id, which should be no more than 45 characters, is used for identifying a unique Flink cluster. The id must only contain lowercase alphanumeric characters and "-". The required format is
a-z. If not set, the client will automatically generate it with a random ID.The
cluster-id, which should be no more than 45 characters, is used for identifying a unique Flink cluster.
k8sImage
- 类型: 单选
- 必须: 是
- 默认值: flink-cluster
- 说明: 选择一个与该执行器匹配的Docker Image实例
服务暴露
- 类型: 整型数字
- 必须: 是
- 默认值: 无
- 说明: Flink集群 启动之后将默认8081端口对外部暴露,可选择K8S相应暴露服务端口方式,如:NodePort,Ingress,LoadBalance
jmMemory
类型: 字节规格容量
必须: 是
默认值: 1600
说明:
Total Process Memory size for the JobManager. This includes all the memory that a JobManager JVM process consumes, consisting of Total Flink Memory, JVM Metaspace, and JVM Overhead. In containerized setups, this should be set to the container memory. See also 'jobmanager.memory.flink.size' for Total Flink Memory size configuration.
单位:
mbTotal Process Memory size for the JobManager.This includes all the memory that a JobManager JVM process consumes, consisting of Total Flink Memory, JVM Metaspace, and JVM Overhead. In containerized setups, this should be set to the container memory. See also 'jobmanager.memory.flink.size' for Total Flink Memory size configuration.
tmMemory
类型: 字节规格容量
必须: 是
默认值: 1728
说明:
Total Process Memory size for the TaskExecutors. This includes all the memory that a TaskExecutor consumes, consisting of Total Flink Memory, JVM Metaspace, and JVM Overhead. On containerized setups, this should be set to the container memory. See also 'taskmanager.memory.flink.size' for total Flink memory size configuration.
单位:
mbTotal Flink Memory size for the TaskExecutors.This includes all the memory that a TaskExecutor consumes, except for JVM Metaspace and JVM Overhead. It consists of Framework Heap Memory, Task Heap Memory, Task Off-Heap Memory, Managed Memory, and Network Memory. See also '%s' for total process memory size configuration.
tmCPUCores
类型: 整型数字
必须: 否
默认值: 1000
说明:
CPU cores for the TaskExecutors. In case of Yarn setups, this value will be rounded to the closest positive integer. If not explicitly configured, legacy config options 'yarn.containers.vcores' and 'kubernetes.taskmanager.cpu' will be used for Yarn / Kubernetes setups, and 'taskmanager.numberOfTaskSlots' will be used for standalone setups (approximate number of slots).
*1000个单位代表一个1 CPU Core
taskSlot
类型: 整型数字
必须: 是
默认值: 1
说明:
The number of parallel operator or user function instances that a single TaskManager can run. If this value is larger than 1, a single TaskManager takes multiple instances of a function or operator. That way, the TaskManager can utilize multiple CPU cores, but at the same time, the available memory is divided between the different operator or function instances. This value is typically proportional to the number of physical CPU cores that the TaskManager's machine has (e.g., equal to the number of cores, or half the number of cores).
svcAccount
类型: 单行文本
必须: 是
默认值: default
说明:
Service account that is used by jobmanager and taskmanager within kubernetes cluster. Notice that this can be overwritten by config options 'kubernetes.jobmanager.service-account' and 'kubernetes.taskmanager.service-account' for jobmanager and taskmanager respectively.
授权
类型: 单选
必须: 是
默认值: true
说明:
保证Flink 在Kubernetes(Session / Application)模式下拥有执行所有操作都有相应的权限,如不拥有相应权限则会报以下错误:
io.fabric8.kubernetes.client.KubernetesClientException: pods is forbidden:
User "system:serviceaccount:default:default" cannot watch resource "pods" in API group "" in the namespace "default"如选择:是,执行过程会查看系统是否有 rolebing:tis-flink-manager,如没有,则会在Kubernetes Cluster中执行以下等效语句:
kubectl create clusterrolebinding tis-flink-manager --clusterrole=cluster-admin --serviceaccount=default:default
retryMax
类型: 整型数字
必须: 是
默认值: 20
说明:
The number of retries the client will attempt if a retryable operations fails.
retryDelay
类型: 时间跨度
必须: 是
默认值: 3
说明:
The time that the client waits between retries (See also
rest.retry.max-attempts).单位:
秒
metricReportInterval
类型: 时间跨度
必须: 是
默认值: 10
说明:
The reporter interval to use for the reporter named <name>. Only applicable to push-based reporters.
单位:
秒
🔐com.qlangtech.plugins.incr.flink.cluster.KubernetesApplicationClusterConfig
显示名: flink-kubernetes-application-cfg
全路径名: com.qlangtech.plugins.incr.flink.cluster.KubernetesApplicationClusterConfig
提供者: TIS
费用: 🔐
社区协作配置项说明:
配置编号
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 可将此配置作为'kubernetes-application'部署配置模版,作为配置标识后续可供其他kubernetes-application部署类型的Flink Job引用
k8sImage
- 类型: 单选
- 必须: 是
- 默认值: flink-cluster
- 说明: 选择一个与该执行器匹配的Docker Image实例
服务暴露
- 类型: 整型数字
- 必须: 是
- 默认值: 无
- 说明: Flink集群 启动之后将默认8081端口对外部暴露,可选择K8S相应暴露服务端口方式,如:NodePort,Ingress,LoadBalance
jmMemory
类型: 字节规格容量
必须: 是
默认值: 1600
说明:
Total Process Memory size for the JobManager. This includes all the memory that a JobManager JVM process consumes, consisting of Total Flink Memory, JVM Metaspace, and JVM Overhead. In containerized setups, this should be set to the container memory. See also 'jobmanager.memory.flink.size' for Total Flink Memory size configuration.
单位:
mb
tmMemory
类型: 字节规格容量
必须: 是
默认值: 1728
说明:
Total Process Memory size for the TaskExecutors. This includes all the memory that a TaskExecutor consumes, consisting of Total Flink Memory, JVM Metaspace, and JVM Overhead. On containerized setups, this should be set to the container memory. See also 'taskmanager.memory.flink.size' for total Flink memory size configuration.
单位:
mb
tmCPUCores
类型: 整型数字
必须: 否
默认值: 1000
说明:
CPU cores for the TaskExecutors. In case of Yarn setups, this value will be rounded to the closest positive integer. If not explicitly configured, legacy config options 'yarn.containers.vcores' and 'kubernetes.taskmanager.cpu' will be used for Yarn / Kubernetes setups, and 'taskmanager.numberOfTaskSlots' will be used for standalone setups (approximate number of slots).
*1000个单位代表一个1 CPU Core
taskSlot
类型: 整型数字
必须: 是
默认值: 1
说明:
The number of parallel operator or user function instances that a single TaskManager can run. If this value is larger than 1, a single TaskManager takes multiple instances of a function or operator. That way, the TaskManager can utilize multiple CPU cores, but at the same time, the available memory is divided between the different operator or function instances. This value is typically proportional to the number of physical CPU cores that the TaskManager's machine has (e.g., equal to the number of cores, or half the number of cores).
svcAccount
类型: 单行文本
必须: 是
默认值: default
说明:
Service account that is used by jobmanager and taskmanager within kubernetes cluster. Notice that this can be overwritten by config options 'kubernetes.jobmanager.service-account' and 'kubernetes.taskmanager.service-account' for jobmanager and taskmanager respectively.
授权
类型: 单选
必须: 是
默认值: true
说明:
保证Flink 在Kubernetes(Session / Application)模式下拥有执行所有操作都有相应的权限,如不拥有相应权限则会报以下错误:
io.fabric8.kubernetes.client.KubernetesClientException: pods is forbidden:
User "system:serviceaccount:default:default" cannot watch resource "pods" in API group "" in the namespace "default"如选择:是,执行过程会查看系统是否有 rolebing:tis-flink-manager,如没有,则会在Kubernetes Cluster中执行以下等效语句:
kubectl create clusterrolebinding tis-flink-manager --clusterrole=cluster-admin --serviceaccount=default:default
retryMax
类型: 整型数字
必须: 是
默认值: 20
说明:
The number of retries the client will attempt if a retryable operations fails.
retryDelay
类型: 时间跨度
必须: 是
默认值: 3
说明:
The time that the client waits between retries (See also
rest.retry.max-attempts).单位:
秒
metricReportInterval
类型: 时间跨度
必须: 是
默认值: 10
说明:
The reporter interval to use for the reporter named <name>. Only applicable to push-based reporters.
单位:
秒
com.qlangtech.tis.plugin.datax.powerjob.K8SDataXJobWorker
显示名: dataX-worker
全路径名: com.qlangtech.tis.plugin.datax.powerjob.K8SDataXJobWorker
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
k8sImage
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 选择一个与该执行器匹配的Docker Image实例
serverPortExport
- 类型: 整型数字
- 必须: 是
appName
- 类型: 单行文本
- 必须: 是
password
- 类型: 密码
- 必须: 是
omsProfile
- 类型: 单行文本
- 必须: 是
com.qlangtech.tis.plugin.paimon.datax.utils.PaimonConfig
com.qlangtech.tis.plugin.paimon.datax.utils.PaimonConfig
显示名: PaimonConfig
全路径名: com.qlangtech.tis.plugin.paimon.datax.utils.PaimonConfig
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.incr.TISRateLimiter
com.qlangtech.plugins.incr.flink.cdc.NoRateLimiter
显示名: off
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.cdc.PerSecondRateLimiter
显示名: on
全路径名: com.qlangtech.plugins.incr.flink.cdc.PerSecondRateLimiter
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ds.oracle.ConnEntity
com.qlangtech.tis.plugin.ds.oracle.impl.SIDConnEntity
显示名: SID
费用: 😄
社区版(免费)配置项说明:
SID
- 类型: 单行文本
- 必须: 是
- 默认值: xe
- 说明: 无
com.qlangtech.tis.plugin.ds.oracle.impl.ServiceNameConnEntity
显示名: ServiceName
全路径名: com.qlangtech.tis.plugin.ds.oracle.impl.ServiceNameConnEntity
费用: 😄
社区版(免费)配置项说明:
serviceName
类型: 单行文本
必须: 是
默认值: 无
说明:
从 Oracle 8i 开始,Oracle 已经引入了 Service Name 的概念以支持数据库的集群 (RAC) 部署,一个 Service Name 可作为一个数据库的逻辑概念,统一对该数据库不同的 SID 实例的连接。
以服务名方式连接方式 (即 port 和 dbname 中间使用 “ / ” 分隔开),即:
"jdbc:oracle:thin:@" + hostname + ":" + port + "/" + dbname
com.qlangtech.tis.plugin.paimon.catalog.CatalogCache
com.qlangtech.tis.plugin.paimon.catalog.cache.CatalogCacheOFF
显示名: off
全路径名: com.qlangtech.tis.plugin.paimon.catalog.cache.CatalogCacheOFF
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.catalog.cache.CatalogCacheON
显示名: on
全路径名: com.qlangtech.tis.plugin.paimon.catalog.cache.CatalogCacheON
费用: 😄
社区版(免费)配置项说明:
expiration-interval
类型: 时间跨度
必须: 是
默认值: 10
说明:
Controls the duration for which databases and tables in the catalog are cached.
partition.max-num
类型: 整型数字
必须: 是
默认值: 0
说明:
Controls the max number for which partitions in the catalog are cached.
manifest.small-file-memory
类型: 字节规格容量
必须: 是
默认值: 128
说明:
Controls the cache memory to cache small manifest files.
manifest.small-file-threshold
类型: 字节规格容量
必须: 是
默认值: 1
说明:
Controls the threshold of small manifest file.
manifest.max-memory
类型: 字节规格容量
必须: 否
默认值: 无
说明:
Controls the maximum memory to cache manifest content.
snapshot.max-num-per-table
类型: 整型数字
必须: 是
默认值: 20
说明:
Controls the max number for snapshots per table in the catalog are cached.
com.qlangtech.tis.plugin.incr.TISSinkFactory
com.qlangtech.plugins.incr.flink.chunjun.clickhouse.sink.ChunjunClickhouseSinkFactory
显示名: Chunjun-Sink-Clickhouse
全路径名: com.qlangtech.plugins.incr.flink.chunjun.clickhouse.sink.ChunjunClickhouseSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.plugins.incr.flink.chunjun.dameng.sink.ChunjunDamengSinkFactory
显示名: Chunjun-Sink-DaMeng
全路径名: com.qlangtech.plugins.incr.flink.chunjun.dameng.sink.ChunjunDamengSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.plugins.incr.flink.chunjun.doris.sink.ChunjunDorisSinkFactory
显示名: Chunjun-Sink-Doris
全路径名: com.qlangtech.plugins.incr.flink.chunjun.doris.sink.ChunjunDorisSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
connectTimeout
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.plugins.incr.flink.chunjun.doris.sink.ChunjunDorisCommon.dftConnectTimeout()
- 说明: 和服务端建立连接的超时时间,单位:ms
socketTimeout
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.plugins.incr.flink.chunjun.doris.sink.ChunjunDorisCommon.dftSocketTimeout()
- 说明: 从服务端读取数据的超时时间,单位:ms
retries
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.plugins.incr.flink.chunjun.doris.sink.ChunjunDorisCommon.dftRetries()
- 说明: 从服务端读取数据失败最大重试次数
com.qlangtech.tis.plugins.incr.flink.cdc.pipeline.kafka.sink.KafkaPipelineSinkFactory
显示名: FlinkCDC-Pipeline-Sink-Kafka
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.pipeline.kafka.sink.KafkaPipelineSinkFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
传输格式
- 类型: 单行文本
- 必须: 是
- 默认值: json
- 说明: 无
sink.delivery-guarantee
类型: 单选
必须: 是
默认值: at-least-once
说明:
Optional delivery guarantee when committing.
分区策略
类型: 单选
必须: 是
默认值: all-to-zero
说明:
Defines the strategy for sending record to kafka topic, available options are
all-to-zeroandhash-by-key, default option isall-to-zero.
schema.change.behavior
类型: 单选
必须: 是
默认值: IGNORE
说明:
Behavior for handling schema change events.
- IGNORE: Drop all schema change events.
- LENIENT: Apply schema changes to downstream tolerantly, and keeps executing if applying fails.
- TRY_EVOLVE: Apply schema changes to downstream, but keeps executing if applying fails.
- EVOLVE: Apply schema changes to downstream. This requires sink to support handling schema changes.
- EXCEPTION: Throw an exception to terminate the sync pipeline.
所在时区
类型: 单行文本
必须: 是
默认值: default
说明:
在 Flink CDC 同步任务中,
timeZone参数的作用是解决跨时区时间数据的一致性问题,核心要点如下:
com.qlangtech.tis.plugins.incr.flink.connector.kingbase.sink.KingBaseSinkFactory
显示名: Chunjun-Sink-KingBase
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.kingbase.sink.KingBaseSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.tis.plugins.incr.flink.connector.sink.MySQLSinkFactory
显示名: Chunjun-Sink-MySQL
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.sink.MySQLSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.tis.plugins.incr.flink.maria.sink.MariaDBSinkFactory
显示名: Chunjun-Sink-MariaDB
全路径名: com.qlangtech.tis.plugins.incr.flink.maria.sink.MariaDBSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.plugins.incr.flink.chunjun.oracle.sink.ChunjunOracleSinkFactory
显示名: Chunjun-Sink-Oracle
全路径名: com.qlangtech.plugins.incr.flink.chunjun.oracle.sink.ChunjunOracleSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.plugins.incr.flink.chunjun.postgresql.sink.ChunjunPostgreSQLSinkFactory
显示名: Chunjun-Sink-Postgres
全路径名: com.qlangtech.plugins.incr.flink.chunjun.postgresql.sink.ChunjunPostgreSQLSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.tis.plugins.incr.flink.connector.sink.SqlServerSinkFactory
显示名: Chunjun-Sink-SqlServer
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.sink.SqlServerSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.tis.plugins.incr.flink.chunjun.starrocks.sink.ChunjunStarRocksSinkFactory
显示名: Chunjun-Sink-StarRocks
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.starrocks.sink.ChunjunStarRocksSinkFactory
提供者: Chunjun
费用: 😄
社区版(免费)配置项说明:
semantic
类型: 单选
必须: 是
默认值: at-least-once
说明:
描述: sink 端是否支持二阶段提交
注意: 如果此参数为空,默认不开启二阶段提交,即 sink 端不支持 exactly_once 语义; 当前只支持 exactly-once 和 at-least-once
writeMode
类型: 单选
必须: 是
默认值: insert
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
脚本类型
类型: 单行文本
必须: 是
默认值: StreamAPI
说明:
TIS 为您自动生成 Flink Stream 脚本,现支持两种类型脚本:
SQL: 优点逻辑清晰,便于用户自行修改执行逻辑Stream API:优点基于系统更底层执行逻辑执行、轻量、高性能
batchSize
类型: 整型数字
必须: 是
默认值: 5000
说明:
描述:一次性批量提交的记录数大小,该值可以极大减少 ChunJun 与数据库的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成 ChunJun 运行进程 OOM 情况
flushIntervalMills
- 类型: 整型数字
- 必须: 是
- 默认值: 10000
- 说明: "the flush interval mills, over this time, asynchronous threads will flush data. The default value is 10s.
parallelism
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: sink 并行度
com.qlangtech.tis.plugins.incr.flink.pipeline.paimon.sink.PaimonPipelineSinkFactory
显示名: FlinkCDC-Pipeline-Sink-Paimon
全路径名: com.qlangtech.tis.plugins.incr.flink.pipeline.paimon.sink.PaimonPipelineSinkFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
schema.change.behavior
类型: 单选
必须: 是
默认值: IGNORE
说明:
Behavior for handling schema change events.
- IGNORE: Drop all schema change events.
- LENIENT: Apply schema changes to downstream tolerantly, and keeps executing if applying fails.
- TRY_EVOLVE: Apply schema changes to downstream, but keeps executing if applying fails.
- EVOLVE: Apply schema changes to downstream. This requires sink to support handling schema changes.
- EXCEPTION: Throw an exception to terminate the sync pipeline.
所在时区
类型: 单行文本
必须: 是
默认值: default
说明:
在 Flink CDC 同步任务中,
timeZone参数的作用是解决跨时区时间数据的一致性问题,核心要点如下:在 Flink CDC 同步任务中,
timeZone参数的作用是解决跨时区时间数据的一致性问题,核心要点如下:
com.qlangtech.tis.plugins.incr.flink.connector.elasticsearch7.ElasticSearchSinkFactory
显示名: Flink-ElasticSearch-Sink
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.elasticsearch7.ElasticSearchSinkFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
bulkFlushIntervalMs
类型: 整型数字
必须: 是
默认值: 10000
说明:
刷新的时间间隔(不论缓存操作的数量或大小如何),默认10秒自动提交一次
bulkFlushMaxActions
类型: 整型数字
必须: 否
默认值: 无
说明:
设置使 sink 在接收每个元素之后立即提交,否则这些元素将被缓存起来,官方文档: https://nightlies.apache.org/flink/flink-docs-master/zh/docs/connectors/datastream/elasticsearch/#%e9%85%8d%e7%bd%ae%e5%86%85%e9%83%a8%e6%89%b9%e9%87%8f%e5%a4%84%e7%90%86%e5%99%a8
bulkFlushMaxSizeMb
类型: 整型数字
必须: 否
默认值: 无
说明:
刷新前最大缓存的数据量(以兆字节为单位)
com.qlangtech.tis.plugin.ontology.chatbi.config.RetryConfig
com.qlangtech.tis.plugin.ontology.chatbi.config.RetryConfig
显示名: Retry Config
全路径名: com.qlangtech.tis.plugin.ontology.chatbi.config.RetryConfig
费用: 😄
社区版(免费)配置项说明:
重试次数
- 类型: 整型数字
- 必须: 是
- 默认值: 2
- 说明: LLM 生成失败时的最大重试次数。推荐范围:1-3,过高会增加延迟
超时
- 类型: 时间跨度
- 必须: 是
- 默认值: 5
- 说明: EXPLAIN 查询的超时时间(秒)。推荐范围:3-10,视数据库性能调整
com.qlangtech.tis.plugin.incr.IncrStreamFactory
com.qlangtech.plugins.incr.flink.launch.TISFlinkCDCStreamFactory
显示名: Flink
全路径名: com.qlangtech.plugins.incr.flink.launch.TISFlinkCDCStreamFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
cluster
类型: 单行文本
必须: 是
默认值: Standalone
说明:
对应Flink的执行任务集群,TIS组装好Flink Job之后,提交任务时会向 Flink Cluster中提交任务。
TIS平台中,提交任务前,请先创建Flink Cluster,其支持三种部署模式:
Kubernetes Session: 详细请查看
特点是多个Flink Job任务会由同一个Job Manager分配资源调度
Kubernetes Application: 详细请查看 Application Mode Detail
每个Flink Job任务独占一个JobManager ,对于运行在集群中的Job不会有资源抢占问题,
因此对于比较重要且优先级的任务,建议采用这种部署方式
流控
类型: 单行文本
必须: 是
默认值: on
说明:
用于运行期 限流读取数据 的控制实现,其主要目的是控制数据源的读取速率 ,防止反压(Backpressure),避免下游系统过载或资源耗尽,可避免因数据消费过快导致内存溢出(OOM)或 CPU/网络带宽被占满。
打开流控开关,选择
on就可在任务运行期,对流选择以下三种控制类型:- 任务
暂停/恢复功能 - 设置每秒消息限流数目
- 取消每秒消息限流阀
- 任务
并行度
类型: 整型数字
必须: 是
默认值: 1
说明:
任务执行并行度
在 Flink 里面代表每个任务的并行度,适当的提高并行度可以大大提高 job 的执行效率,比如你的 job 消费 kafka 数据过慢,适当调大可能就消费正常了。
重启策略
类型: 单行文本
必须: 是
默认值: off
说明:
The cluster can be started with a default restart strategy which is always used when no job specific restart strategy has been defined. In case that the job is submitted with a restart strategy, this strategy overrides the cluster’s default setting.
Detailed description:restart-strategies
There are 4 types of restart-strategy:
支持意外恢复
类型: 单选
必须: 是
默认值: false
说明:
支持任务恢复,当Flink节点因为服务器意外宕机导致当前运行的flink job意外终止,需要支持Flink Job恢复执行,
需要Flink配置支持:
- 持久化stateBackend
- 开启checkpoint
checkpoint
类型: 单行文本
必须: 是
默认值: off
说明:
Checkpoints make state in Flink fault tolerant by allowing state and the corresponding stream positions to be recovered, thereby giving the application the same semantics as a failure-free execution.
Detailed description:
stateBackend
类型: 单行文本
必须: 是
默认值: FSState
说明:
Flink provides different state backends that specify how and where state is stored.
State can be located on Java’s heap or off-heap. Depending on your state backend, Flink can also manage the state for the application, meaning Flink deals with the memory management (possibly spilling to disk if necessary) to allow applications to hold very large state. By default, the configuration file flink-conf.yaml determines the state backend for all Flink jobs.
However, the default state backend can be overridden on a per-job basis, as shown below.
For more information about the available state backends, their advantages, limitations, and configuration parameters see the corresponding section in Deployment & Operations.
com.qlangtech.tis.plugin.MemorySpecification
🔐com.qlangtech.tis.plugin.memory.CustomizeMemorySpecification
显示名: customize
全路径名: com.qlangtech.tis.plugin.memory.CustomizeMemorySpecification
费用: 🔐
社区协作配置项说明:
request
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.memory.CustomizeMemorySpecification.dftMemory()
- 说明: 单个任务内存初始申请,单位:兆。当任务并发数目设置为:n,内存总体初始开销为'n*memoryRequest',注意防止执行节点OOM
limit
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.memory.CustomizeMemorySpecification.dftMemory()
- 说明: 单个任务内存最大极限申请,单位:兆。当任务并发数目设置为:n,内存总体最大极限开销为'n*memoryLimit',注意防止执行节点OOM
com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.FormatFactory
com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.canaljson.TISCanalJsonFormatFactory
显示名: canal-json
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.canaljson.TISCanalJsonFormatFactory
费用: 😄
社区版(免费)配置项说明:
ignoreParseErrors
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to skip fields and rows with parse errors instead of failing; fields are set to null in case of errors, false by default.
timestampFormat
类型: 单选
必须: 是
默认值: SQL
说明:
Optional flag to specify timestamp format, SQL by default. Option ISO-8601 will parse input timestamp in "yyyy-MM-ddTHH:mm:ss.s{precision}" format and output timestamp in the same format. Option SQL will parse input timestamp in "yyyy-MM-dd HH:mm:ss.s{precision}" format and output timestamp in the same format.
dbInclude
类型: 单行文本
必须: 否
默认值: 无
说明:
An optional regular expression to only read the specific databases changelog rows by regular matching the "database" meta field in the Canal record.The pattern string is compatible with Java's Pattern.
tableInclude
类型: 单行文本
必须: 否
默认值: 无
说明:
An optional regular expression to only read the specific tables changelog rows by regular matching the "table" meta field in the Canal record.The pattern string is compatible with Java's Pattern.
nullKeyMode
类型: 单选
必须: 否
默认值: FAIL
说明:
Optional flag to control the handling mode when serializing null key for map data, FAIL by default. Option DROP will drop null key entries for map data. Option LITERAL will use 'map-null-key.literal' as key literal.
nullKeyLiteral
类型: 单行文本
必须: 否
默认值: null
说明:
Optional flag to specify string literal for null keys when 'map-null-key.mode' is LITERAL, "null" by default.
encodeDecimal
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to specify whether to encode all decimals as plain numbers instead of possible scientific notations, false by default.
com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.canaljson.TISSourceCanalJsonFormatFactory
显示名: canal-json
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.canaljson.TISSourceCanalJsonFormatFactory
费用: 😄
社区版(免费)配置项说明:
Table Name(s)
类型: 单行文本
必须: 否
默认值: 无
说明:
导入流实体名称,目标端以此作为表名,多个表以逗号分隔。支持wildcard样式 ,当消息体中表名为
order_detail_001,order_detail_002,order_detail_003则可以用 wildcard表达式order_detail*匹配,最终将多个匹配的物理表名归并成order_detail逻辑表名
ignoreParseErrors
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to skip fields and rows with parse errors instead of failing; fields are set to null in case of errors, false by default.
timestampFormat
类型: 单选
必须: 是
默认值: SQL
说明:
Optional flag to specify timestamp format, SQL by default. Option ISO-8601 will parse input timestamp in "yyyy-MM-ddTHH:mm:ss.s{precision}" format and output timestamp in the same format. Option SQL will parse input timestamp in "yyyy-MM-dd HH:mm:ss.s{precision}" format and output timestamp in the same format.
dbInclude
类型: 单行文本
必须: 否
默认值: 无
说明:
An optional regular expression to only read the specific databases changelog rows by regular matching the "database" meta field in the Canal record.The pattern string is compatible with Java's Pattern.
tableInclude
类型: 单行文本
必须: 否
默认值: 无
说明:
An optional regular expression to only read the specific tables changelog rows by regular matching the "table" meta field in the Canal record.The pattern string is compatible with Java's Pattern.
nullKeyMode
类型: 单选
必须: 否
默认值: FAIL
说明:
Optional flag to control the handling mode when serializing null key for map data, FAIL by default. Option DROP will drop null key entries for map data. Option LITERAL will use 'map-null-key.literal' as key literal.
nullKeyLiteral
类型: 单行文本
必须: 否
默认值: null
说明:
Optional flag to specify string literal for null keys when 'map-null-key.mode' is LITERAL, "null" by default.
encodeDecimal
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to specify whether to encode all decimals as plain numbers instead of possible scientific notations, false by default.
com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.debeziumjson.TISSinkDebeziumJsonFormatFactory
显示名: debezium-json
费用: 😄
社区版(免费)配置项说明:
ignoreParseErrors
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to skip fields and rows with parse errors instead of failing; fields are set to null in case of errors, false by default.
timestampFormat
类型: 单选
必须: 是
默认值: SQL
说明:
Optional flag to specify timestamp format, SQL by default. Option ISO-8601 will parse input timestamp in "yyyy-MM-ddTHH:mm:ss.s{precision}" format and output timestamp in the same format. Option SQL will parse input timestamp in "yyyy-MM-dd HH:mm:ss.s{precision}" format and output timestamp in the same format.
nullKeyMode
类型: 单选
必须: 否
默认值: FAIL
说明:
Optional flag to control the handling mode when serializing null key for map data, FAIL by default. Option DROP will drop null key entries for map data. Option LITERAL will use 'map-null-key.literal' as key literal.
nullKeyLiteral
类型: 单行文本
必须: 否
默认值: null
说明:
Optional flag to specify string literal for null keys when 'map-null-key.mode' is LITERAL, "null" by default.
encodeDecimal
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to specify whether to encode all decimals as plain numbers instead of possible scientific notations, false by default.
com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.debeziumjson.TISSourceDebeziumJsonFormatFactory
显示名: debezium-json
费用: 😄
社区版(免费)配置项说明:
Table Name(s)
类型: 单行文本
必须: 否
默认值: 无
说明:
导入流实体名称,目标端以此作为表名,多个表以逗号分隔。支持wildcard样式 ,当消息体中表名为
order_detail_001,order_detail_002,order_detail_003则可以用 wildcard表达式order_detail*匹配,最终将多个匹配的物理表名归并成order_detail逻辑表名
ignoreParseErrors
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to skip fields and rows with parse errors instead of failing; fields are set to null in case of errors, false by default.
timestampFormat
类型: 单选
必须: 是
默认值: SQL
说明:
Optional flag to specify timestamp format, SQL by default. Option ISO-8601 will parse input timestamp in "yyyy-MM-ddTHH:mm:ss.s{precision}" format and output timestamp in the same format. Option SQL will parse input timestamp in "yyyy-MM-dd HH:mm:ss.s{precision}" format and output timestamp in the same format.
nullKeyMode
类型: 单选
必须: 否
默认值: FAIL
说明:
Optional flag to control the handling mode when serializing null key for map data, FAIL by default. Option DROP will drop null key entries for map data. Option LITERAL will use 'map-null-key.literal' as key literal.
nullKeyLiteral
类型: 单行文本
必须: 否
默认值: null
说明:
Optional flag to specify string literal for null keys when 'map-null-key.mode' is LITERAL, "null" by default.
encodeDecimal
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to specify whether to encode all decimals as plain numbers instead of possible scientific notations, false by default.
com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.json.SourceJsonFormatFactory
显示名: json
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.kafka.format.json.SourceJsonFormatFactory
费用: 😄
社区版(免费)配置项说明:
Table Name
类型: 单行文本
必须: 否
默认值: 无
说明:
导入流实体名称,目标端以此作为表名,多个表以逗号分隔。支持wildcard样式 ,当消息体中表名为
order_detail_001,order_detail_002,order_detail_003则可以用 wildcard表达式order_detail*匹配,最终将多个匹配的物理表名归并成order_detail逻辑表名
ignoreParseErrors
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to skip fields and rows with parse errors instead of failing; fields are set to null in case of errors, false by default.
failOnMissingField
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to specify whether to fail if a field is missing or not, false by default.
timestampFormat
类型: 单选
必须: 是
默认值: SQL
说明:
Optional flag to specify timestamp format, SQL by default. Option ISO-8601 will parse input timestamp in "yyyy-MM-ddTHH:mm:ss.s{precision}" format and output timestamp in the same format. Option SQL will parse input timestamp in "yyyy-MM-dd HH:mm:ss.s{precision}" format and output timestamp in the same format.
nullKeyMode
类型: 单选
必须: 否
默认值: FAIL
说明:
Optional flag to control the handling mode when serializing null key for map data, FAIL by default. Option DROP will drop null key entries for map data. Option LITERAL will use 'map-null-key.literal' as key literal.
nullKeyLiteral
类型: 单行文本
必须: 否
默认值: null
说明:
Optional flag to specify string literal for null keys when 'map-null-key.mode' is LITERAL, "null" by default.
encodeJsonParserEnabled
类型: 单选
必须: 否
默认值: true
说明:
Optional flag to specify whether to use the Jackson JsonParser to decode json with better performance, true by default.
encodeDecimal
类型: 单选
必须: 否
默认值: false
说明:
Optional flag to specify whether to encode all decimals as plain numbers instead of possible scientific notations, false by default.
com.qlangtech.tis.offline.FileSystemFactory
com.qlangtech.tis.hdfs.impl.AliayunJindoFSFactory
显示名: Aliyun-Jindo-HDFS
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-datax-hdfs-aliyun-emr-plugin/tis-datax-hdfs-aliyun-emr-plugin_hadoop_3.0.0-cdh6.3.2.tpi
配置项说明:
name
- 类型: 单行文本
- 必须: 是
使用域名
类型: 单选
必须: 是
默认值: false
说明:
当客户端导入数据到HDFS过程中,客户端会使用hostname(域名)而不是ip地址的方式去连接HDFS DataNode地址。当用户利用Docker Compose的方式启动hadoop环境(例如:Hudi测试环境) ,客户端取得的DataNode地址一般会是Docker容器的内部Ip地址,从容器外部是访问不到的,此时将该选项设置为
是,可以解决数据无法导入到HDFS的问题。详细请查看https://segmentfault.com/q/1010000008473574
当选择
是,在创HDFS FileSystem实例时加上如下参数:conf.set("dfs.client.use.datanode.hostname", "true");
endpoint
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:OSS Server的EndPoint信息
bucket
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 描述:OSS的bucket
rootDir
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 系统会将源数据导入到该子目录下,用户需要保证该子目录有读/写权限
userToken
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 当选择为'on', 开启kerberos客户端认证
hdfs-site.xml
类型: 富文本
必须: 是
默认值: com.qlangtech.tis.hdfs.impl.AliayunJindoFSFactory.nullHdfsSiteContent()
说明:
配置实例,实现了HDFS HA高可用方案:
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.28.200</value>
</property>
</configuration>
com.qlangtech.tis.hdfs.impl.HdfsFileSystemFactory
显示名: HDFS
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-datax-hdfs-plugin/tis-datax-hdfs-plugin_hadoop_3.0.0-cdh6.3.2.tpi
配置项说明:
name
- 类型: 单行文本
- 必须: 是
使用域名
类型: 单选
必须: 是
默认值: false
说明:
当客户端导入数据到HDFS过程中,客户端会使用hostname(域名)而不是ip地址的方式去连接HDFS DataNode地址。当用户利用Docker Compose的方式启动hadoop环境(例如:Hudi测试环境) ,客户端取得的DataNode地址一般会是Docker容器的内部Ip地址,从容器外部是访问不到的,此时将该选项设置为
是,可以解决数据无法导入到HDFS的问题。详细请查看https://segmentfault.com/q/1010000008473574
当选择
是,在创HDFS FileSystem实例时加上如下参数:conf.set("dfs.client.use.datanode.hostname", "true");
rootDir
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 系统会将源数据导入到该子目录下,用户需要保证该子目录有读/写权限
userToken
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 当选择为'on', 开启kerberos客户端认证
hdfs-site.xml
类型: 富文本
必须: 是
默认值: com.qlangtech.tis.hdfs.impl.HdfsFileSystemFactory.dftHdfsSiteContent()
说明:
配置实例,实现了HDFS HA高可用方案:
<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.28.200</value>
</property>
</configuration>
com.qlangtech.tis.plugin.amazon.s3.AmazonS3FileSystemFactory
显示名: AmazonS3
全路径名: com.qlangtech.tis.plugin.amazon.s3.AmazonS3FileSystemFactory
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-datax-hdfs-plugin/tis-datax-hdfs-plugin_hadoop_3.0.0-cdh6.3.2.tpi
配置项说明:
name
- 类型: 单行文本
- 必须: 是
服务端点
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: S3/MinIO服务端点(API地址),例如:http://localhost:9000
存储桶
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 存储桶名称,相当于一个顶级存储容器
根目录
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 系统会将数据存储到该子目录下,用户需要保证该路径有读/写权限
区域
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 可选项,如果遇到Region相关报错可以设置一个默认Region
认证方式
- 类型: 单行文本
- 必须: 是
- 默认值: userPass
- 说明: S3/MinIO认证信息,用户名填写AccessKey,密码填写SecretKey
路径访问模式
类型: 单选
必须: 是
默认值: false
说明:
控制 S3 API 的 URL 寻址方式。
- 是(Path-Style):URL 格式为 http://endpoint/bucket/key,MinIO、Ceph 等自建 S3 兼容存储必须开启此选项。
- 否(Virtual-Hosted-Style):URL 格式为 http://bucket.endpoint/key,Amazon S3 推荐使用此模式(AWS 自 2020 年 9 月起对新建 Bucket 已弃用 Path-Style)。 如不确定,自建存储选 true,AWS S3 选 false。
连接超时
- 类型: 时间跨度
- 必须: 是
- 默认值: 15
- 说明: 连接S3/MinIO服务的超时时间(秒),默认15秒。超时后会抛出连接失败异常
com.qlangtech.tis.plugin.ds.SplitTableStrategy
🔐com.qlangtech.tis.plugin.ds.split.DefaultSplitTableStrategy
显示名: on
全路径名: com.qlangtech.tis.plugin.ds.split.DefaultSplitTableStrategy
费用: 🔐
社区协作配置项说明:
分库节点
类型: 富文本
必须: 是
默认值: 无
说明:
将分布在多个数据库冗余节点中的物理表视作一个逻辑表,在数据同步管道中进行配置,输入框中可输入以下内容:
192.168.28.200[00-07]: 单节点多库,导入 192.168.28.200:3306 节点的 order00,order01,order02,order03,order04,order05,order06,order078个库。也可以将节点描述写成:192.168.28.200[0-7],则会导入 192.168.28.200:3306 节点的 order0,order1,order2,order3,order4,order5,order6,order78个库192.168.28.200[00-07],192.168.28.201[08-15]:会导入 192.168.28.200:3306 节点的 order00,order01,order02,order03,order04,order05,order06,order078个库 和 192.168.28.201:3306 节点的 order08,order09,order10,order11,order12,order13,order14,order158个库,共计16个库
分表识别
类型: 单行文本
必须: 否
默认值: 无
说明:
识别分表的正则式,默认识别分表策略为
(tabname)_\d+, 如需使用其他分表策略,如带字母[a-z]的后缀则需要用户自定义注意:如输入自定义正则式,表达式中逻辑表名部分,必须要用括号括起来,不然无法从物理表名中抽取出逻辑表名。
测试表
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 提交表单用户测试,所填正则式是否能正确识别物理分表。输入需要识别的逻辑表名,点击‘校验’按钮会进行自动识别。
增量前缀匹配
类型: 单选
必须: 是
默认值: false
说明:
使用前缀匹配的样式,在flink-cdc表前缀通配匹配的场景中使用
- 选择
是:在增量监听流程中使用逻辑表+*的方式对目标表监听,例如,逻辑表名为base,启动时使用base*对数据库中base01,base02启用增量监听,在运行期用户又增加了base03表则执行逻辑会自动对base03表开启监听 - 选择
否:在增量监听流程中使用物理表全匹配的方式进行匹配。在运行期用户增加的新的分表忽略,如需对新加的分表增量监听生效,需要重启增量执行管道。
- 选择
com.qlangtech.tis.datax.impl.DataxReader
com.qlangtech.tis.plugin.datax.dameng.reader.DataXDaMengReader
显示名: DaMeng
全路径名: com.qlangtech.tis.plugin.datax.dameng.reader.DataXDaMengReader
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 执行数据批量导出时单次从数据库中提取记录条数,可以有效减少网络IO次数,提升导出效率。切忌不能设置太大以免OOM发生
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.dameng.reader.DataXDaMengReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXDFSReader
显示名: TDFS
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
资源
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: DFS服务端连接配置
目标文件匹配
类型: 单行文本
必须: 是
默认值: Wildcard
说明:
到指定目录中获取目标资源文件,TIS已经为您准备了两种类型的匹配器:
Wildcard:
通过
wildcard表达式(如:user*.json,"a/b/*"),到指定目录扫描所有资源文件,如果与wildcard匹配,则作为TDFS Reader的目标资源文件,在后续全量导入流程中读取ByMeta:
Writer TDFS作为目标Writer,流程中开启了添加元数据选项,将源数据的Schema写入到目标文件系统中,后续,以该TDFS作为源数据类型则可以依赖该预写入的Schema文件作为数据源的Schema信息,可大大简化流程
文件格式
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 可以根据目标文件不同的格式,对文件进行解析
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXDFSReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.kingbase.DataXKingBaseReader
显示名: KingBase
全路径名: com.qlangtech.tis.plugin.datax.kingbase.DataXKingBaseReader
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
splitPk
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 描述:数据抽取时,如果指定splitPk,表示用户希望使用splitPk代表的字段进行数据分片,DataX因此会启动并发任务进行数据同步,这样可以大大提供数据同步的效能。推荐splitPk用户使用表主键,因为表主键通常情况下比较均匀,因此切分出来的分片也不容易出现数据热点。 目前splitPk仅支持整形数据切分,不支持浮点、字符串型、日期等其他类型。如果用户指定其他非支持类型,将报错! splitPk设置为空,底层将视作用户不允许对单表进行切分,因此使用单通道进行抽取。
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 描述:该配置项定义了插件和数据库服务器端每次批量数据获取条数,该值决定了DataX和服务器端的网络交互次数,能够较大的提升数据抽取性能。注意,该值过大(>2048)可能造成DataX进程OOM
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXPostgresqlReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXMariaReader
显示名: MariaDB
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
splitPk
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 进行数据抽取时,如果指定splitPk,表示用户希望使用splitPk代表的字段进行数据分片,DataX因此会启动并发任务进行数据同步,这样可以大大提供数据同步的效能。 推荐splitPk用户使用表主键,因为表主键通常情况下比较均匀,因此切分出来的分片也不容易出现数据热点。 目前splitPk仅支持整形数据切分,不支持浮点、字符串、日期等其他类型。如果用户指定其他非支持类型,MysqlReader将报错! 如果splitPk不填写,包括不提供splitPk或者splitPk值为空,DataX视作使用单通道同步该表数据。
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 执行数据批量导出时单次从数据库中提取记录条数,可以有效减少网络IO次数,提升导出效率。切忌不能设置太大以免OOM发生
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataxMySQLReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXMongodbReader
显示名: MongoDB
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXMongodbReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXOracleReader
显示名: Oracle
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
splitPk
- 类型: 单选
- 必须: 否
- 默认值: false
- 说明: 描述:OracleReader进行数据抽取时,如果指定splitPk,表示用户希望使用splitPk代表的字段进行数据分片,DataX因此会启动并发任务进行数据同步,这样可以大大提供数据同步的效能。
session
- 类型: 富文本
- 必须: 否
- 默认值: 无
- 说明: 描述:控制写入数据的时间格式,时区等的配置,如果表中有时间字段,配置该值以明确告知写入 oracle 的时间格式。通常配置的参数为:NLS_DATE_FORMAT,NLS_TIME_FORMAT。其配置的值为 json 格式,例如:[ "alter session set NLS_DATE_FORMAT='yyyy-mm-dd hh24:mi:ss'", "alter session set NLS_TIMESTAMP_FORMAT='yyyy-mm-dd hh24:mi:ss'", "alter session set NLS_TIMESTAMP_TZ_FORMAT='yyyy-mm-dd hh24:mi:ss'", "alter session set TIME_ZONE='US/Pacific'" ]
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 描述:该配置项定义了插件和数据库服务器端每次批量数据获取条数,该值决定了DataX和服务器端的网络交互次数,能够较大的提升数据抽取性能。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXOracleReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXPostgresqlReader
显示名: PostgreSQL
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
splitPk
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 描述:数据抽取时,如果指定splitPk,表示用户希望使用splitPk代表的字段进行数据分片,DataX因此会启动并发任务进行数据同步,这样可以大大提供数据同步的效能。推荐splitPk用户使用表主键,因为表主键通常情况下比较均匀,因此切分出来的分片也不容易出现数据热点。 目前splitPk仅支持整形数据切分,不支持浮点、字符串型、日期等其他类型。如果用户指定其他非支持类型,将报错! splitPk设置为空,底层将视作用户不允许对单表进行切分,因此使用单通道进行抽取。
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 描述:该配置项定义了插件和数据库服务器端每次批量数据获取条数,该值决定了DataX和服务器端的网络交互次数,能够较大的提升数据抽取性能。注意,该值过大(>2048)可能造成DataX进程OOM
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXPostgresqlReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXSqlserverReader
显示名: SqlServer
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
splitPk
- 类型: 单行文本
- 必须: 否
- 默认值: false
- 说明: SqlServerReader进行数据抽取时,如果指定splitPk,表示用户希望使用splitPk代表的字段进行数据分片,DataX因此会启动并发任务进行数据同步,这样可以大大提供数据同步的效能。 推荐splitPk用户使用表主键,因为表主键通常情况下比较均匀,因此切分出来的分片也不容易出现数据热点。 目前splitPk仅支持整形型数据切分,不支持浮点、字符串、日期等其他类型。如果用户指定其他非支持类型,SqlServerReader将报错! splitPk设置为空,底层将视作用户不允许对单表进行切分,因此使用单通道进行抽取。
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 该配置项定义了插件和数据库服务器端每次批量数据获取条数,该值决定了DataX和服务器端的网络交互次数,能够较大的提升数据抽取性能。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXSqlserverReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataxMySQLReader
显示名: MySQL
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
splitPk
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 进行数据抽取时,如果指定splitPk,表示用户希望使用splitPk代表的字段进行数据分片,DataX因此会启动并发任务进行数据同步,这样可以大大提供数据同步的效能。 推荐splitPk用户使用表主键,因为表主键通常情况下比较均匀,因此切分出来的分片也不容易出现数据热点。 目前splitPk仅支持整形数据切分,不支持浮点、字符串、日期等其他类型。如果用户指定其他非支持类型,MysqlReader将报错! 如果splitPk不填写,包括不提供splitPk或者splitPk值为空,DataX视作使用单通道同步该表数据。
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 执行数据批量导出时单次从数据库中提取记录条数,可以有效减少网络IO次数,提升导出效率。切忌不能设置太大以免OOM发生
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataxMySQLReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.doris.DataXDorisReader
显示名: Doris
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
splitPk
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 进行数据抽取时,如果指定splitPk,表示用户希望使用splitPk代表的字段进行数据分片,DataX因此会启动并发任务进行数据同步,这样可以大大提供数据同步的效能。 推荐splitPk用户使用表主键,因为表主键通常情况下比较均匀,因此切分出来的分片也不容易出现数据热点。 目前splitPk仅支持整形数据切分,不支持浮点、字符串、日期等其他类型。如果用户指定其他非支持类型,MysqlReader将报错! 如果splitPk不填写,包括不提供splitPk或者splitPk值为空,DataX视作使用单通道同步该表数据。
fetchSize
- 类型: 整型数字
- 必须: 是
- 默认值: 2000
- 说明: 执行数据批量导出时单次从数据库中提取记录条数,可以有效减少网络IO次数,提升导出效率。切忌不能设置太大以免OOM发生
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataxMySQLReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.kafka.reader.DataXKafkaReader
显示名: Kafka
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.DataXKafkaReader
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
Bootstrap Servers
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: A list of host/port pairs to use for establishing the initial connection to the Kafka cluster. The client will make use of all servers irrespective of which servers are specified here for bootstrapping—this list only impacts the initial hosts used to discover the full set of servers. This list should be in the form
host1:port1,host2:port2,.... Since these servers are just used for the initial connection to discover the full cluster membership (which may change dynamically), this list need not contain the full set of servers (you may want more than one, though, in case a server is down).
Subscription Method
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: You can choose to manually assign a list of partitions, or subscribe to all topics matching specified pattern to get dynamically assigned partitions.
Test Topic
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: The Topic to test in case the can consume messages.
MessageFormat
- 类型: 单行文本
- 必须: 是
- 默认值: json
- 说明: The serialization used based on this.
Request Timeout, ms
- 类型: 整型数字
- 必须: 否
- 默认值: 30000
- 说明: The configuration controls the maximum amount of time the client will wait for the response of a request. If the response is not received before the timeout elapses the client will resend the request if necessary or fail the request if retries are exhausted.
猜测字段类型
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 通过TIS提供的的内部算法,预先读取Kafka事件流中一定数量的记录,猜测对应列的类型,以帮助最大化提高录入表单效率。最后通过分析得到的类型不够准确,需要用户手动微调。
Group ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: The Group ID is how you distinguish different consumer groups.
Client DNS Lookup
- 类型: 单选
- 必须: 否
- 默认值: use_all_dns_ips
- 说明: Controls how the client uses DNS lookups. If set to use_all_dns_ips, connect to each returned IP address in sequence until a successful connection is established. After a disconnection, the next IP is used. Once all IPs have been used once, the client resolves the IP(s) from the hostname again. If set to resolve_canonical_bootstrap_servers_only, resolve each bootstrap address into a list of canonical names. After the bootstrap phase, this behaves the same as use_all_dns_ips. If set to default (deprecated), attempt to connect to the first IP address returned by the lookup, even if the lookup returns multiple IP addresses.
Protocol
- 类型: 单行文本
- 必须: 是
- 默认值: PLAINTEXT
- 说明: The Protocol used to communicate with brokers.
Enable Auto Commit
- 类型: 单选
- 必须: 否
- 默认值: true
- 说明: If true, the consumer's offset will be periodically committed in the background.
Client ID
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: An ID string to pass to the server when making requests. The purpose of this is to be able to track the source of requests beyond just ip/port by allowing a logical application name to be included in server-side request logging.
Retry Backoff, ms
- 类型: 整型数字
- 必须: 否
- 默认值: 100
- 说明: The amount of time to wait before attempting to retry a failed request to a given topic partition. This avoids repeatedly sending requests in a tight loop under some failure scenarios.
Auto Commit Interval, ms
- 类型: 整型数字
- 必须: 否
- 默认值: 5000
- 说明: The frequency in milliseconds that the consumer offsets are auto-committed to Kafka if enable.auto.commit is set to true.
Max Poll Records
- 类型: 整型数字
- 必须: 否
- 默认值: 500
- 说明: The maximum number of records returned in a single call to poll(). Note, that max_poll_records does not impact the underlying fetching behavior. The consumer will cache the records from each fetch request and returns them incrementally from each poll.
Receive Buffer, bytes
- 类型: 整型数字
- 必须: 否
- 默认值: 32768
- 说明: The size of the TCP receive buffer (SO_RCVBUF) to use when reading data. If the value is -1, the OS default will be used.
Socket Setup TimeoutMs
- 类型: 整型数字
- 必须: 否
- 默认值: 10000
- 说明: The amount of time the client will wait for the socket connection to be established. If the connection is not built before the timeout elapses, clients will close the socket channel.
Socket Setup Timeout MaxMs
- 类型: 整型数字
- 必须: 否
- 默认值: 30000
- 说明: The maximum amount of time the client will wait for the socket connection to be established. The connection setup timeout will increase exponentially for each consecutive connection failure up to this maximum. To avoid connection storms, a randomization factor of 0.2 will be applied to the timeout resulting in a random range between 20% below and 20% above the computed value.
Maximum Records
- 类型: 整型数字
- 必须: 否
- 默认值: 100000
- 说明: The Maximum to be processed per execution
Repeated Calls
- 类型: 整型数字
- 必须: 否
- 默认值: 3
- 说明: The number of repeated calls to poll() if no messages were received.
Polling Time
- 类型: 整型数字
- 必须: 否
- 默认值: 1000
- 说明: Amount of time Kafka connector should try to poll for messages.
com.qlangtech.tis.hive.reader.DataXHiveReader
显示名: HiveMetaStore
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
资源
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: DFS服务端连接配置
目标分区
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 如果目标表设置了分区键,请设置该选项
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.hive.reader.DataXHiveReader.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTarget
com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTargetMetricExpr
显示名: Metric Expression
全路径名: com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTargetMetricExpr
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
SQL表达式
- 类型: 富文本
- 必须: 是
- 默认值: 无
- 说明: 自定义指标SQL表达式
com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTargetOT
显示名: OT Reference
全路径名: com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTargetOT
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
对象类型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 术语指向的本体对象类型
com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTargetProperty
显示名: Property Reference
全路径名: com.qlangtech.tis.plugin.ontology.impl.glossary.GlossaryTargetProperty
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
Object Type
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 目标本体对象名称
Target Field
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 目标本体对象字段名称
com.qlangtech.tis.plugin.datax.powerjob.ServerPortExport
com.qlangtech.tis.plugin.datax.powerjob.impl.serverport.Ingress
显示名: Ingress
全路径名: com.qlangtech.tis.plugin.datax.powerjob.impl.serverport.Ingress
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
serverPort
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@7b8d6c66
- 说明: SpringBoot配置,HTTP端口号,默认7700,不建议更改
host
- 类型: 单行文本
- 必须: 是
path
- 类型: 单行文本
- 必须: 是
com.qlangtech.tis.plugin.datax.powerjob.impl.serverport.LoadBalance
显示名: LoadBalance
全路径名: com.qlangtech.tis.plugin.datax.powerjob.impl.serverport.LoadBalance
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
serverPort
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@1700d089
- 说明: SpringBoot配置,HTTP端口号,默认7700,不建议更改
com.qlangtech.tis.plugin.datax.powerjob.impl.serverport.NodePort
显示名: NodePort
全路径名: com.qlangtech.tis.plugin.datax.powerjob.impl.serverport.NodePort
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
serverPort
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@25765a49
- 说明: SpringBoot配置,HTTP端口号,默认7700,不建议更改
INTERNAL-IP
类型: 单行文本
必须: 是
默认值: 无
说明:
通过执行如下命令:
kubectl get nodes -o wide得到如下输出结果:
NAME STATUS ROLES AGE VERSION INTERNAL-IP EXTERNAL-IP OS-IMAGE KERNEL-VERSION CONTAINER-RUNTIME
baisui-test-2 Ready control-plane 242d v1.28.3 192.168.28.201 <none> CentOS Linux 7 (Core) 3.10.0-1127.el7.x86_64 docker://24.0.5可
任选一条记录的INTERNAL-IP填入输入框中
nodePort
类型: 整型数字
必须: 是
默认值: 31000
说明:
NodePort服务是让外部请求直接访问服务的最原始方式,NodePort是在所有的节点上开放指定的端口,所有发送到这个端口的请求都会直接转发到服务中的pod里;
这种方式不足:
- 一个端口只提供一个服务使用
- 只能使用30000-32767之间的端口
- 如果节点/虚拟机的IP地址发送变化,需要人工处理;
所以在生产环境,不推荐这种方式发布服务
com.qlangtech.tis.plugin.datax.format.FileFormat
com.qlangtech.tis.plugin.datax.format.CSVReaderFormat
显示名: CSV
费用: 😄
社区版(免费)配置项说明:
字段分隔符
- 类型: 单选
- 必须: 是
- 默认值: comma
- 说明: 描述:读取的字段分隔符,可以用'\t','\001'等字符
压缩格式
- 类型: 单选
- 必须: 是
- 默认值: none
- 说明: 描述:文本压缩类型,默认不填写意味着没有压缩。支持压缩类型为zip、gzip、bzip2。
encoding
- 类型: 单选
- 必须: 是
- 默认值: utf-8
- 说明: 描述:读取文件的编码配置。
空值替代符
- 类型: 单行文本
- 必须: 是
- 默认值: null
- 说明: 描述:文本文件中无法使用标准字符串定义null(空指针),DataX提供nullFormat定义哪些字符串可以表示为null。例如如果用户配置: nullFormat="\N",那么如果源头数据是"\N",DataX视作null字段。
日期格式
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.format.BasicPainFormat.defaultNullFormat()
- 说明: 描述:日期类型的数据序列化到文件中时的格式,例如 "dateFormat": "yyyy-MM-dd"。
csvConfig
类型: 富文本
必须: 否
默认值: 无
说明:
描述:(读取/写入)CSV类型文件参数配置,Map类型。
- 写入CSV类型文件使用的CsvWriter进行写入,会有很多配置,不配置则使用默认值。
{ "forceQualifier": true,
"textQualifier": "\"",
"useTextQualifier": true,
"delimiter": ",",
"recordDelimiter": 0,
"comment": "#",
"escapeMode": 1
} - 读取CSV类型文件使用的CsvReader进行读取,会有很多配置,不配置则使用默认值。所有配置项及默认值,配置时 csvReaderConfig 的map中请严格按照以下字段名字进行配置:
{ "safetySwitch": false,
"skipEmptyRecords": false,
"useTextQualifier": false}boolean caseSensitive = true;
char textQualifier = 34;
boolean trimWhitespace = true;
boolean useTextQualifier = true;//是否使用csv转义字符
char delimiter = 44;//分隔符
char recordDelimiter = 0;
char comment = 35;
boolean useComments = false;
int escapeMode = 1;
boolean safetySwitch = true;//单列长度是否限制100000字符
boolean skipEmptyRecords = true;//是否跳过空行
boolean captureRawRecord = true;
- 写入CSV类型文件使用的CsvWriter进行写入,会有很多配置,不配置则使用默认值。
header
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 描述:写出时的表头,列名(s)是否在文件头写入
猜测字段类型
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 通过TIS提供的的内部算法,尝试读取部分DFS文件内容,猜测对应列的类型,以帮助最大化提高录入表单效率。最后通过分析得到的类型不够准确,需要用户手动微调。
com.qlangtech.tis.plugin.datax.format.CSVWriterFormat
显示名: CSV
费用: 😄
社区版(免费)配置项说明:
字段分隔符
- 类型: 单选
- 必须: 是
- 默认值: comma
- 说明: 描述:读取的字段分隔符,可以用'\t','\001'等字符
压缩格式
- 类型: 单选
- 必须: 是
- 默认值: none
- 说明: 描述:文本压缩类型,默认不填写意味着没有压缩。支持压缩类型为zip、gzip、bzip2。
encoding
- 类型: 单选
- 必须: 是
- 默认值: utf-8
- 说明: 描述:读取文件的编码配置。
空值替代符
- 类型: 单行文本
- 必须: 是
- 默认值: null
- 说明: 描述:文本文件中无法使用标准字符串定义null(空指针),DataX提供nullFormat定义哪些字符串可以表示为null。例如如果用户配置: nullFormat="\N",那么如果源头数据是"\N",DataX视作null字段。
日期格式
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.format.BasicPainFormat.defaultNullFormat()
- 说明: 描述:日期类型的数据序列化到文件中时的格式,例如 "dateFormat": "yyyy-MM-dd"。
csvConfig
类型: 富文本
必须: 否
默认值: 无
说明:
描述:(读取/写入)CSV类型文件参数配置,Map类型。
- 写入CSV类型文件使用的CsvWriter进行写入,会有很多配置,不配置则使用默认值。
{ "forceQualifier": true,
"textQualifier": "\"",
"useTextQualifier": true,
"delimiter": ",",
"recordDelimiter": 0,
"comment": "#",
"escapeMode": 1
} - 读取CSV类型文件使用的CsvReader进行读取,会有很多配置,不配置则使用默认值。所有配置项及默认值,配置时 csvReaderConfig 的map中请严格按照以下字段名字进行配置:
{ "safetySwitch": false,
"skipEmptyRecords": false,
"useTextQualifier": false}boolean caseSensitive = true;
char textQualifier = 34;
boolean trimWhitespace = true;
boolean useTextQualifier = true;//是否使用csv转义字符
char delimiter = 44;//分隔符
char recordDelimiter = 0;
char comment = 35;
boolean useComments = false;
int escapeMode = 1;
boolean safetySwitch = true;//单列长度是否限制100000字符
boolean skipEmptyRecords = true;//是否跳过空行
boolean captureRawRecord = true;
- 写入CSV类型文件使用的CsvWriter进行写入,会有很多配置,不配置则使用默认值。
header
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 描述:写出时的表头,列名(s)是否在文件头写入
com.qlangtech.tis.plugin.datax.format.TextReaderFormat
显示名: TEXT
全路径名: com.qlangtech.tis.plugin.datax.format.TextReaderFormat
费用: 😄
社区版(免费)配置项说明:
字段分隔符
- 类型: 单选
- 必须: 是
- 默认值: comma
- 说明: 描述:读取的字段分隔符,可以用'\t','\001'等字符
压缩格式
- 类型: 单选
- 必须: 是
- 默认值: none
- 说明: 描述:文本压缩类型,默认不填写意味着没有压缩。支持压缩类型为zip、gzip、bzip2。
encoding
- 类型: 单选
- 必须: 是
- 默认值: utf-8
- 说明: 描述:读取文件的编码配置。
空值替代符
- 类型: 单行文本
- 必须: 是
- 默认值: null
- 说明: 描述:文本文件中无法使用标准字符串定义null(空指针),DataX提供nullFormat定义哪些字符串可以表示为null。例如如果用户配置: nullFormat="\N",那么如果源头数据是"\N",DataX视作null字段。
日期格式
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.format.BasicPainFormat.defaultNullFormat()
- 说明: 描述:日期类型的数据序列化到文件中时的格式,例如 "dateFormat": "yyyy-MM-dd"。
header
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 描述:写出时的表头,列名(s)是否在文件头写入
猜测字段类型
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 通过TIS提供的的内部算法,尝试读取部分DFS文件内容,猜测对应列的类型,以帮助最大化提高录入表单效率。最后通过分析得到的类型不够准确,需要用户手动微调。
com.qlangtech.tis.plugin.datax.format.TextWriterFormat
显示名: TEXT
全路径名: com.qlangtech.tis.plugin.datax.format.TextWriterFormat
费用: 😄
社区版(免费)配置项说明:
字段分隔符
- 类型: 单选
- 必须: 是
- 默认值: comma
- 说明: 描述:读取的字段分隔符,可以用'\t','\001'等字符
压缩格式
- 类型: 单选
- 必须: 是
- 默认值: none
- 说明: 描述:文本压缩类型,默认不填写意味着没有压缩。支持压缩类型为zip、gzip、bzip2。
encoding
- 类型: 单选
- 必须: 是
- 默认值: utf-8
- 说明: 描述:读取文件的编码配置。
空值替代符
- 类型: 单行文本
- 必须: 是
- 默认值: null
- 说明: 描述:文本文件中无法使用标准字符串定义null(空指针),DataX提供nullFormat定义哪些字符串可以表示为null。例如如果用户配置: nullFormat="\N",那么如果源头数据是"\N",DataX视作null字段。
日期格式
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.format.BasicPainFormat.defaultNullFormat()
- 说明: 描述:日期类型的数据序列化到文件中时的格式,例如 "dateFormat": "yyyy-MM-dd"。
header
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 描述:写出时的表头,列名(s)是否在文件头写入
com.qlangtech.tis.plugin.ontology.impl.linker.LinkReference
com.qlangtech.tis.plugin.ontology.impl.linker.JoinReference
显示名: Join Reference
全路径名: com.qlangtech.tis.plugin.ontology.impl.linker.JoinReference
费用: 😄
社区版(免费)配置项说明:
对象类型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 该端引用的本体对象类型(OntologyObjectType),即参与连接的一方所对应的对象。
左对象连接字段
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 连接表中用于关联“左对象”的字段,与左对象所选连接字段进行匹配(不能与右对象连接字段相同)。
右对象连接字段
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 连接表中用于关联“右对象”的字段,与右对象所选连接字段进行匹配(不能与左对象连接字段相同)。
com.qlangtech.tis.plugin.ontology.impl.linker.LinkReference
显示名: Reference
全路径名: com.qlangtech.tis.plugin.ontology.impl.linker.LinkReference
费用: 😄
社区版(免费)配置项说明:
对象类型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 该端引用的本体对象类型(OntologyObjectType),即参与连接的一方所对应的对象。
连接字段
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 在所选对象类型上用于连接关联的字段(通常为外键或主键列),用于与对端对象/连接表进行匹配。
com.qlangtech.tis.plugin.paimon.datax.writemode.WriteMode
com.qlangtech.tis.plugin.paimon.datax.writemode.BatchInsertWriteMode
显示名: Batch
全路径名: com.qlangtech.tis.plugin.paimon.datax.writemode.BatchInsertWriteMode
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.datax.writemode.StreamInsertWriteMode
显示名: Stream
全路径名: com.qlangtech.tis.plugin.paimon.datax.writemode.StreamInsertWriteMode
费用: 😄
社区版(免费)配置项说明:
batchSize
类型: 整型数字
必须: 是
默认值: 30000
说明:
在 Paimon 的 Stream 写入模式下,选择最佳的单次 Commit 记录数量需要平衡 数据延迟、写入效率和小文件问题三大因素。
⚠️ 必须规避的陷阱
过度追求低延迟
# 错误配置(导致小文件爆炸)
commit.interval = 1s
sink.buffer-size = 100后果:每秒生成数百小文件,NameNode 压力激增
盲目增大批次
# 错误配置(内存溢出风险)
sink.buffer-size = 1000000
execution.checkpointing.interval = 10min后果:Flink TM OOM,Checkpoint 超时失败
忽略数据特征
- 大对象场景(如图片/文档):
# 改用数据体积控制
sink.buffer-size = -1 # 禁用条数控制
sink.max-buffer-size = 128mb # 按体积Commit
- 大对象场景(如图片/文档):
📊 性能优化对照表
单Commit条数 延迟 吞吐 小文件风险 适用场景 <1,000 极低(1s内) 低 极高 实时监控告警 1,000~10,000 低(1~5s) 中等 高 实时报表/风控 10,000~50,000 中等(5~15s) 高 中 通用CDC同步 ✅ 50,000~200,000 较高(15~60s) 极高 低 历史数据回填 >200,000 高(>1min) 超高性能 极低 批量ETL(非实时) 终极建议:从 25,000条/Commit 开始(约5-10秒数据量),结合实时监控逐步调整。在精确控制延迟的场景,优先使用
commit.interval时间阈值;在高吞吐场景,优先用sink.buffer-size条数控制,并始终开启自动合并防御小文件问题。
com.qlangtech.tis.plugin.datax.meta.MetaDataWriter
com.qlangtech.tis.plugin.datax.meta.DefaultMetaDataWriter
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.meta.DefaultMetaDataWriter
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.meta.NoneMetaDataWriter
显示名: off
全路径名: com.qlangtech.tis.plugin.datax.meta.NoneMetaDataWriter
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.OntologyProperty
com.qlangtech.tis.plugin.ontology.impl.objtype.DefaultOntologyProperty
显示名: DefaultOntologyProperty
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.DefaultOntologyProperty
费用: 😄
社区版(免费)配置项说明:
属性名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 属性的数据库列名
描述
- 类型: 富文本
- 必须: 否
- 默认值: 无
- 说明: 属性的详细业务描述
类型引用
- 类型: 单行文本
- 必须: 是
- 默认值: Default
- 说明: 无
主键
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 无
允许为空
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 无
语义角色
- 类型: 单行文本
- 必须: 是
- 默认值: Unknown
- 说明: ChatBI查询中的语义角色
物理表达式
- 类型: 富文本
- 必须: 否
- 默认值: 无
- 说明: 用于描述从物理存储格式到查询可用格式的转换,使用 {col} 作为列名占位符。
com.qlangtech.tis.plugin.ontology.chatbi.config.TraceConfig
com.qlangtech.tis.plugin.ontology.chatbi.config.TraceConfig
显示名: Trace Config
全路径名: com.qlangtech.tis.plugin.ontology.chatbi.config.TraceConfig
费用: 😄
社区版(免费)配置项说明:
最大 Trace 数
- 类型: 整型数字
- 必须: 是
- 默认值: 100
- 说明: 最大保存的 trace 文件数。超过限制时删除最旧的文件。推荐范围:100-1000
保留天数
- 类型: 整型数字
- 必须: 是
- 默认值: 7
- 说明: Trace 文件保留天数。超过此天数的日期目录会被自动删除。推荐范围:3-30
启用自动清理
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 是否启用自动清理机制。关闭后需要手动清理历史 trace 文件
com.qlangtech.plugins.incr.flink.launch.CheckpointFactory
🔐com.qlangtech.plugins.incr.flink.launch.ckpt.CKOn
显示名: customize
费用: 🔐
社区协作配置项说明:
ckpointInterval
类型: 整型数字
必须: 是
默认值: 200
说明:
Gets the interval in which checkpoints are periodically scheduled.
This setting defines the base interval. Checkpoint triggering may be delayed by the settingsexecution.checkpointing.max-concurrent-checkpoints,execution.checkpointing.min-pauseandexecution.checkpointing.interval-during-backlog单位:
秒
checkpointMode
类型: 单选
必须: 是
默认值: EXACTLY_ONCE
说明:
The checkpointing mode (exactly-once vs. at-least-once).
checkpointTimeout
类型: 整型数字
必须: 是
默认值: 600
说明:
The maximum time that a checkpoint may take before being discarded.
单位:
秒
maxConcurrentNum
类型: 整型数字
必须: 是
默认值: 1
说明:
The maximum number of checkpoint attempts that may be in progress at the same time. If this value is n, then no checkpoints will be triggered while n checkpoint attempts are currently in flight. For the next checkpoint to be triggered, one checkpoint attempt would need to finish or expire.
minPause
类型: 整型数字
必须: 是
默认值: 0
说明:
The minimal pause between checkpointing attempts. This setting defines how soon thecheckpoint coordinator may trigger another checkpoint after it becomes possible to triggeranother checkpoint with respect to the maximum number of concurrent checkpoints(see
execution.checkpointing.max-concurrent-checkpoints).
If the maximum number of concurrent checkpoints is set to one, this setting makes effectively sure that a minimum amount of time passes where no checkpoint is in progress at all.单位:
秒
maxFaildNum
类型: 整型数字
必须: 是
默认值: 0
说明:
The tolerable checkpoint consecutive failure number. If set to 0, that means we do not tolerance any checkpoint failure. This only applies to the following failure reasons: IOException on the Job Manager, failures in the async phase on the Task Managers and checkpoint expiration due to a timeout. Failures originating from the sync phase on the Task Managers are always forcing failover of an affected task. Other types of checkpoint failures (such as checkpoint being subsumed) are being ignored.
enableExternal
类型: 单选
必须: 是
默认值: RETAIN_ON_CANCELLATION
说明:
Externalized checkpoints write their meta data out to persistent storage and are not automatically cleaned up when the owning job fails or is suspended (terminating with job status
JobStatus#FAILEDorJobStatus#SUSPENDED). In this case, you have to manually clean up the checkpoint state, both the meta data and actual program state.
The mode defines how an externalized checkpoint should be cleaned up on job cancellation. If you choose to retain externalized checkpoints on cancellation you have to handle checkpoint clean up manually when you cancel the job as well (terminating with job statusJobStatus#CANCELED).
The target directory for externalized checkpoints is configured viaexecution.checkpointing.dir.
enableUnaligned
类型: 单选
必须: 是
默认值: false
说明:
Enables unaligned checkpoints, which greatly reduce checkpointing times under backpressure.
Unaligned checkpoints contain data stored in buffers as part of the checkpoint state, which allows checkpoint barriers to overtake these buffers. Thus, the checkpoint duration becomes independent of the current throughput as checkpoint barriers are effectively not embedded into the stream of data anymore.
Unaligned checkpoints can only be enabled ifexecution.checkpointing.modeisEXACTLY_ONCEand ifexecution.checkpointing.max-concurrent-checkpointsis 1
forceUnaligned
类型: 单选
必须: 是
默认值: false
说明:
Forces unaligned checkpoints, particularly allowing them for iterative jobs.
com.qlangtech.plugins.incr.flink.launch.ckpt.CKOff
显示名: off
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.launch.ckpt.DefaultCK
显示名: on
全路径名: com.qlangtech.plugins.incr.flink.launch.ckpt.DefaultCK
费用: 😄
社区版(免费)配置项说明:
ckpointInterval
类型: 整型数字
必须: 是
默认值: 200
说明:
Gets the interval in which checkpoints are periodically scheduled.
This setting defines the base interval. Checkpoint triggering may be delayed by the settingsexecution.checkpointing.max-concurrent-checkpoints,execution.checkpointing.min-pauseandexecution.checkpointing.interval-during-backlog单位:
秒
com.qlangtech.tis.plugin.ds.DataSourceFactoryManipulate
com.qlangtech.tis.plugin.ontology.ExportToOntologyInDataSource
显示名: Export To Ontology
全路径名: com.qlangtech.tis.plugin.ontology.ExportToOntologyInDataSource
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
本体(Ontology)域
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 选择目标本体管理域
导出表
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要导出作为本体对象的表
🔐com.qlangtech.tis.plugin.ds.manipulate.CloneDataSourceFactory
显示名: Clone
全路径名: com.qlangtech.tis.plugin.ds.manipulate.CloneDataSourceFactory
提供者: TIS
费用: 🔐
社区协作配置项说明:
新实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 填写新实例名称,不能与已存在的数据源实例重名
com.qlangtech.tis.plugin.paimon.datax.writebuffer.PaimonWriteBuffer
com.qlangtech.tis.plugin.paimon.datax.writebuffer.PaimonWriteBufferCustomize
显示名: customize
全路径名: com.qlangtech.tis.plugin.paimon.datax.writebuffer.PaimonWriteBufferCustomize
费用: 😄
社区版(免费)配置项说明:
size
类型: 字节规格容量
必须: 是
默认值: 256
说明:
Amount of data to build up in memory before converting to a sorted on-disk file.
write-buffer-size(默认值: 128mb):- 作用: 这是控制内存中 Buffer 大小的参数。当 Flink 或 Spark 任务向 Paimon 写入数据时,数据首先会缓存在内存中的一个排序缓冲区(Sorter Buffer)中。
- 原理: 当一个 Buffer 被填满(达到
write-buffer-size)时,它会被排序并刷写(Spill)到磁盘,形成一个 L0 文件。 - 影响:
write-buffer-size直接决定了单个 L0 文件的最小期望大小。如果你期望每个 L0 文件大约是 256MB,那么就应该设置write-buffer-size=256mb。Buffer 满了就刷写,自然就生成了一个 ~256MB 的文件。
spillable
类型: 单选
必须: 否
默认值: 无
说明:
Whether the write buffer can be spillable. Enabled by default when using object storage or when 'target-file-size' is greater than 'write-buffer-size'.
spill.max-disk-size
类型: 字节规格容量
必须: 否
默认值: 无
说明:
The max disk to use for write buffer spill. This only work when the write buffer spill is enabled
target-file-size
类型: 字节规格容量
必须: 否
默认值: 无
说明:
Target size of a file.
- primary key table: the default value is 128 MB.
- append table: the default value is 256 MB.
target-file-size(默认值: 128mb):- 作用: 这是 Paimon 最终期望生成的稳定数据文件(通常是经过 Compaction 合并到更高层级的文件)的目标大小。
- 原理: 在 Compaction 过程中(无论是 Universal 还是 Size-Tiered),Paimon 会尝试将输入的小文件合并,并输出大小接近
target-file-size的文件到更高的层级(如 L1, L2)。 - 影响 L0 的间接方式: 虽然
target-file-size主要影响 Compaction 的输出,但它间接影响 L0 文件的“合并潜力”。如果target-file-size设置得很大(比如 1GB),那么 Compaction 需要积累更多的 L0 小文件(累计大小达到 ~1GB)才会触发合并操作。这相当于放宽了触发 Compaction 的“累计大小”阈值。 - 注意:
target-file-size不直接控制单个 L0 文件的大小。L0 文件大小主要由write-buffer-size和 Checkpointing 决定。 - 效果: 主要在 Universal Compaction 中影响较大。因为 Universal 在合并时会尽量将一组文件合并成一个接近
target-file-size的大文件。增大target-file-size意味着 Compaction 需要积累更多的 L0 文件(总数据量更大)才会触发合并。对于 Size-Tiered,它定义了更高层级文件的大小目标,也间接影响合并策略。 - 注意: 过大的
target-file-size可能影响查询效率(读取大文件可能慢)和 Compaction 本身的资源消耗(合并更大量数据)。
com.qlangtech.tis.plugin.paimon.datax.writebuffer.PaimonWriteBufferDefault
显示名: default
全路径名: com.qlangtech.tis.plugin.paimon.datax.writebuffer.PaimonWriteBufferDefault
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.launch.clustertype.ClusterType
🔐com.qlangtech.plugins.incr.flink.launch.clustertype.KubernetesApplication
显示名: kubernetes-application
全路径名: com.qlangtech.plugins.incr.flink.launch.clustertype.KubernetesApplication
费用: 🔐
社区协作配置项说明:
clusterId
类型: 单行文本
必须: 是
默认值: tis-flink-cluster-1
说明:
The cluster-id, which should be no more than 45 characters, is used for identifying a unique Flink cluster. The id must only contain lowercase alphanumeric characters and "-". The required format is
a-z. If not set, the client will automatically generate it with a random ID.
集群配置
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 管理已创建的集群配置引用,如还未创建则不选,在下一步流程中创建集群配置
🔐com.qlangtech.plugins.incr.flink.launch.clustertype.KubernetesSession
显示名: kubernetes-session
全路径名: com.qlangtech.plugins.incr.flink.launch.clustertype.KubernetesSession
费用: 🔐
社区协作配置项说明:
flinkCluster
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.plugins.incr.flink.launch.clustertype.Standalone
显示名: Standalone
全路径名: com.qlangtech.plugins.incr.flink.launch.clustertype.Standalone
费用: 😄
社区版(免费)配置项说明:
flinkCluster
类型: 单选
必须: 是
默认值: 无
说明:
Standalone 集群: 详细请查看
安装说明:
下载、解压
wget http://tis-release.oss-cn-beijing.aliyuncs.com/5.1.0/tis/flink-tis-1.20.1-bin.tar.gz && rm -rf flink-tis-1.20.1 && mkdir flink-tis-1.20.1 && tar xvf flink-tis-1.20.1-bin.tar.gz -C ./flink-tis-1.20.1修改
$FLINK_HOME/conf/config.yaml# The address that the REST & web server binds to
# By default, this is localhost, which prevents the REST & web server from
# being able to communicate outside of the machine/container it is running on.
#
# To enable this, set the bind address to one that has access to outside-facing
# network interface, such as 0.0.0.0.
#
rest.bind-address: 0.0.0.0这样使Flink启动之后,可以从其他机器节点访问flink所在的节点
# The number of task slots that each TaskManager offers. Each slot runs one parallel pipeline.
taskmanager:
numberOfTaskSlots: 1默认值是1,需要在单个Flink节点上运行多个Flink任务,可修改成大于1的值就行(一般情况slot代表了服务节点的资源并行处理能力,一般配置于节点CPU核数相一致即可)
启动Flink-Cluster:
./bin/start-cluster.sh
com.qlangtech.tis.datax.DataXJobSubmit
com.qlangtech.tis.plugin.akka.DistributedAKKAJobDataXJobSubmit
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.EmbeddedDataXJobSubmit
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.LocalDataXJobSubmit
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.kingbase.KingBaseCompatibleMode
com.qlangtech.tis.plugin.datax.kingbase.mode.MySQLMode
显示名: MySQL
全路径名: com.qlangtech.tis.plugin.datax.kingbase.mode.MySQLMode
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
自动建表
- 类型: 单选
- 必须: 是
- 默认值: on
- 说明: 当该数据源作为目标端,是否支持自动在目标端中创建表?
com.qlangtech.tis.plugin.datax.kingbase.mode.OracleMode
显示名: Oracle
全路径名: com.qlangtech.tis.plugin.datax.kingbase.mode.OracleMode
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
自动建表
- 类型: 单选
- 必须: 是
- 默认值: on
- 说明: 当该数据源作为目标端,是否支持自动在目标端中创建表?
com.qlangtech.tis.plugin.datax.kingbase.mode.PGMode
显示名: Postgres
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
自动建表
- 类型: 单选
- 必须: 是
- 默认值: on
- 说明: 当该数据源作为目标端,是否支持自动在目标端中创建表?
com.qlangtech.tis.async.message.client.consumer.impl.MQListenerFactory
com.qlangtech.tis.plugin.kafka.consumer.KafkaMQListenerFactory
显示名: Kafka
全路径名: com.qlangtech.tis.plugin.kafka.consumer.KafkaMQListenerFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
独立监听
类型: 单选
必须: 是
默认值: false
说明:
执行Flink任务过程中,监听分配独立的Slot计算资源不会与下游计算算子混合在一起。
如开启,带来的好处是运算时资源各自独立不会相互相互影响,弊端是,上游算子与下游算子独立在两个Solt中需要额外的网络传输开销
Startint Offsets
类型: 单行文本
必须: 是
默认值: Latest Offset
说明:
Kafka消费起始位置,有以下策略可供选择
Committed Offset: Start from committed offset of the consuming group, without reset strategy. An exception will be thrown at runtime if there is no committed offsets.Earliest Offset: Start from earliest offsetEarliest When None Committed Offset: Start from committed offset, also use EARLIEST as reset strategy if committed offset doesn't existLatest Offset: (default) Start from latest offsetTimestamp Offset: Start from the first record whose timestamp is greater than or equals a timestamp (milliseconds)
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
com.qlangtech.plugins.incr.flink.cdc.kingbase.FlinkCDCKingBaseSourceFactory
显示名: Flink-CDC-KingBase
全路径名: com.qlangtech.plugins.incr.flink.cdc.kingbase.FlinkCDCKingBaseSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
解码器
- 类型: 单选
- 必须: 是
- 默认值: decoderbufs
- 说明: The name of the KingBase logical decoding plug-in installed on the server. Supported values are decoderbufs
Slot
类型: 单行文本
必须: 是
默认值: com.qlangtech.tis.trigger.util.UnCacheString@3ac406d4
说明:
The name of the Postgres logical decoding slot created for streaming changes from a plugin.Defaults to 'debezium
Drop slot on stop
类型: 单选
必须: 是
默认值: false
说明:
Whether or not to drop the logical replication slot when the connector finishes orderlyBy default the replication is kept so that on restart progress can resume from the last recorded location
起始位点
类型: 单选
必须: 是
默认值: latest
说明:
Debezium startup options
Initial: Performs an initial snapshot on the monitored database tables upon first startup, and continue to read the latest binlog.Latest: Never to perform snapshot on the monitored database tables upon first startup, just read from the end of the binlog which means only have the changes since the connector was started.
Replica Rule
类型: 单行文本
必须: 是
默认值: FULL
说明:
在 PostgreSQL 中,ALTER TABLE ... REPLICA IDENTITY 命令用于指定在逻辑复制或行级触发器中如何标识已更新或删除的行。https://developer.aliyun.com/ask/575334
可选项有以下两个
FULL: 使用此值需要确保对应的表执行ALTER TABLE your_table_name REPLICA IDENTITY FULL;,表记录更新时会带上更新Before值,使用此方式比较耗费性能。DEFAULT: 默认值,更新删除操作时不会带上Before值。
如目标端需要实现
物理删除,必须选择FULL
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
com.qlangtech.plugins.incr.flink.cdc.mongdb.FlinkCDCMongoDBSourceFactory
显示名: Flink-CDC-MongoDB
全路径名: com.qlangtech.plugins.incr.flink.cdc.mongdb.FlinkCDCMongoDBSourceFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
起始位点
类型: 单行文本
必须: 是
默认值: LATEST_OFFSET
说明:
Debezium startup options
Initial: Performs an initial snapshot on the monitored database tables upon first startup, and continue to read the latest oplog.Latest(default): Never to perform snapshot on the monitored database tables upon first startup, just read from the end of the oplog which means only have the changes since the connector was started.Timestamp: Skip snapshot phase and start reading oplog events from a specific timestamp.
补全策略
类型: 单行文本
必须: 是
默认值: UPDATE_LOOKUP
说明:
MongoDB 发生更新时候,before数据获取策略,目前有两种方式
- FULL_CHANGE_LOG: (包括:
RowKind.UPDATE_BEFORE,RowKind.UPDATE_AFTER两种类型消息) Full Changelog详细参考 - UPDATE_LOOKUP: 通过 CDC内部合并更新内容和更新之前的整条记录值(包括: 只有
RowKind.UPDATE_AFTER一种类型消息)
- FULL_CHANGE_LOG: (包括:
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
Conn Options
类型: 单行文本
必须: 否
默认值: 无
说明:
The ampersand-separated connection options of MongoDB. eg:
replicaSet=test&connectTimeoutMS=300000Default: none
com.qlangtech.tis.plugins.incr.flink.cdc.maria.FlinkCDCMariaDBSourceFactory
显示名: Flink-CDC-MariaDB
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.maria.FlinkCDCMariaDBSourceFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
起始位点
类型: 单选
必须: 是
默认值: LATEST_OFFSET
说明:
Debezium startup options
参数详细请参考:https://ververica.github.io/flink-cdc-connectors/master/content/connectors/mysql-cdc.html#connector-options ,https://debezium.io/documentation/reference/1.5/connectors/mysql.html#mysql-property-snapshot-mode
:InitialPerforms an initial snapshot on the monitored database tables upon first startup, and continue to read the latest binlog.:EarliestNever to perform snapshot on the monitored database tables upon first startup, just read from the beginning of the binlog. This should be used with care, as it is only valid when the binlog is guaranteed to contain the entire history of the database.Latest: Never to perform snapshot on the monitored database tables upon first startup, just read from the end of the binlog which means only have the changes since the connector was started.Timestamp: Never to perform snapshot on the monitored database tables upon first startup, and directly read binlog from the specified timestamp.The consumer will traverse the binlog from the beginning and ignore change events whose timestamp is smaller than the specified timestamp.
BinLog独立监听
类型: 单选
必须: 是
默认值: false
说明:
执行Flink任务过程中,Binlog监听分配独立的Slot计算资源不会与下游计算算子混合在一起。
如开启,带来的好处是运算时资源各自独立不会相互相互影响,弊端是,上游算子与下游算子独立在两个Solt中需要额外的网络传输开销
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
com.qlangtech.tis.plugins.incr.flink.cdc.mysql.FlinkCDCMySQLSourceFactory
显示名: Flink-CDC-MySQL
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.mysql.FlinkCDCMySQLSourceFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
起始位点
类型: 单选
必须: 是
默认值: LATEST_OFFSET
说明:
Debezium startup options
参数详细请参考:https://ververica.github.io/flink-cdc-connectors/master/content/connectors/mysql-cdc.html#connector-options ,https://debezium.io/documentation/reference/1.5/connectors/mysql.html#mysql-property-snapshot-mode
:InitialPerforms an initial snapshot on the monitored database tables upon first startup, and continue to read the latest binlog.:EarliestNever to perform snapshot on the monitored database tables upon first startup, just read from the beginning of the binlog. This should be used with care, as it is only valid when the binlog is guaranteed to contain the entire history of the database.Latest: Never to perform snapshot on the monitored database tables upon first startup, just read from the end of the binlog which means only have the changes since the connector was started.Timestamp: Never to perform snapshot on the monitored database tables upon first startup, and directly read binlog from the specified timestamp.The consumer will traverse the binlog from the beginning and ignore change events whose timestamp is smaller than the specified timestamp.
BinLog独立监听
类型: 单选
必须: 是
默认值: false
说明:
执行Flink任务过程中,Binlog监听分配独立的Slot计算资源不会与下游计算算子混合在一起。
如开启,带来的好处是运算时资源各自独立不会相互相互影响,弊端是,上游算子与下游算子独立在两个Solt中需要额外的网络传输开销
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
com.qlangtech.plugins.incr.flink.cdc.oracle.FlinkCDCOracleSourceFactory
显示名: Flink-CDC-Oracle
全路径名: com.qlangtech.plugins.incr.flink.cdc.oracle.FlinkCDCOracleSourceFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
startupOptions
类型: 单选
必须: 是
默认值: latest
说明:
Optional startup mode for Oracle CDC consumer, valid enumerations are "initial" and "latest-offset". Please see Startup Reading Positionsection for more detailed information.
参数详细请参考:https://ververica.github.io/flink-cdc-connectors/master/content/connectors/oracle-cdc.html#connector-options ,https://debezium.io/documentation/reference/1.5/connectors/oracle.html#oracle-connector-properties
Initial: Performs an initial snapshot on the monitored database tables upon first startup, and continue to read the latest binlog.Latest: Never to perform a snapshot on the monitored database tables upon first startup, just read from the change since the connector was started.Note: the mechanism of
scan.startup.modeoption relying on Debezium’ssnapshot.modeconfiguration. So please do not use them together. If you specific bothscan.startup.modeanddebezium.snapshot.modeoptions in the table DDL, it may makescan.startup.modedoesn’t work.
Log Mining Strategy
类型: 单选
必须: 是
默认值: redo_log_catalog
说明:
There are strategies: Online catalog with faster mining but no captured DDL. Another - with data dictionary loaded into REDO LOG files
Supports mining LOB fields and operations
类型: 单选
必须: 是
默认值: false
说明:
When set to
false, the default, LOB fields will not be captured nor emitted. When set totrue, the connector will capture LOB fields and emit changes for those fields like any other column type.
Poll interval (ms)
类型: 整型数字
必须: 是
默认值: 500
说明:
Time to wait for new change events to appear after receiving no events, given in milliseconds. Defaults to 500 ms.
Event deserialization failure handling
类型: 单选
必须: 是
默认值: fail
说明:
Specify how failures during processing of events (i.e. when encountering a corrupted event) should be handled, including:'fail' (the default) an exception indicating the problematic event and its position is raised, causing the connector to be stopped; 'warn' the problematic event and its position will be logged and the event will be skipped;'ignore' the problematic event will be skipped.
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
BinLog独立监听
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 无
com.qlangtech.plugins.incr.flink.cdc.postgresql.FlinkCDCPostreSQLSourceFactory
显示名: Flink-CDC-PostgreSQL
全路径名: com.qlangtech.plugins.incr.flink.cdc.postgresql.FlinkCDCPostreSQLSourceFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
解码器
- 类型: 单选
- 必须: 是
- 默认值: decoderbufs
- 说明: The name of the Postgres logical decoding plug-in installed on the server. Supported values are decoderbufs, wal2json, wal2json_rds, wal2json_streaming, wal2json_rds_streaming and pgoutput.
Slot
类型: 单行文本
必须: 是
默认值: com.qlangtech.tis.trigger.util.UnCacheString@1e6bd367
说明:
The name of the Postgres logical decoding slot created for streaming changes from a plugin.Defaults to 'debezium
Drop slot on stop
类型: 单选
必须: 是
默认值: false
说明:
Whether or not to drop the logical replication slot when the connector finishes orderlyBy default the replication is kept so that on restart progress can resume from the last recorded location
起始位点
类型: 单选
必须: 是
默认值: latest
说明:
Debezium startup options
Initial: Performs an initial snapshot on the monitored database tables upon first startup, and continue to read the latest binlog.Latest: Never to perform snapshot on the monitored database tables upon first startup, just read from the end of the binlog which means only have the changes since the connector was started.
Replica Rule
类型: 单行文本
必须: 是
默认值: FULL
说明:
在 PostgreSQL 中,ALTER TABLE ... REPLICA IDENTITY 命令用于指定在逻辑复制或行级触发器中如何标识已更新或删除的行。https://developer.aliyun.com/ask/575334
可选项有以下两个
FULL: 使用此值需要确保对应的表执行ALTER TABLE your_table_name REPLICA IDENTITY FULL;,表记录更新时会带上更新Before值,使用此方式比较耗费性能。DEFAULT: 默认值,更新删除操作时不会带上Before值。
如目标端需要实现
物理删除,必须选择FULL
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.FlinkCDCSqlServerSourceFactory
显示名: Flink-CDC-SqlServer
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.FlinkCDCSqlServerSourceFactory
提供者: FlinkCDC
费用: 😄
社区版(免费)配置项说明:
起始位点
类型: 单行文本
必须: 是
默认值: LatestOffset
说明:
Initial: Takes a snapshot of structure and data of captured tables; useful if topics should be populated with a complete representation of the data from the captured tables.Snapshot: Takes a snapshot of structure and data like initial but instead does not transition into streaming changes once the snapshot has completed.LatestOffset(default): Takes a snapshot of the structure of captured tables only; useful if only changes happening from now onwards should be propagated to topics.
BinLog独立监听
类型: 单选
必须: 是
默认值: false
说明:
执行Flink任务过程中,Binlog监听分配独立的Slot计算资源不会与下游计算算子混合在一起。
如开启,带来的好处是运算时资源各自独立不会相互相互影响,弊端是,上游算子与下游算子独立在两个Solt中需要额外的网络传输开销
过滤
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 可以将数据流中将某一种事件类型的事件过滤掉,有以下几种类型可以选择:INSERT, UPDATE_BEFORE, UPDATE_AFTER, DELETE
com.qlangtech.tis.datax.DefaultDataXProcessorManipulate
com.qlangtech.plugins.incr.flink.alert.AddMonitorForEvents
显示名: Add Monitor for Alert
全路径名: com.qlangtech.plugins.incr.flink.alert.AddMonitorForEvents
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: alert
- 说明: 一个数据管道只能定义一个监控
启用
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 配置完成之后,使用过程中可以控制报警渠道暂时失效,可选择‘否’
报警渠道
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 选择需要的报警发送渠道
com.qlangtech.tis.dag.BatchJobCrontab
显示名: Crontab
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: crontab
- 说明: 一个数据管道只能定义一个定时任务触发器
表达式
类型: 单行文本
必须: 是
默认值: 无
说明:
填写 CRON 表达式 在线生成网站
例子:
0 0 12 * * ?每天中午12点触发0 15 10 ? * *每天上午10:15触发0 15 10 * * ? 20052005年的每天上午10:15触发
启用
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 配置完成之后,使用过程中可以控制定时触发暂时失效,可选择‘否’
🔐com.qlangtech.tis.plugin.ds.manipulate.CloneDefaultDataXProcessor
显示名: Clone
全路径名: com.qlangtech.tis.plugin.ds.manipulate.CloneDefaultDataXProcessor
提供者: TIS
费用: 🔐
社区协作配置项说明:
新实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 填写新实例名称,不能与已存在的数据管道实例重名
com.qlangtech.tis.plugin.datax.mongo.UpsertSupport
com.qlangtech.tis.plugin.datax.mongo.OffUpsertSupport
显示名: off
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.mongo.OnUpsertSupport
显示名: on
费用: 😄
社区版(免费)配置项说明:
upsertKey
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@6c8ad6d7
- 说明: replaceKey指定了每行记录的业务主键。用来做更新时使用
com.qlangtech.tis.plugin.datax.powerjob.PowerJobOMS
com.qlangtech.tis.plugin.datax.powerjob.PowerJobOMS
显示名: OMSProfile
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
akkaPort
- 类型: 整型数字
- 必须: 是
- 默认值: 10086
- 说明: PowerJob配置,Akka端口号,默认10086
httpPort
- 类型: 整型数字
- 必须: 是
- 默认值: 10010
- 说明: PowerJob配置,多语言客户端HTTP端口号,默认10010, 不建议更改
retentionLocal
- 类型: 整型数字
- 必须: 是
- 默认值: 7
- 说明: 本地容器保留天数,负数代表永久保留
retentionRemote
- 类型: 整型数字
- 必须: 是
- 默认值: 7
- 说明: 远程容器保留天数,负数代表永久保留
com.qlangtech.plugins.incr.flink.cdc.pglike.PGLikeReplicaIdentity
com.qlangtech.plugins.incr.flink.cdc.pglike.replica.DefaultPGLikeReplicaIdentity
显示名: DEFAULT
全路径名: com.qlangtech.plugins.incr.flink.cdc.pglike.replica.DefaultPGLikeReplicaIdentity
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.cdc.pglike.replica.FullPGLikeReplicaIdentity
显示名: FULL
全路径名: com.qlangtech.plugins.incr.flink.cdc.pglike.replica.FullPGLikeReplicaIdentity
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.FSFormat
com.qlangtech.tis.plugin.datax.impl.TextFSFormat
显示名: TEXT
费用: 😄
社区版(免费)插件包: tis-datax-hdfs-plugin/tis-datax-hdfs-plugin_hadoop_3.0.0-cdh6.3.2.tpi
配置项说明:
列分割符
- 类型: 单选
- 必须: 是
- 默认值: char001
- 说明: 描述:读取的字段分隔符,可以用'\t','\001'等字符
com.qlangtech.tis.hive.impl.OrcFSFormat
显示名: ORC
费用: 😄
社区版(免费)
com.qlangtech.tis.hive.impl.ParquetFSFormat
显示名: PARQUET
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.datax.compact.PaimonCompaction
com.qlangtech.tis.plugin.paimon.datax.compact.PaimonCompaction
显示名: default
全路径名: com.qlangtech.tis.plugin.paimon.datax.compact.PaimonCompaction
费用: 😄
社区版(免费)配置项说明:
min.file-num
类型: 整型数字
必须: 是
默认值: 5
说明:
For file set [f_0,...,f_N], the minimum file number to trigger a compaction for append-only table.
放大比例
类型: 整型数字
必须: 是
默认值: 200
说明:
The size amplification is defined as the amount (in percentage) of additional storage needed to store a single byte of data in the merge tree for changelog mode table.
size-ratio
类型: 整型数字
必须: 是
默认值: 1
说明:
Percentage flexibility while comparing sorted run size for changelog mode table. If the candidate sorted run(s) size is 1% smaller than the next sorted run's size, then include next sorted run into this candidate set.
optimization-interval
类型: 时间跨度
必须: 否
默认值: 2
说明:
Implying how often to perform an optimization compaction, this configuration is used to ensure the query timeliness of the read-optimized system table.
compaction.optimization-interval 的核心是平衡后台优化开销和数据查询/管理效率。1 分钟是安全的默认起点。 最佳值需要通过仔细监控你的特定工作负载在特定环境下的表现(资源使用、文件状态、查询延迟、写入稳定性)来确定。优先解决已观察到的瓶颈(资源争用或小文件堆积),然后进行有针对性的调整。记住,它需要与 compaction.max.file-num 和 compaction.early.max.file-num 等参数协同工作。
num.trigger
类型: 整型数字
必须: 否
默认值: 5
说明:
The sorted run number to trigger compaction. Includes level0 files (one file one sorted run) and high-level runs (one level one sorted run).
num-sorted-run.compaction-trigger = N意味着:当 Paimon 表(LSM 结构)的磁盘文件片段(Sorted Run)积累到N个时,系统会自动启动后台合并(Compaction)任务,将这些文件合并成更少、更大的文件,以优化后续的查询性能和空间利用率。 这个参数是平衡写入吞吐量和查询性能的关键杠杆之一。
num.stop.trigger
类型: 整型数字
必须: 否
默认值: 无
说明:
The number of sorted runs that trigger the stopping of writes, the default value is 'num-sorted-run.compaction-trigger' + 3.
以下是
num-sorted-run.stop-trigger的详细解释:背景:写入与合并的速率差
- 数据持续写入会不断产生新的 Sorted Run。
- 后台的 Compaction 任务负责合并这些 Sorted Run 以减少其数量。
- 理想情况下,Compaction 的速度应该能跟上写入产生新 Sorted Run 的速度,保持 Sorted Run 数量在
compaction-trigger附近波动。 - 但是,如果写入速率远远超过 Compaction 的处理能力,Sorted Run 的数量就会持续增长。
num-sorted-run.stop-trigger的核心作用- 这个参数定义了一个更高的 Sorted Run 数量阈值。
- 当磁盘上的 Sorted Run 数量达到或超过这个
stop-trigger设定的值时,Paimon 会采取强制措施:暂停(或显著减慢)新的数据写入操作。 - 简单说:它设定了“积攒的文件片段(Sorted Run)数量达到某个危险上限时,必须停止写入,优先让合并追赶上来”。
writeOnly
类型: 单选
必须: 是
默认值: false
说明:
If set to true, compactions and snapshot expiration will be skipped. This option is used along with dedicated compact jobs.
com.qlangtech.tis.plugin.k8s.K8sImage
com.qlangtech.tis.config.k8s.impl.DefaultK8SImage
显示名: dft-image
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
k8sCfg
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
命名空间
类型: 单行文本
必须: 是
默认值: default
说明:
Kubernetes中的Namespace是一种用于在集群内部组织和隔离资源的机制。一个Namespace可以看作是一个虚拟的集群,它将物理集群划分为多个逻辑部分,每个部分都有自己的一组资源(如Pod、Service、ConfigMap等)。
例如:输入框中录入的值为
tis,该命名空间尚未创建,则可通过输入命令行:kubectl create namespace tis创建。Kubernetes 默认包含 :
default这个名字空间,以便于你无需创建新的名字空间即可开始使用新集群。
镜像地址
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
使用ExternalIP
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 当TIS控制台不在K8S的网络中,选择'是',TIS控制台节点使用ExternalIP作为连接地址。
hostAliases
类型: 富文本
必须: 否
默认值: 无
说明:
启动Pod时会在容器内的hosts文件中添加所输入的内容,例子:
- ip: "127.0.0.1"
hostnames:
- "foo.local"
- "bar.local"
com.qlangtech.tis.plugin.datax.powerjob.PowerJobK8SImage
显示名: powerjob-image
全路径名: com.qlangtech.tis.plugin.datax.powerjob.PowerJobK8SImage
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
k8sCfg
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
命名空间
类型: 单行文本
必须: 是
默认值: default
说明:
Kubernetes中的Namespace是一种用于在集群内部组织和隔离资源的机制。一个Namespace可以看作是一个虚拟的集群,它将物理集群划分为多个逻辑部分,每个部分都有自己的一组资源(如Pod、Service、ConfigMap等)。
例如:输入框中录入的值为
tis,该命名空间尚未创建,则可通过输入命令行:kubectl create namespace tis创建。Kubernetes 默认包含 :
default这个名字空间,以便于你无需创建新的名字空间即可开始使用新集群。
Worker Image
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.powerjob.PowerJobK8SImage.dftPowerJobWorkerImagePath()
- 说明: DataX Worker 镜像地址
使用ExternalIP
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 当TIS控制台不在K8S的网络中,选择'是',TIS控制台节点使用ExternalIP作为连接地址。
hostAliases
类型: 富文本
必须: 否
默认值: 无
说明:
启动Pod时会在容器内的hosts文件中添加所输入的内容,例子:
- ip: "127.0.0.1"
hostnames:
- "foo.local"
- "bar.local"
com.qlangtech.plugins.incr.flink.common.FlinkK8SImage
显示名: flink-image
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
k8sCfg
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
命名空间
类型: 单行文本
必须: 是
默认值: default
说明:
Kubernetes中的Namespace是一种用于在集群内部组织和隔离资源的机制。一个Namespace可以看作是一个虚拟的集群,它将物理集群划分为多个逻辑部分,每个部分都有自己的一组资源(如Pod、Service、ConfigMap等)。
例如:输入框中录入的值为
tis,该命名空间尚未创建,则可通过输入命令行:kubectl create namespace tis创建。Kubernetes 默认包含 :
default这个名字空间,以便于你无需创建新的名字空间即可开始使用新集群。
镜像地址
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugins.incr.flink.FlinkCommon.dftImagePath()
- 说明: Flink Docker Image Path 由TIS定制
使用ExternalIP
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 当TIS控制台不在K8S的网络中,选择'是',TIS控制台节点使用ExternalIP作为连接地址。
hostAliases
类型: 富文本
必须: 否
默认值: 无
说明:
启动Pod时会在容器内的hosts文件中添加所输入的内容,例子:
- ip: "127.0.0.1"
hostnames:
- "foo.local"
- "bar.local"
com.qlangtech.tis.plugin.paimon.datax.PaimonSequenceFields
com.qlangtech.tis.plugin.paimon.datax.sequence.PaimonSequenceFieldsOff
显示名: off
全路径名: com.qlangtech.tis.plugin.paimon.datax.sequence.PaimonSequenceFieldsOff
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.datax.sequence.PaimonSequenceFieldsOn
显示名: on
全路径名: com.qlangtech.tis.plugin.paimon.datax.sequence.PaimonSequenceFieldsOn
费用: 😄
社区版(免费)配置项说明:
field
类型: 单选
必须: 是
默认值: 无
说明:
The field that generates the sequence number for primary key table, the sequence number determines which data is the most recent.
一个单调递增的字段(如时间戳、版本号),用于解决更新冲突。当主键相同时
field.sort-order
类型: 单选
必须: 是
默认值: ascending
说明:
Specify the order of sequence.field.
com.qlangtech.tis.plugin.paimon.datax.ChangelogProducer
com.qlangtech.tis.plugin.paimon.datax.changelog.ChangelogProducerON
显示名: on
全路径名: com.qlangtech.tis.plugin.paimon.datax.changelog.ChangelogProducerON
费用: 😄
社区版(免费)配置项说明:
producer
类型: 单选
必须: 是
默认值: none
说明:
Whether to double write to a changelog file. This changelog file keeps the details of data changes, it can be read directly during stream reads. This can be applied to tables with primary keys.
row-deduplicate
类型: 单选
必须: 是
默认值: false
说明:
Whether to generate -U, +U changelog for the same record. This configuration is only valid for the changelog-producer is lookup or full-compaction.
deduplicate-ignore-fields
类型: 单选
必须: 是
默认值: none
说明:
Fields that are ignored for comparison while generating -U, +U changelog for the same record. This configuration is only valid for the changelog-producer.row-deduplicate is true.
com.qlangtech.tis.plugin.paimon.datax.changelog.ChangelogProducerOff
显示名: off
全路径名: com.qlangtech.tis.plugin.paimon.datax.changelog.ChangelogProducerOff
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.CDCStartupOptions
com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.Initial
显示名: Initial
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.Initial
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.LatestOffset
显示名: LatestOffset
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.LatestOffset
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.Snapshot
显示名: Snapshot
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.sqlserver.startup.Snapshot
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.launch.StateBackendFactory
com.qlangtech.plugins.incr.flink.launch.statbackend.FileSystemState
显示名: FSState
全路径名: com.qlangtech.plugins.incr.flink.launch.statbackend.FileSystemState
费用: 😄
社区版(免费)配置项说明:
checkpointDir
类型: 单行文本
必须: 是
默认值: file:///opt/data/savepoint
说明:
The default directory used for storing the data files and meta data of checkpoints in a Flink supported filesystem. The storage path must be accessible from all participating processes/nodes(i.e. all TaskManagers and JobManagers). If the 'execution.checkpointing.storage' is set to 'jobmanager', only the meta data of checkpoints will be stored in this directory.
The scheme (hdfs://, file://, etc) is null. Please specify the file system scheme explicitly in the URI.
enableSavePoint
类型: 单选
必须: 是
默认值: true
说明:
支持任务执行savepoint,Flink任务管理器执行停机操作时会主动触发创建savepoint操作,存放位置为属性
checkpointDir平行目录下的一个以时间戳命名的子目录中
smallFileThreshold
类型: 整型数字
必须: 是
默认值: 0
说明:
The minimum size of state data files. All state chunks smaller than that are stored inline in the root checkpoint metadata file. The max memory threshold for this configuration is 1MB.
单位:
mb
writeBufferSize
类型: 整型数字
必须: 是
默认值: 4096
说明:
The default size of the write buffer for the checkpoint streams that write to file systems. The actual write buffer size is determined to be the maximum of the value of this option and option 'execution.checkpointing.data-inline-threshold'.
com.qlangtech.plugins.incr.flink.launch.statbackend.MemoryState
显示名: HashMapState
全路径名: com.qlangtech.plugins.incr.flink.launch.statbackend.MemoryState
费用: 😄
社区版(免费)配置项说明:
latencyTrackEnable
类型: 单选
必须: 是
默认值: false
说明:
Whether to track latency of keyed state operations, e.g value state put/get/clear.
trackSampleInterval
类型: 整型数字
必须: 是
默认值: 100
说明:
The sample interval of latency track once 'state.backend.latency-track.keyed-state-enabled' is enabled. The default value is 100, which means we would track the latency every 100 access requests.
trackHistorySize
类型: 整型数字
必须: 是
默认值: 128
说明:
Defines the number of measured latencies to maintain at each state access operation.
com.qlangtech.plugins.incr.flink.launch.statbackend.OFF
显示名: off
全路径名: com.qlangtech.plugins.incr.flink.launch.statbackend.OFF
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.powerjob.PowerJobOMSStorage
com.qlangtech.tis.plugin.datax.powerjob.impl.oms.MySQLPowerJobOMSStorage
显示名: MySQL
全路径名: com.qlangtech.tis.plugin.datax.powerjob.impl.oms.MySQLPowerJobOMSStorage
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
dbName
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.datax.powerjob.impl.oms.NonePowerJobOMSStorage
显示名: None
全路径名: com.qlangtech.tis.plugin.datax.powerjob.impl.oms.NonePowerJobOMSStorage
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
com.qlangtech.tis.plugin.ontology.chatbi.config.ValidationConfig
com.qlangtech.tis.plugin.ontology.chatbi.config.ValidationConfig
显示名: Validation Config
全路径名: com.qlangtech.tis.plugin.ontology.chatbi.config.ValidationConfig
费用: 😄
社区版(免费)配置项说明:
EXPLAIN 校验
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 是否启用 EXPLAIN 动态校验。关闭可加快速度但降低准确性
关键字检查
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 是否启用关键字白名单/黑名单校验。建议保持开启以确保安全
AST 校验
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 是否启用 AST 语法树校验。检查表名、列名、JOIN 是否在 GraphRAG 白名单内
允许首关键字
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@5296f00c
- 说明: 允许的 SQL 首关键字白名单(逗号分隔,不区分大小写)。只有这些关键字开头的 SQL 才会被执行。安全建议:仅保留 SELECT 相关关键字
禁止关键字
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@4727e5fc
- 说明: 禁止出现的关键字黑名单(逗号分隔,不区分大小写)。包含这些关键字的 SQL 会被拒绝。安全建议:禁止所有 DDL 和 DML 写操作
安全函数
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@5487a8f1
- 说明: 安全的字符串/数值函数(逗号分隔,不区分大小写)。这些函数即使与禁止关键字同名也会被豁免。例如:REPLACE 函数不会被误判为 CREATE OR REPLACE
com.qlangtech.tis.plugins.incr.flink.chunjun.offset.StartLocation
com.qlangtech.tis.plugins.incr.flink.chunjun.offset.DesignatedLocation
显示名: Designated
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.offset.DesignatedLocation
费用: 😄
社区版(免费)配置项说明:
startLocation
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 增量查询起始位置
com.qlangtech.tis.plugins.incr.flink.chunjun.offset.LatestLocation
显示名: Latest
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.offset.LatestLocation
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.chunjun.offset.ScanAll
显示名: Initial
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.offset.ScanAll
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.common.AutoCreateTable
com.qlangtech.tis.plugin.datax.ClickhouseAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.ClickhouseAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.dameng.writer.DaMengAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.dameng.writer.DaMengAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.doris.DorisAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.doris.DorisAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
建表模型
类型: 单行文本
必须: 是
默认值: Unique
说明:
TIS可以帮助用户自动生成Doris端的建表DDL语句,如Doris中已存在对应的表可选择
Off,如需要生成可以选择Unique和Duplicate之一,如需要使用Aggregate模型,由于Agg模型需要设置非聚合列的聚合函数,系统无法预知。 可先选择Unique和Duplicate任意一种,待到DDL生成之后,手动在DDL之上进行修改。Doris 支持三种数据模型:
- Aggregate
- Unique
- Duplicate
副本数
类型: 整型数字
必须: 是
默认值: 1
说明:
设置Doris create table脚本中的副本数目:
CREATE TABLE `test`
(
`id` VARCHAR(96) NOT NULL,
)
ENGINE=olap
UNIQUE KEY(`id`)
PROPERTIES("replication_num" = "1" )
分桶数
类型: 整型数字
必须: 是
默认值: 10
说明:
表Bucket的作用主要有以下几点:
- 数据分布:Bucket可以帮助数据在集群中更均匀地分布,提高数据的可靠性和容错性。
- 加快数据查询速度:通过对数据进行分桶,查询时可以只扫描涉及的Bucket,减少扫描的数据量,从而加快查询速度。
- 数据归档:Bucket可以用于数据的归档管理,将不再更新的数据移动到较为冷的Bucket中。
- 数据安全:Bucket也可以用于数据备份,一般会有多个Bucket副本以防止数据丢失。
创建带Bucket的表的示例SQL语句如下:
CREATE TABLE `test`
(
`id` VARCHAR(96) NOT NULL,
)
ENGINE=olap
UNIQUE KEY(`id`)
BUCKETS 16
PROPERTIES("replication_num" = "1" )
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.OdpsAutoCreateTable
显示名: on
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.OracleAutoCreateTable
显示名: on
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.paimon.datax.utils.PaimonAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.paimon.datax.utils.PaimonAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.PostgreSQLAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.PostgreSQLAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.SqlServerAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.SqlServerAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.starrocks.StarRocksAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.starrocks.StarRocksAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
副本数
类型: 整型数字
必须: 是
默认值: 1
说明:
设置Doris create table脚本中的副本数目:
CREATE TABLE `test`
(
`id` VARCHAR(96) NOT NULL,
)
ENGINE=olap
UNIQUE KEY(`id`)
PROPERTIES("replication_num" = "1" )
分桶数
类型: 整型数字
必须: 是
默认值: 10
说明:
表Bucket的作用主要有以下几点:
- 数据分布:Bucket可以帮助数据在集群中更均匀地分布,提高数据的可靠性和容错性。
- 加快数据查询速度:通过对数据进行分桶,查询时可以只扫描涉及的Bucket,减少扫描的数据量,从而加快查询速度。
- 数据归档:Bucket可以用于数据的归档管理,将不再更新的数据移动到较为冷的Bucket中。
- 数据安全:Bucket也可以用于数据备份,一般会有多个Bucket副本以防止数据丢失。
创建带Bucket的表的示例SQL语句如下:
CREATE TABLE `test`
(
`id` VARCHAR(96) NOT NULL,
)
ENGINE=olap
UNIQUE KEY(`id`)
BUCKETS 16
PROPERTIES("replication_num" = "1" )
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.KingBaseMySQLModeAutoCreateTable
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.KingBaseMySQLModeAutoCreateTable
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.MySQLAutoCreateTable
显示名: on
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.HiveAutoCreateTable
显示名: on
费用: 😄
社区版(免费)配置项说明:
添加列注释
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 在建表DDL上添加列注释,需要依赖源端表列是否定义注释,如源端列上没有列注释,则目标端建表列DDL上也没有列注释
别名前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 统一为目标表添加前缀,例如在构建分层数仓用于为ods层目标表统一添加前缀,例如:
ods_erp_
com.qlangtech.tis.plugin.datax.common.AutoCreateTableColCommentSwitch
🔐com.qlangtech.tis.plugin.datax.common.impl.AutoCreateTableColCommentSwitchON
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.common.impl.AutoCreateTableColCommentSwitchON
提供者: TIS
费用: 🔐
社区协作
com.qlangtech.tis.config.authtoken.UserToken
com.qlangtech.tis.config.authtoken.impl.KerberosUserToken
显示名: kerberos
全路径名: com.qlangtech.tis.config.authtoken.impl.KerberosUserToken
费用: 😄
社区版(免费)配置项说明:
kerberos
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 开启kerberos客户端认证
com.qlangtech.tis.plugin.datax.transformer.impl.joiner.TargetRowsCache
com.qlangtech.tis.plugin.datax.transformer.impl.joiner.cache.TargetRowsCacheFull
显示名: on(Full Preload)
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.joiner.cache.TargetRowsCacheFull
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
最大行数
- 类型: 整型数字
- 必须: 是
- 默认值: 100000
- 说明: 全量预加载维度表时允许加载的最大行数。当维度表实际行数超过该阈值时会报错,需要切换为 LRU 缓存模式。取值范围 1 ~ 2,000,000。
com.qlangtech.tis.plugin.datax.transformer.impl.joiner.cache.TargetRowsCacheOff
显示名: off
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.joiner.cache.TargetRowsCacheOff
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
com.qlangtech.tis.plugin.datax.transformer.impl.joiner.cache.TargetRowsCacheOn
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.joiner.cache.TargetRowsCacheOn
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
最大缓存数
类型: 整型数字
必须: 是
默认值: 5000
说明:
Specifies the maximum number of entries the cache may contain. Note that the cache may evict an entry before this limit is exceeded or temporarily exceed the threshold while evicting. As the cache size grows close to the maximum, the cache evicts entries that are less likely to be used again. For example, the cache may evict an entry because it hasn't been used recently or very often.
写入后过期
类型: 时间跨度
必须: 是
默认值: 120
说明:
缓存项创建后的过期时间 Specifies that each entry should be automatically removed from the cache once a fixed duration has elapsed after the entry's creation, or the most recent replacement of its value.
访问后过期
类型: 时间跨度
必须: 是
默认值: 120
说明:
缓存项最后访问后的过期时间 Specifies that each entry should be automatically removed from the cache once a fixed duration has elapsed after the entry's creation, the most recent replacement of its value, or its last access. Access time is reset by all cache read and write operations, but not by operations on the collection-views .
com.qlangtech.plugins.incr.flink.launch.RestartStrategyFactory
🔐com.qlangtech.plugins.incr.flink.launch.restart.ExponentialDelay
显示名: exponential-delay
全路径名: com.qlangtech.plugins.incr.flink.launch.restart.ExponentialDelay
费用: 🔐
社区协作配置项说明:
initialBackoff
类型: 整型数字
必须: 是
默认值: 1
说明:
Starting duration between restarts if
restart-strategy.typehas been set toexponential-delay. It can be specified using notation: "1 min", "20 s"单位:
秒
maxBackoff
类型: 整型数字
必须: 是
默认值: 60
说明:
The highest possible duration between restarts if
restart-strategy.typehas been set toexponential-delay. It can be specified using notation: "1 min", "20 s"单位:
秒
backoffMultiplier
类型: 单行文本
必须: 是
默认值: 1.5
说明:
Backoff value is multiplied by this value after every failure,until max backoff is reached if
restart-strategy.typehas been set toexponential-delay.
resetBackoffThreshold
类型: 整型数字
必须: 是
默认值: 3600
说明:
Threshold when the backoff is reset to its initial value if
restart-strategy.typehas been set toexponential-delay. It specifies how long the job must be running without failure to reset the exponentially increasing backoff to its initial value. It can be specified using notation: "1 min", "20 s"单位:
秒
jitter
类型: 单行文本
必须: 是
默认值: 0.1
说明:
Jitter specified as a portion of the backoff if
restart-strategy.typehas been set toexponential-delay. It represents how large random value will be added or subtracted to the backoff. Useful when you want to avoid restarting multiple jobs at the same time.
🔐com.qlangtech.plugins.incr.flink.launch.restart.FailureRate
显示名: failure-rate
全路径名: com.qlangtech.plugins.incr.flink.launch.restart.FailureRate
费用: 🔐
社区协作配置项说明:
maxFailures
类型: 整型数字
必须: 是
默认值: 1
说明:
Maximum number of restarts in given time interval before failing a job if
restart-strategy.typehas been set tofailure-rate.
failureRateInterval
类型: 整型数字
必须: 是
默认值: 60
说明:
Time interval for measuring failure rate if
restart-strategy.typehas been set tofailure-rate. It can be specified using notation: "1 min", "20 s"单位:
秒
failureRateDelay
类型: 整型数字
必须: 是
默认值: 1
说明:
Delay between two consecutive restart attempts if
restart-strategy.typehas been set tofailure-rate. It can be specified using notation: "1 min", "20 s"单位:
秒
🔐com.qlangtech.plugins.incr.flink.launch.restart.FixedDelay
显示名: fixed-delay
全路径名: com.qlangtech.plugins.incr.flink.launch.restart.FixedDelay
费用: 🔐
社区协作配置项说明:
attempts
类型: 整型数字
必须: 是
默认值: 1
说明:
The number of times that Flink retries the execution before the job is declared as failed if
restart-strategy.typehas been set tofixed-delay.
delay
类型: 整型数字
必须: 是
默认值: 1
说明:
Delay between two consecutive restart attempts if
restart-strategy.typehas been set tofixed-delay. Delaying the retries can be helpful when the program interacts with external systems where for example connections or pending transactions should reach a timeout before re-execution is attempted. It can be specified using notation: "1 min", "20 s"单位:
秒
com.qlangtech.plugins.incr.flink.launch.restart.OFF
显示名: off
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.format.guesstype.GuessFieldType
com.qlangtech.tis.plugin.datax.format.guesstype.GuessOff
显示名: off
全路径名: com.qlangtech.tis.plugin.datax.format.guesstype.GuessOff
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.format.guesstype.GuessOn
显示名: on
全路径名: com.qlangtech.tis.plugin.datax.format.guesstype.GuessOn
费用: 😄
社区版(免费)配置项说明:
扫描行数
- 类型: 整型数字
- 必须: 是
- 默认值: 20000
- 说明: 会遍历该项设定设定值,指定的行数,以判断列类型
com.qlangtech.tis.plugin.trigger.JobTrigger
🔐com.qlangtech.tis.plugin.trigger.impl.PartialJobsTrigger
显示名: PartialTables
全路径名: com.qlangtech.tis.plugin.trigger.impl.PartialJobsTrigger
费用: 🔐
社区协作配置项说明:
Tables
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 需要同步的表
com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaProtocol
com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaPlaintext
显示名: PLAINTEXT
全路径名: com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaPlaintext
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaSaslPlaintext
显示名: SASL_PLAINTEXT
全路径名: com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaSaslPlaintext
费用: 😄
社区版(免费)配置项说明:
SASL Mechanism
- 类型: 单行文本
- 必须: 是
- 默认值: PLAIN
- 说明: SASL mechanism used for client connections. This may be any mechanism for which a security provider is available.
SASL JAAS Config
- 类型: 单行文本
- 必须: 是
- 默认值:
- 说明: JAAS login context parameters for SASL connections in the format used by JAAS configuration files.
com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaSaslSsl
显示名: SASL_SSL
全路径名: com.qlangtech.tis.plugins.datax.kafka.writer.protocol.KafkaSaslSsl
费用: 😄
社区版(免费)配置项说明:
SASL Mechanism
- 类型: 单选
- 必须: 是
- 默认值: GSSAPI
- 说明: SASL mechanism used for client connections. This may be any mechanism for which a security provider is available.
SASL JAAS Config
- 类型: 单行文本
- 必须: 是
- 默认值:
- 说明: JAAS login context parameters for SASL connections in the format used by JAAS configuration files.
com.qlangtech.tis.plugin.paimon.catalog.PaimonCatalog
com.qlangtech.tis.plugin.paimon.catalog.FileSystemCatalog
显示名: FileSystem
全路径名: com.qlangtech.tis.plugin.paimon.catalog.FileSystemCatalog
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 在文件系统中创建的Paimon数据库名称,用于组织和管理表结构。需符合数据库命名规范(字母、数字、下划线)
fsName
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:Hadoop hdfs文件系统namenode节点地址。格式:hdfs://ip:端口;例如:hdfs://127.0.0.1:9000
commit.user-prefix
类型: 单行文本
必须: 是
默认值: admin
说明:
Specifies the commit user prefix.
在 Paimon 中的作用是标识提交操作的来源,虽然看似可以配置任意值,但它在分布式环境中对运维监控至关重要。 以下是详细解析:
- 核心作用:提交者身份标识
- 分布式环境追踪,在 Flink 集群中,不同 TaskManager 上的写入任务会产生各自的提交记录。通过前缀可快速区分
Lock
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: Enable Catalog Lock.
Cache
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: Controls whether the catalog will cache databases, tables, manifests and partitions.
com.qlangtech.tis.plugin.paimon.catalog.HiveCatalog
显示名: Hive
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
hiveserver2
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
fsName
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:Hadoop hdfs文件系统namenode节点地址。格式:hdfs://ip:端口;例如:hdfs://127.0.0.1:9000
commit.user-prefix
类型: 单行文本
必须: 是
默认值: admin
说明:
Specifies the commit user prefix.
在 Paimon 中的作用是标识提交操作的来源,虽然看似可以配置任意值,但它在分布式环境中对运维监控至关重要。 以下是详细解析:
- 核心作用:提交者身份标识
- 分布式环境追踪,在 Flink 集群中,不同 TaskManager 上的写入任务会产生各自的提交记录。通过前缀可快速区分
Lock
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: Enable Catalog Lock.
Cache
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: Controls whether the catalog will cache databases, tables, manifests and partitions.
com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeBinding
com.qlangtech.tis.plugin.ontology.impl.objtype.DataSourceBinding
显示名: DataSource Bound
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.DataSourceBinding
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
数据源
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 对象绑定的目标数据源
目标表
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 选择目标表作为绑定对象,请先选择‘数据源’
com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeNoneBindingDataSource
显示名: Unbound
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeNoneBindingDataSource
提供者: TIS
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.chunjun.poll.Polling
com.qlangtech.tis.plugins.incr.flink.chunjun.poll.RunInterval
显示名: RunInterval
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.poll.RunInterval
费用: 😄
社区版(免费)配置项说明:
incrColumn
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 增量字段,可以是对应的增量字段名
轮询间隔
- 类型: 整型数字
- 必须: 是
- 默认值: 5000
- 说明: 轮询间隔时间,从数据库中拉取数据的间隔时间,默认为5000毫秒
useMaxFunc
类型: 单选
必须: 是
默认值: true
说明:
描述:用于标记是否保存endLocation位置的一条或多条数据,true:不保存,false(默认):保存, 某些情况下可能出现最后几条数据被重复记录的情况,可以将此参数配置为true
useMaxFunc的使用场景 考虑可能存在这样的场景:某一次增量同步后的endLocation为x,在下一次增量同步作业启动的间隙中,表内又写入了增量键的值=x的数据。按照默认的情况,假设增量键为id,下一次作业会拼接例如SELECT id,name,age FROM table WHERE id > x。此时在间隙中插入的id=x的数据将会丢失。
为了对应上述场景,chunjun增量同步提供了配置项useMaxFunc(默认值为false)。在设置useMaxFunc=true时,chunjun会在增量作业启动时获取当前数据库中增量键的最大值作为本次作业的endLocation,并且将用于startLocation的运算符号从'>'改为'>='。例如:
某一次增量启动时上次作业的endLocation为10,id最大值为100,那么将会拼接SQL语句 SELECT id,name,age FROM table WHERE id >= 10 AND id < 100 下一次增量作业启动时id的最大值为200,那么将会拼接SQL语句 SELECT id,name,age FROM table WHERE id >=100 AND id < 200
起始位点
类型: 单行文本
必须: 是
默认值: Latest
说明:
Chunjun 增量消费启动起始位点支持三种模式:
Latest:Initial:Designated:
com.qlangtech.tis.plugin.ds.oracle.Authorized
com.qlangtech.tis.plugin.ds.oracle.auth.AcceptAuthorized
显示名: on
全路径名: com.qlangtech.tis.plugin.ds.oracle.auth.AcceptAuthorized
费用: 😄
社区版(免费)配置项说明:
Schema
类型: 单行文本
必须: 是
默认值: 无
说明:
可以只包含某一个模式(Schema)下的表,Oracle模式对象schema的介绍
可以不填,但当选中的表在多个授权Schema中出现时,TIS会报异常
去除保留Schema
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 过滤掉系统保留Schema,如:"ANONYMOUS", "APEX_030200", "APEX_PUBLIC_USER", "APPQOSSYS", "BI", "CTXSYS", "DBSNMP", "DIP", "EXFSYS", "FLOWS_FILES", "HR", "IX"等
com.qlangtech.tis.config.hive.meta.PartitionFilter
com.qlangtech.tis.hive.reader.impl.DefaultPartitionFilter
显示名: on
全路径名: com.qlangtech.tis.hive.reader.impl.DefaultPartitionFilter
费用: 😄
社区版(免费)配置项说明:
ptFilter
类型: 单行文本
必须: 是
默认值: com.qlangtech.tis.hive.reader.impl.DefaultPartitionFilter.getPtDftVal()
说明:
每次触发全量读取会使用输入项目的表达式对所有分区进行匹配,默认值为
pt=latest,假设系统中存在两个分区路径:1. pt=20231111121159 , 2. pt=20231211121159很明显
pt=20231211121159为最新分区,会作为目标分区进行读取。用户也可以在输入框中输入
pt=’20231211121159‘强制指定特定分区作为目标分区进行读取。也可以在输入项目中使用过滤条件进行匹配,例如:pt=’20231211121159‘ and pmod='0'
路径格式
类型: 单行文本
必须: 是
默认值: WithoutPtKeys
说明:
支持两种分区路径格式:
WithoutPtKeys: 分区路径上不包含分区字段名,如:/user/hive/warehouse/sales_data/2023/1WithPtKeys:(默认值) 分区路径上包含分区字段名,如:/user/hive/warehouse/sales_data/year=2023/month=1
com.qlangtech.tis.hive.reader.impl.NonePartition
显示名: off
费用: 😄
社区版(免费)
com.qlangtech.tis.hive.PartitionPathPattern
com.qlangtech.tis.hive.reader.impl.PartitionPathPatternWithPtKeys
显示名: WithPtKeys
全路径名: com.qlangtech.tis.hive.reader.impl.PartitionPathPatternWithPtKeys
费用: 😄
社区版(免费)
com.qlangtech.tis.hive.reader.impl.PartitionPathPatternWithoutPtKeys
显示名: WithoutPtKeys
全路径名: com.qlangtech.tis.hive.reader.impl.PartitionPathPatternWithoutPtKeys
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.chatbi.config.RetrievalConfig
com.qlangtech.tis.plugin.ontology.chatbi.config.RetrievalConfig
显示名: Retrieval Config
全路径名: com.qlangtech.tis.plugin.ontology.chatbi.config.RetrievalConfig
费用: 😄
社区版(免费)配置项说明:
Top-K 种子数
- 类型: 整型数字
- 必须: 是
- 默认值: 5
- 说明: 每个向量索引各取的入口节点数。增大可提高召回率但增加 token 消耗。推荐范围:3-10
最大扩展跳数
- 类型: 整型数字
- 必须: 是
- 默认值: 2
- 说明: 沿 LINKED_TO 关系扩展的最大跳数。0=不扩展,1-3 合理,>3 易导致结果爆炸
Token 预算
- 类型: 整型数字
- 必须: 是
- 默认值: 3000
- 说明: 序列化 prompt 的 token 上限(按 4 chars ≈ 1 token 估算)。推荐范围:2000-5000
包含取值示例
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 是否在 prompt 中带上 Enum 等取值示例。true 提高准确性但增加 token 消耗
com.qlangtech.tis.plugin.ds.DataSourceFactory
com.qlangtech.tis.plugin.ds.clickhouse.ClickHouseDataSourceFactory
显示名: ClickHouse
全路径名: com.qlangtech.tis.plugin.ds.clickhouse.ClickHouseDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
host
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 服务器节点连接地址,可以为IP或者域名
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 8123
- 说明: 无
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.datax.dameng.ds.DaMengDataSourceFactory
显示名: DaMeng
全路径名: com.qlangtech.tis.plugin.datax.dameng.ds.DaMengDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
分库分表
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 无
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 5236
- 说明: 无
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ds.doris.DorisSourceFactory
显示名: Doris
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
host
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 目标数据库的 JDBC 连接信息,用于执行preSql及postSql
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 9030
- 说明: 无
Catalog
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: Doris Catalog 配置,默认使用内置 catalog;如需通过 Doris 访问 Paimon 等外部 catalog 的外表,请选择自定义并填写目标 catalog 名称
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: Doris表的数据库名称
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: Doris数据库的用户名
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: Doris数据库的密码
loadUrl
类型: 富文本
必须: 是
默认值: []
说明:
Doris FE的地址用于Streamload,可以为多个fe地址,fe_ip:fe_http_port 样例:
["172.28.17.100:8030", "172.28.17.100:8030"]
com.qlangtech.tis.plugin.ds.kingbase.KingBaseDataSourceFactory
显示名: KingBase-V9x
全路径名: com.qlangtech.tis.plugin.ds.kingbase.KingBaseDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
host
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 服务器节点连接地址,可以为IP或者域名
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 4321
- 说明: 无
schema
- 类型: 单行文本
- 必须: 是
- 默认值: public
- 说明: Specify the schema (or several schema separated by commas) to be set in the search-path. This schema will be used to resolve unqualified object names used in statements over this connection.
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
兼容数据库
- 类型: 单行文本
- 必须: 是
- 默认值: Postgres
- 说明: 无
读写分离
类型: 单行文本
必须: 是
默认值: off
说明:
支持批量数据同步过程中从从节点读取数据,KingBase详细说明文档
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
编码
- 类型: 单选
- 必须: 是
- 默认值: utf8
- 说明: 数据数据
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.datax.MariaDBDataSourceFactory
显示名: MariaDB
全路径名: com.qlangtech.tis.plugin.datax.MariaDBDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
分库分表
类型: 单行文本
必须: 是
默认值: off
说明:
数据库中使用分表策略:
off:不启用分表策略on: 启用分表策略。每张分表数据结构需要保证相同,且有规则的后缀作为物理表的分区规则,逻辑层面视为同一张表。如逻辑表order对应的物理分表为:order_01,order_02,order_03,order_04
注意:若用户未提及分表、多节点、表后缀等关键词,默认选择 id = 'off'
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 3306
- 说明: 无
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
传输压缩
类型: 单选
必须: 是
默认值: true
说明:
与服务端通信时采用zlib进行压缩,效果请参考https://blog.csdn.net/Shadow_Light/article/details/100749537
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ds.mangodb.MangoDBDataSourceFactory
显示名: MongoDB
全路径名: com.qlangtech.tis.plugin.ds.mangodb.MangoDBDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
address
- 类型: 富文本
- 必须: 是
- 默认值: host:27017[;host:27017]
- 说明: MongoDB的数据地址信息,因为MonogDB可能是个集群,则ip端口信息需要以Json数组的形式给出,可填写多个每个address中间可用';'分隔【必填】
dbName
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: MongoDB 数据库名称
授权机制
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.ds.mangodb.MangoDBDataSourceFactory.dftAuthMechanism()
- 说明: the authentication mechanism
username
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: MongoDB的用户名。【选填】
password
- 类型: 密码
- 必须: 否
- 默认值: 无
- 说明: MongoDB的密码。【选填】
userSource
- 类型: 单行文本
- 必须: 是
- 默认值: admin
- 说明: 保存用户的库
预读记录数
- 类型: 整型数字
- 必须: 是
- 默认值: 500
- 说明: 预先读取MongoDB中一定数量的记录,通过反射的方式分析出各字段类型,可以简化MongoDB Schema定义
com.qlangtech.tis.plugin.datax.odps.OdpsDataSourceFactory
显示名: AliyunODPS
全路径名: com.qlangtech.tis.plugin.datax.odps.OdpsDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
odpsServer
类型: 单行文本
必须: 是
默认值: 无
说明:
描述:ODPS的server地址,例如,线上地址为 http://service.odps.aliyun.com/api
tunnelServer
类型: 单行文本
必须: 是
默认值: 无
说明:
ODPS的tunnelserver地址,例如,线上地址为 http://dt.odps.aliyun.com
project
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 描述:ODPS表所属的project,注意:Project只能是字母+数字组合,请填写英文名称。在云端等用户看到的ODPS项目中文名只是显示名,请务必填写底层真实地Project英文标识名。
useProjectTimeZone
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 是否使用MaxCompute项目空间的时区
authToken
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ds.oracle.OracleDataSourceFactory
显示名: Oracle
全路径名: com.qlangtech.tis.plugin.ds.oracle.OracleDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
服务节点
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 服务器节点连接地址,可以为IP或者域名
连接方式
类型: 单行文本
必须: 是
默认值: SID
说明:
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 1521
- 说明: 无
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: system
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
包含授权
类型: 单行文本
必须: 是
默认值: on
说明:
Oracle系统会向用户授权其他用户名下的表
如选择
on可以包含系统授权的其他用户名下的表如选择
off则只包含用户名下的表
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
com.qlangtech.tis.plugin.ds.postgresql.PGDataSourceFactory
显示名: PostgreSQL
全路径名: com.qlangtech.tis.plugin.ds.postgresql.PGDataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
host
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 服务器节点连接地址,可以为IP或者域名
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 5432
- 说明: 无
schema
- 类型: 单行文本
- 必须: 是
- 默认值: public
- 说明: Specify the schema (or several schema separated by commas) to be set in the search-path. This schema will be used to resolve unqualified object names used in statements over this connection.
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
编码
- 类型: 单选
- 必须: 是
- 默认值: utf8
- 说明: 数据数据
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ds.sqlserver.SqlServer2008DatasourceFactory
显示名: SqlServer-2008
全路径名: com.qlangtech.tis.plugin.ds.sqlserver.SqlServer2008DatasourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
分库分表
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 无
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 1433
- 说明: 无
schema
- 类型: 单行文本
- 必须: 是
- 默认值: dbo
- 说明: Specify the schema (or several schema separated by commas) to be set in the search-path. This schema will be used to resolve unqualified object names used in statements over this connection.
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
🔐com.qlangtech.tis.plugin.ds.sqlserver.SqlServer2019DatasourceFactory
显示名: SqlServer-2019
全路径名: com.qlangtech.tis.plugin.ds.sqlserver.SqlServer2019DatasourceFactory
提供者: TIS
费用: 🔐
社区协作配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
分库分表
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 无
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 1433
- 说明: 无
schema
- 类型: 单行文本
- 必须: 是
- 默认值: dbo
- 说明: Specify the schema (or several schema separated by commas) to be set in the search-path. This schema will be used to resolve unqualified object names used in statements over this connection.
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
useSSL
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 支持加密传输
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ds.starrocks.StarRocksSourceFactory
显示名: StarRocks
全路径名: com.qlangtech.tis.plugin.ds.starrocks.StarRocksSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
host
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 目标数据库的 JDBC 连接信息,用于执行preSql及postSql
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 9030
- 说明: 无
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: Doris表的数据库名称
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: Doris数据库的用户名
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: StarRocks数据库的密码
loadUrl
类型: 富文本
必须: 是
默认值: []
说明:
Doris FE的地址用于Streamload,可以为多个fe地址,fe_ip:fe_http_port 样例:
["172.28.17.100:8030", "172.28.17.100:8030"]
com.qlangtech.tis.plugin.ds.mysql.MySQLV5DataSourceFactory
显示名: MySQL-V5
全路径名: com.qlangtech.tis.plugin.ds.mysql.MySQLV5DataSourceFactory
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
分库分表
类型: 单行文本
必须: 是
默认值: off
说明:
数据库中使用分表策略:
off:不启用分表策略on: 启用分表策略。每张分表数据结构需要保证相同,且有规则的后缀作为物理表的分区规则,逻辑层面视为同一张表。如逻辑表order对应的物理分表为:order_01,order_02,order_03,order_04
注意:若用户未提及分表、多节点、表后缀等关键词,默认选择 id = 'off'
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 3306
- 说明: 无
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
传输压缩
类型: 单选
必须: 是
默认值: true
说明:
与服务端通信时采用zlib进行压缩,效果请参考https://blog.csdn.net/Shadow_Light/article/details/100749537
编码
- 类型: 单选
- 必须: 是
- 默认值: utf8
- 说明: 数据数据
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
🔐com.qlangtech.tis.plugin.ds.mysql.MySQLV8DataSourceFactory
显示名: MySQL-V8
全路径名: com.qlangtech.tis.plugin.ds.mysql.MySQLV8DataSourceFactory
提供者: TIS
费用: 🔐
社区协作配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
分库分表
类型: 单行文本
必须: 是
默认值: off
说明:
数据库中使用分表策略:
off:不启用分表策略on: 启用分表策略。每张分表数据结构需要保证相同,且有规则的后缀作为物理表的分区规则,逻辑层面视为同一张表。如逻辑表order对应的物理分表为:order_01,order_02,order_03,order_04
注意:若用户未提及分表、多节点、表后缀等关键词,默认选择 id = 'off'
端口
- 类型: 整型数字
- 必须: 是
- 默认值: 3306
- 说明: 无
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据库名,创建JDBC实例时用
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: root
- 说明: 无
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 无
所在时区
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 设置服务端所在时区,有两种输入方式:1. default 从下拉框中选择,2. customize:用户手动输入时区编码
传输压缩
类型: 单选
必须: 是
默认值: true
说明:
与服务端通信时采用zlib进行压缩,效果请参考https://blog.csdn.net/Shadow_Light/article/details/100749537
编码
- 类型: 单选
- 必须: 是
- 默认值: utf8
- 说明: 数据数据
附加参数
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.hive.Hiveserver2DataSourceFactory
显示名: Hiveserver2
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例ID
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 数据源实例名称,请起一个有意义且唯一的名称
metaData
类型: 单行文本
必须: 是
默认值: HiveMeta
说明:
是Hive Metastore服务,其核心作用是管理Hive的元数据(Metadata)。
Hive Metastore 的作用
元数据存储:
- 存储所有Hive表、分区、列、数据类型、存储位置(如HDFS路径)等元数据信息。
- 记录表的创建时间、所有者、权限等管理信息。
元数据共享:
- 允许多个Hive实例(或计算引擎如Spark、Impala)共享同一份元数据,避免重复定义表结构。
- 例如:Spark可以直接通过Hive Metastore读取表结构,无需重新定义表。
解耦元数据与计算:
- Metastore服务独立于HiveServer2,使得元数据管理(9083端口)与查询执行(10000端口)分离,提高系统灵活性和可维护性。
支持多种后端存储:
- 默认使用关系型数据库(如MySQL、PostgreSQL)持久化元数据(而非HDFS),确保元数据的高效查询和事务支持。
HMS
类型: 单行文本
必须: 是
默认值: HMS
说明:
是HiveServer2(HS2)的默认服务,其核心作用是为远程客户端提供与Hive交互,允许远程查询执行:
- 允许客户端(如JDBC、ODBC、Beeline等)通过TCP/IP远程提交HiveQL查询(如SELECT、JOIN等),而无需直接访问Hadoop集群节点。
- 将HiveQL转换为底层计算任务(如MapReduce、Tez、Spark)并提交到集群执行。
AliasOfSubPath
类型: 单行文本
必须: 否
默认值: 无
说明:
假设当前数据库名称为
dezhou,有一张名称为test001的表,默认hdfs上的路径为:hdfs://10.8.0.10:9000/user/hive/warehouse/dezhou/test001而用户的应用场景需要为:
hdfs://10.8.0.10:9000/user/hive/warehouse/dezhou.db/test001此时需要设置此属性为:
$1.db,当然也可以直接设置为:dezhou.db(只不过当dbName变化,此属性不会随之变化)
数据库名
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: Hive 数据库使用的库名,请在执行任务前先创建完成
com.qlangtech.tis.plugin.ontology.chatbi.config.ExecutionConfig
com.qlangtech.tis.plugin.ontology.chatbi.config.ExecutionConfig
显示名: Execution Config
全路径名: com.qlangtech.tis.plugin.ontology.chatbi.config.ExecutionConfig
费用: 😄
社区版(免费)配置项说明:
执行查询
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 是否执行生成的 SQL。false 则只生成不执行,适合调试和验证 SQL 生成效果
最大结果行数
- 类型: 整型数字
- 必须: 是
- 默认值: 200
- 说明: 最大返回结果行数,防止结果集过大导致前端 OOM。推荐范围:100-1000
查询超时(秒)
- 类型: 时间跨度
- 必须: 是
- 默认值: 30
- 说明: SQL 查询超时时间(秒)。防止慢查询长时间占用资源。推荐范围:10-60
com.qlangtech.tis.plugin.ontology.impl.aggregation.AggregationKind
com.qlangtech.tis.plugin.ontology.impl.aggregation.ApproxCardinalityAgg
显示名: Approximate cardinality
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.ApproxCardinalityAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.aggregation.AverageAgg
显示名: Average
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.AverageAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.aggregation.CollectListAgg
显示名: Collect list
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.CollectListAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
limit
- 类型: 整型数字
- 必须: 否
com.qlangtech.tis.plugin.ontology.impl.aggregation.CollectSetAgg
显示名: Collect set
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.CollectSetAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
limit
- 类型: 整型数字
- 必须: 否
com.qlangtech.tis.plugin.ontology.impl.aggregation.CountAgg
显示名: Count
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.CountAgg
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.impl.aggregation.CountDistinctAgg
显示名: Exact cardinality
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.CountDistinctAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.aggregation.MaxAgg
显示名: Maximum
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.MaxAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.aggregation.MinAgg
显示名: Minimum
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.MinAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.aggregation.SumAgg
显示名: Sum
全路径名: com.qlangtech.tis.plugin.ontology.impl.aggregation.SumAgg
费用: 😄
社区版(免费)配置项说明:
目标属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.datax.impl.DataxWriter
com.qlangtech.tis.plugin.datax.DataXClickhouseWriter
显示名: ClickHouse
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
batchByteSize
- 类型: 整型数字
- 必须: 是
- 默认值: 13421772
- 说明: 无
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
在开始执行DataX任务前,自动在目标数据库中创建表,目标表Engine类型为'CollapsingMergeTree' 构建原理请参考MySQL到ClickHouse实时同步
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 2048
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXClickhouseWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.dameng.writer.DataXDaMengWriter
显示名: DaMeng
全路径名: com.qlangtech.tis.plugin.datax.dameng.writer.DataXDaMengWriter
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.dameng.writer.DataXDaMengWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXDFSWriter
显示名: TDFS
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
资源
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: DFS服务端连接配置
添加元数据
类型: 单行文本
必须: 是
默认值: on
说明:
写数据过程中会在
DFS目录中写一份source的元数据。当其他环境中需要使用TIS来导入DFS中的数据时,可以利用这份元数据快速生成目标端的数据表结构,省去手动配置元数据的流程。
替换规则
类型: 单选
必须: 是
默认值: truncate
说明:
FtpWriter写入前数据清理处理模式:
- truncate: 写入前清理目录下一fileName前缀的所有文件。
- append: 写入前不做任何处理,DFS Writer直接使用filename写入,并保证文件名不冲突。
- nonConflict: 如果目录下有fileName前缀的文件,直接报错。
fileFormat
类型: 单行文本
必须: 是
默认值: TEXT
说明:
文件写出的格式,包括csv 和text两种,csv是严格的csv格式,如果待写数据包括列分隔符,则会按照csv的转义语法转义,转义符号为双引号。text格式是用列分隔符简单分割待写数据,对于待写数据包括列分隔符情况下不做转义。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXDFSWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.doris.DataXDorisWriter
显示名: Doris
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
loadProps
类型: 富文本
必须: 是
默认值: com.qlangtech.tis.plugin.datax.doris.DataXDorisWriter.getDftLoadProps()
说明:
StreamLoad 的请求参数,默认传入的数据均会被转为字符串,并以 \t 作为列分隔符,\n 作为行分隔符,组成csv文件进行 StreamLoad导入参数说明。 如需更改列分隔符, 则正确配置 loadProps 即可:
{
"column_separator": "\\x01",
"line_delimiter": "\\x02"
}
maxBatchRows
类型: 整型数字
必须: 否
默认值: 10000
说明:
- 描述:单次StreamLoad导入的最大行数
- 必选:否
- 默认值:10000 (1W)
maxBatchSize
类型: 整型数字
必须: 否
默认值: 104857600
说明:
- 描述:单次StreamLoad导入的最大字节数。
- 必选:否
- 默认值:104857600 (100M)
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.doris.DataXDorisWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXElasticsearchWriter
显示名: Elasticsearch
全路径名: com.qlangtech.tis.plugin.datax.DataXElasticsearchWriter
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
endpoint
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: ElasticSearch的连接地址
index
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@3051e476
- 说明: Elasticsearch中的index名
cleanup
- 类型: 单选
- 必须: 否
- 默认值: false
- 说明: 是否删除原表
batchSize
- 类型: 单行文本
- 必须: 否
- 默认值: 1000
- 说明: 每次批量数据的条数
trySize
- 类型: 单行文本
- 必须: 否
- 默认值: 1
- 说明: 失败后重试的次数
timeout
- 类型: 单行文本
- 必须: 否
- 默认值: 600000
- 说明: 客户端超时时间
discovery
- 类型: 单选
- 必须: 否
- 默认值: false
- 说明: 启用节点发现将(轮询)并定期更新客户机中的服务器列表
compression
- 类型: 单选
- 必须: 否
- 默认值: true
- 说明: http请求,开启压缩
multiThread
- 类型: 单选
- 必须: 否
- 默认值: true
- 说明: http请求,是否有多线程
忽略错误
- 类型: 单选
- 必须: 否
- 默认值: false
- 说明: 忽略写入错误,不重试,继续写入
ignoreParseError
- 类型: 单选
- 必须: 否
- 默认值: true
- 说明: 忽略解析数据格式错误,继续写入
alias
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 数据导入完成后写入别名
aliasMode
- 类型: 单选
- 必须: 否
- 默认值: append
- 说明: 数据导入完成后增加别名的模式,append(增加模式), exclusive(只留这一个)
settings
类型: 富文本
必须: 否
默认值: {"index" :{"number_of_shards": 1, "number_of_replicas": 0}}
说明:
创建index时候的settings, 与elasticsearch官方相同,详细配置请参考:index-modules-settings
splitter
- 类型: 单行文本
- 必须: 否
- 默认值: ,
- 说明: 如果插入数据是array,就使用指定分隔符
dynamic
- 类型: 单选
- 必须: 否
- 默认值: false
- 说明: 不使用datax的mappings,使用es自己的自动mappings
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXElasticsearchWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugins.datax.kafka.writer.DataXKafkaWriter
显示名: Kafka
全路径名: com.qlangtech.tis.plugins.datax.kafka.writer.DataXKafkaWriter
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
Bootstrap Servers
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: A list of host/port pairs to use for establishing the initial connection to the Kafka cluster. The client will make use of all servers irrespective of which servers are specified here for bootstrapping—this list only impacts the initial hosts used to discover the full set of servers. This list should be in the form
host1:port1,host2:port2,.... Since these servers are just used for the initial connection to discover the full cluster membership (which may change dynamically), this list need not contain the full set of servers (you may want more than one, though, in case a server is down).
Topic
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: Topic pattern in which the records will be sent. '{stream}' to send the message to a specific topic based on these values. Notice that the topic name will be transformed to a standard naming convention.
Test Topic
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: Topic to test if can produce messages.
Delivery Timeout
- 类型: 整型数字
- 必须: 是
- 默认值: 120000
- 说明: An upper bound on the time to report success or failure after a call to 'send()' returns.
Protocol
- 类型: 单行文本
- 必须: 是
- 默认值: PLAINTEXT
- 说明: Protocol used to communicate with brokers.
ACKs
类型: 单选
必须: 是
默认值: 1
说明:
The number of acknowledgments the producer requires the leader to have received before considering a request complete. This controls the durability of records that are sent.
all: 这意味着leader需要等待所有备份都成功写入日志,这种策略会保证只要有一个备份存活就不会丢失数据。这是最强的保证
Compression Type
- 类型: 单选
- 必须: 是
- 默认值: none
- 说明: The compression type for all data generated by the producer.
Send Buffer bytes
- 类型: 整型数字
- 必须: 是
- 默认值: 131072
- 说明: The size of the TCP send buffer (SO_SNDBUF) to use when sending data. If the value is -1, the OS default will be used.
Client DNS Lookup
- 类型: 单选
- 必须: 是
- 默认值: use_all_dns_ips
- 说明: Controls how the client uses DNS lookups. If set to use_all_dns_ips, connect to each returned IP address in sequence until a successful connection is established. After a disconnection, the next IP is used. Once all IPs have been used once, the client resolves the IP(s) from the hostname again. If set to resolve_canonical_bootstrap_servers_only, resolve each bootstrap address into a list of canonical names. After the bootstrap phase, this behaves the same as use_all_dns_ips. If set to default (deprecated), attempt to connect to the first IP address returned by the lookup, even if the lookup returns multiple IP addresses.
Request Timeout
- 类型: 整型数字
- 必须: 是
- 默认值: 30000
- 说明: The configuration controls the maximum amount of time the client will wait for the response of a request. If the response is not received before the timeout elapses the client will resend the request if necessary or fail the request if retries are exhausted.
Batch Size
类型: 整型数字
必须: 是
默认值: 16384
说明:
The producer will attempt to batch records together into fewer requests whenever multiple records are being sent to the same partition.
控制发送者在发布到kafka之前等待批处理的字节数。满足batch.size和ling.ms之一,producer便开始发送消息
Linger ms
- 类型: 单行文本
- 必须: 是
- 默认值: 0
- 说明: The producer groups together any records that arrive in between request transmissions into a single batched request.
Client ID
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: An ID string to pass to the server when making requests. The purpose of this is to be able to track the source of requests beyond just ip/port by allowing a logical application name to be included in server-side request logging.
Max Request Size
- 类型: 整型数字
- 必须: 是
- 默认值: 1048576
- 说明: The maximum size of a request in bytes.
Enable Idempotence
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: When set to 'true', the producer will ensure that exactly one copy of each message is written in the stream. If 'false', producer retries due to broker failures, etc., may write duplicates of the retried message in the stream.
Max in Flight Requests per Connection
- 类型: 整型数字
- 必须: 是
- 默认值: 5
- 说明: The maximum number of unacknowledged requests the client will send on a single connection before blocking. Can be greater than 1, and the maximum value supported with idempotency is 5.
Retries
- 类型: 整型数字
- 必须: 是
- 默认值: 100
- 说明: Setting a value greater than zero will cause the client to resend any record whose send fails with a potentially transient error.
Socket Connection Setup Timeout
- 类型: 单行文本
- 必须: 是
- 默认值: 10000
- 说明: The amount of time the client will wait for the socket connection to be established.
Socket Connection Setup Max Timeout
- 类型: 单行文本
- 必须: 是
- 默认值: 30000
- 说明: The maximum amount of time the client will wait for the socket connection to be established. The connection setup timeout will increase exponentially for each consecutive connection failure up to this maximum.
Buffer Memory
- 类型: 单行文本
- 必须: 是
- 默认值: 33554432
- 说明: The total bytes of memory the producer can use to buffer records waiting to be sent to the server.
Max Block ms
- 类型: 单行文本
- 必须: 是
- 默认值: 60000
- 说明: The configuration controls how long the KafkaProducer's send(), partitionsFor(), initTransactions(), sendOffsetsToTransaction(), commitTransaction() and abortTransaction() methods will block.
Sync Producer
- 类型: 单选
- 必须: 否
- 默认值: false
- 说明: Wait synchronously until the record has been sent to Kafka.
Receive Buffer bytes
- 类型: 整型数字
- 必须: 是
- 默认值: 32768
- 说明: The size of the TCP receive buffer (SO_RCVBUF) to use when reading data. If the value is -1, the OS default will be used.
com.qlangtech.tis.plugin.datax.kingbase.DataXKingBaseWriter
显示名: KingBase
全路径名: com.qlangtech.tis.plugin.datax.kingbase.DataXKingBaseWriter
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXPostgresqlWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXMariaWriter
显示名: MariaDB
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
writeMode
类型: 单选
必须: 是
默认值: replace
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
session
类型: 富文本
必须: 否
默认值: 无
说明:
DataX在获取Mysql连接时,执行session指定的SQL语句,修改当前connection session属性
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataxMySQLWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXMongodbWriter
显示名: MongoDB
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXMongodbWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXOdpsWriter
显示名: Aliyun-ODPS
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
truncate
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 描述:ODPSWriter通过配置"truncate": true,保证写入的幂等性,即当出现写入失败再次运行时,ODPSWriter将清理前述数据,并导入新数据,这样可以保证每次重跑之后的数据都保持一致。
生命周期
类型: 整型数字
必须: 是
默认值: 3
说明:
表的生命周期,仅支持正整数。单位:天
非分区表:自最后一次修改表数据开始计算,经过days天后数据无改动,则您无需干预此表,MaxCompute会自动回收(类似drop table操作)。分区表:系统根据各分区的LastModifiedTime判断是否需要回收分区。不同于非分区表,分区表的最后一个分区被回收后,该表不会被删除。生命周期只能设定到表级别,不支持在分区级别设置生命周期。
partitionFormat
- 类型: 单选
- 必须: 是
- 默认值: yyyyMMddHHmmss
- 说明: 每进行一次DataX导入在Hive表中会生成一个新的分区,现在系统分区名称为'pt'格式为开始导入数据的时间戳,格式为'yyyyMMddHHmmss'或者'yyyyMMdd'
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXOdpsWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXOracleWriter
显示名: Oracle
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
session
类型: 富文本
必须: 否
默认值: 无
说明:
DataX在获取Mysql连接时,执行session指定的SQL语句,修改当前connection session属性
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXOracleWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.paimon.datax.DataxPaimonWriter
显示名: Paimon
全路径名: com.qlangtech.tis.plugin.paimon.datax.DataxPaimonWriter
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
Catalog
- 类型: 单行文本
- 必须: 是
- 默认值: Hive
- 说明: 无
writeBuffer
类型: 单行文本
必须: 是
默认值: default
说明:
在 Apache Paimon 中,控制底层(特别是 Level 0)小文件大小的核心参数直接影响着 Compaction 的触发频率。通过适当增加单个文件中存储的记录条数(或文件大小),确实可以有效减少 L0 层小文件的数量,从而降低 Compaction 被触发的频率。
以下是控制 L0 层小文件大小和记录数的关键参数及其工作原理:
🧩 1. 核心控制参数:
write-buffer-size和target-file-sizewrite-buffer-size(默认值: 128mb):作用: 这是控制内存中 Buffer 大小的参数。当 Flink 或 Spark 任务向 Paimon 写入数据时,数据首先会缓存在内存中的一个排序缓冲区(Sorter Buffer)中。
原理: 当一个 Buffer 被填满(达到
write-buffer-size)时,它会被排序并刷写(Spill)到磁盘,形成一个 L0 文件。影响:
write-buffer-size直接决定了单个 L0 文件的最小期望大小。如果你期望每个 L0 文件大约是 256MB,那么就应该设置write-buffer-size=256mb。Buffer 满了就刷写,自然就生成了一个 ~256MB 的文件。target-file-size(默认值: 128mb):作用: 这是 Paimon 最终期望生成的稳定数据文件(通常是经过 Compaction 合并到更高层级的文件)的目标大小。
原理: 在 Compaction 过程中(无论是 Universal 还是 Size-Tiered),Paimon 会尝试将输入的小文件合并,并输出大小接近
target-file-size的文件到更高的层级(如 L1, L2)。影响 L0 的间接方式: 虽然
target-file-size主要影响 Compaction 的输出,但它间接影响 L0 文件的“合并潜力”。如果target-file-size设置得很大(比如 1GB),那么 Compaction 需要积累更多的 L0 小文件(累计大小达到 ~1GB)才会触发合并操作。这相当于放宽了触发 Compaction 的“累计大小”阈值。注意:
target-file-size不直接控制单个 L0 文件的大小。L0 文件大小主要由write-buffer-size和 Checkpointing 决定。
🧩 2. 其他影响 L0 文件大小和记录数的因素
Checkpointing / Commit Interval (Flink Streaming):
在 Flink 流式写入场景下,Flink 的 Checkpoint 间隔是决定 L0 文件大小和数量的最关键因素之一。
原理: Paimon 的 Sink 算子通常会在 Flink Checkpoint 时执行
snapshotState。为了确保精确一次的语义,当前内存 Buffer 中的数据(即使未达到write-buffer-size)也会在 Checkpoint 时强制刷写到磁盘,生成一个 L0 文件。影响: 如果 Flink 的 Checkpoint 间隔(
checkpoint.interval)很短(例如 10 秒),即使write-buffer-size设置为 256MB,也可能因为每个 Checkpoint 只积累了少量数据(比如 50MB)就被强制刷出,从而导致产生大量远小于write-buffer-size的 L0 小文件。结论:要减少 L0 小文件数量,在流式写入场景下,适当增加 Flink Checkpoint 间隔 (
checkpoint.interval) 是至关重要的,让 Buffer 有更多时间积累接近write-buffer-size的数据量再刷出。但需权衡故障恢复时间(RTO)。sort-spill-threshold(默认值: 未明确设置,通常内部管理):这个参数控制内存排序缓冲区在内存中最多能容纳多少行数据。当行数超过此阈值时,即使 Buffer 的内存占用未达到
write-buffer-size,也可能触发部分数据溢写(Spill)。这主要用于防止 OOM。影响: 如果记录非常大(例如宽表、大 JSON 对象),即使记录数不多,也可能快速占满内存 Buffer (
write-buffer-size) 而刷写。如果记录非常小(例如计数器更新),则sort-spill-threshold可能先达到,导致按记录数刷写。调整sort-spill-threshold主要应对特殊数据分布场景,一般优先调整write-buffer-size和 Checkpoint 间隔。
✅ 如何通过增加文件大小/记录数减少 Compaction 频率
- 增大
write-buffer-size:
- 这是最直接有效的方法。例如,从默认的
128mb增加到256mb或512mb。 - 效果: 每个 L0 文件平均变大(更接近新设置的 buffer size),L0 层积累到触发 Compaction 阈值(如 Universal 的
num-sorted-run.stop-trigger)所需的文件数量变少,从而降低触发频率。 - 注意: 需要确保 TaskManager 有足够的 JVM Heap 或 Managed Memory 来容纳更大的 Buffer。否则可能导致 OOM 或频繁 GC。
- 增大 Flink Checkpoint 间隔 (
checkpoint.interval):
- 对于流式写入,这是避免超小 L0 文件的关键。根据业务容忍的延迟和恢复时间,尽可能增加间隔(例如从 30s 增加到 1min 或 5min)。
- 效果: 显著减少因频繁 Checkpoint 强制刷写产生的远小于
write-buffer-size的微型 L0 文件数量。让大多数 L0 文件大小接近write-buffer-size。
- 增大
target-file-size:
- 例如从
128mb增加到256mb或512mb。 - 效果: 主要在 Universal Compaction 中影响较大。因为 Universal 在合并时会尽量将一组文件合并成一个接近
target-file-size的大文件。增大target-file-size意味着 Compaction 需要积累更多的 L0 文件(总数据量更大)才会触发合并。对于 Size-Tiered,它定义了更高层级文件的大小目标,也间接影响合并策略。 - 注意: 过大的
target-file-size可能影响查询效率(读取大文件可能慢)和 Compaction 本身的资源消耗(合并更大量数据)。
- 调整 Compaction 触发阈值 (如 Universal 的
num-sorted-run.stop-trigger):
- 虽然不是直接控制文件大小,但配合增大文件大小,调整这个阈值效果更好。例如,如果文件平均大了 2 倍,那么将
num-sorted-run.stop-trigger从默认的 5 增加到 8 或 10,可能仍然能保持或延长触发间隔,同时允许 L0 积累更多文件(但总数据量更大),进一步提升读性能。 - 效果: 直接放宽了触发 Compaction 的条件,让 L0 层可以堆积更多的文件(但每个文件更大了)才触发合并。
⚠️ 总结与权衡
- 核心策略: 增大
write-buffer-size并适当增大 Flink Checkpoint 间隔 是减少 L0 小文件数量、从而降低 Compaction 频率的最有效手段。这直接让每个 L0 文件包含更多记录/更大体积。 - 辅助策略: 增大
target-file-size和/或 Compaction 触发阈值(如num-sorted-run.stop-trigger)可以进一步减少 Compaction 频率,因为它们提高了触发合并所需的“数据量”或“文件数”门槛。 - 重要权衡:
- 内存资源: 增大
write-buffer-size会增加每个 Writer Task 的内存需求。 - 故障恢复: 增大 Flink Checkpoint 间隔会增加故障恢复时需要重放的数据量(RTO 可能变长)。
- 读取延迟: 过大的 L0 文件或过少的 Compaction 可能导致查询(尤其是点查)需要扫描更多的 L0 文件,增加读取延迟。需要监控读性能。
- 空间放大: 减少 Compaction 频率可能导致短时间内存在更多冗余数据(旧版本数据、删除标记等),增加存储空间占用(空间放大)。需要配合合理的快照过期策略。
建议: 从调整
write-buffer-size(如 256MB) 和 Flinkcheckpoint.interval(如 1-5分钟) 开始,观察 L0 文件平均大小是否显著增大、Compaction 频率是否下降。再根据效果和资源/延迟情况,考虑是否调整target-file-size或 Compaction 触发参数。务必监控集群资源(内存、CPU)、Compaction 耗时、查询延迟和存储空间变化。📊
file.format
类型: 单选
必须: 是
默认值: parquet
说明:
Specify the message format of data files, currently orc, parquet and avro are supported.
tableBucket
类型: 单行文本
必须: 是
默认值: Dynamic
说明:
bucket参数定义了表数据的存储分桶策略,这是 Paimon 的核心设计之一。不同值对应完全不同的存储和写入模式:🪣 三种 Bucket 模式详解
模式 值 特点 适用场景 固定桶模式(Fixed) >0 固定数量的桶,桶数不可变 数据分布均匀的静态表 动态桶模式(Dynamic) -1 桶数量自动扩展/收缩,根据数据量调整 数据量变化大的通用场景(推荐) 延迟桶模式(Postpone) -2 写入时不立即分桶,先存临时文件,Compaction 时才分桶 超高吞吐写入的 Append-Only 表
writeMode
类型: 单行文本
必须: 是
默认值: Stream
说明:
Paimon 的写入模式(
write-mode)是影响数据写入行为的关键配置,batch和stream两种模式在底层实现、数据可见性和适用场景上有本质区别:🔄 核心区别对比
特性 Batch 模式 Stream 模式 设计目标 高吞吐批量处理 低延迟实时处理 数据可见性 批次完成后可见 实时可见 提交机制 显式提交(如 Flink Checkpoint) 自动增量提交 文件生成 大文件(MB-GB级) 小文件(KB-MB级) 写入延迟 秒级~分钟级 毫秒级~秒级 典型数据源 Hive/离线数仓 Kafka/CDC 流 压缩效率 高(大文件易压缩) 低(需额外小文件合并) 元数据开销 低(单个提交点) 高(频繁生成提交点) Exactly-Once 保证 依赖批处理框架 原生支持 🚀 适用场景
✅ Batch 模式最佳场景
- 离线数仓同步
- 每日全量同步 Hive 表:
write-mode=batch
- 每日全量同步 Hive 表:
- 大规模历史数据回填
- 初始化 TB 级历史数据
- 资源敏感型环境
- 机械硬盘集群(减少 IOPS 压力)
- OLAP 分析优化
✅ Stream 模式最佳场景
- 实时 CDC 管道
- 低延迟监控看板
- 实时订单看板(要求 5s 内可见)
- 事件驱动型应用
- 用户行为实时分析(点击流处理)
- 渐进式更新场景
- 离线数仓同步
自动建表
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 无
changelog
类型: 单行文本
必须: 是
默认值: off
说明:
changelog-producer的作用核心功能
- 生成变更日志:将底层存储文件的物理更新(如覆盖写入)转换为逻辑变更事件(
+I/-U/+U/-D)。 - 支持流式消费:让 Flink 等引擎能像读 Kafka 一样增量读取 Paimon 表的变更(类似
SELECT * FROM table /*+ OPTIONS('scan.mode'='incremental') */)。
- 生成变更日志:将底层存储文件的物理更新(如覆盖写入)转换为逻辑变更事件(
为何需要它?
- 湖仓痛点:传统湖存储(如 Parquet)只存最终状态,缺少 "行级变更记录",无法支持增量计算。
- 流读需求:Flink CDC 等场景需要实时捕获
INSERT/UPDATE/DELETE事件。
compaction
类型: 单行文本
必须: 是
默认值: default
说明:
Apache Paimon 的 Compaction(压缩)机制是其核心功能之一,尤其在基于 LSM-Tree(Log-Structured Merge-Tree)架构的表格式中至关重要。它主要负责解决由频繁数据写入(尤其是流式写入)带来的小文件问题、读放大问题,并优化数据组织以提升查询性能。
Apache Paimon 的 Compaction 机制是其保证高性能、低延迟查询,尤其是处理高频更新/删除和流式写入场景的基石。它通过智能地合并小文件、清理过期数据、按主键排序数据,有效解决了 LSM-Tree 架构带来的挑战。Universal Compaction 策略因其对流式写入的友好性和易用性,成为 Paimon 的默认和推荐选项。理解并合理配置 Compaction 策略和参数,对于在生产环境中高效稳定地使用 Paimon 至关重要。
snapshot
类型: 单行文本
必须: 是
默认值: default
说明:
Apache Paimon 的 Snapshot(快照)机制 是其实现多版本并发控制(MVCC)、时间旅行查询(Time Travel)、增量计算和数据一致性的核心基础。它借鉴了 Iceberg 等现代数据表格式的设计思想,为存储在 Paimon 表中的数据提供了原子性、一致性、隔离性和持久性(ACID)的保证,特别适用于流批一体和实时更新的场景。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.paimon.datax.DataxPaimonWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXPostgresqlWriter
显示名: PostgreSQL
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXPostgresqlWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXSqlserverWriter
显示名: SqlServer
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXSqlserverWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.starrocks.DataXStarRocksWriter
显示名: StarRocks
全路径名: com.qlangtech.tis.plugin.datax.starrocks.DataXStarRocksWriter
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
loadProps
类型: 富文本
必须: 是
默认值: com.qlangtech.tis.plugin.datax.starrocks.DataXStarRocksWriter.getDftLoadProps()
说明:
StreamLoad 的请求参数,默认传入的数据均会被转为字符串,并以 \t 作为列分隔符,\n 作为行分隔符,组成csv文件进行 StreamLoad导入参数说明。 如需更改列分隔符, 则正确配置 loadProps 即可:
{
"column_separator": "\\x01",
"row_delimiter": "\\x02"
}
maxBatchRows
类型: 整型数字
必须: 否
默认值: 10000
说明:
- 描述:单次StreamLoad导入的最大行数
- 必选:否
- 默认值:10000 (1W)
maxBatchSize
类型: 整型数字
必须: 否
默认值: 104857600
说明:
- 描述:单次StreamLoad导入的最大字节数。
- 必选:否
- 默认值:104857600 (100M)
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.starrocks.DataXStarRocksWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataxMySQLWriter
显示名: MySQL
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
目标数据库
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
writeMode
类型: 单选
必须: 是
默认值: replace
说明:
控制写入数据到目标表采用
insert into或者replace into或者ON DUPLICATE KEY UPDATE语句
preSql
类型: 富文本
必须: 否
默认值: 无
说明:
描述:写入数据到目的表前,会先执行这里的标准语句。如果 Sql 中有你需要操作到的表名称,请使用
@table表示,这样在实际执行 Sql 语句时,会对变量按照实际表名称进行替换。比如你的任务是要写入到目的端的100个同构分表(表名称为:datax_00,datax01, ... datax_98,datax_99),并且你希望导入数据前,先对表中数据进行删除操作,那么你可以这样配置:"preSql":["delete from 表名"],效果是:在执行到每个表写入数据前,会先执行对应的 delete from 对应表名称
postSql
类型: 富文本
必须: 否
默认值: 无
说明:
写入数据到目的表后,会执行这里的标准语句。(原理同 preSql )
session
类型: 富文本
必须: 否
默认值: 无
说明:
DataX在获取Mysql连接时,执行session指定的SQL语句,修改当前connection session属性
自动建表
类型: 单行文本
必须: 是
默认值: on
说明:
解析Reader的元数据,自动生成Writer create table DDL语句,有三种选择:
off:关闭自动生成及同步目标端建表DDL语句,当目标端表实例已经存在可选择此选项。default:打开动生成及自动执行目标端建表DDL语句,执行任务状态由程序自动控制毋需人为干涉。customized:用户可自定义设置自动执行目标端建表DDL语句逻辑,如:是否需要生成列注释等。
batchSize
类型: 整型数字
必须: 否
默认值: 1000
说明:
- 描述:一次性批量提交的记录数大小,该值可以极大减少DataX与Mysql的网络交互次数,并提升整体吞吐量。但是该值设置过大可能会造成DataX运行进程OOM情况。
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataxMySQLWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
com.qlangtech.tis.plugin.datax.DataXHiveWriter
显示名: Hive
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
hiveserver2
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
fsName
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:Hadoop hdfs文件系统namenode节点地址。格式:hdfs://ip:端口;例如:hdfs://127.0.0.1:9000
分区保留数
类型: 整型数字
必须: 是
默认值: 2
说明:
每进行一次DataX导入在Hive表中会生成一个新的分区,现在系统分区名称为
pt格式为开始导入数据的时间戳
分区时间戳格式
类型: 单选
必须: 是
默认值: yyyyMMddHHmmss
说明:
每进行一次DataX导入在Hive表中会生成一个新的分区,现在系统分区名称为'pt'格式为开始导入数据的当前时间戳,格式为
yyyyMMddHHmmss或者yyyyMMdd
自动建表
- 类型: 单选
- 必须: 是
- 默认值: on
- 说明: 解析Reader的元数据,自动生成Writer create table DDL语句
fileType
- 类型: 单行文本
- 必须: 是
- 默认值: TEXT
- 说明: 描述:文件的类型,目前只支持用户配置为"text"
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXHiveWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
writeMode
类型: 单选
必须: 是
默认值: append
说明:
hdfswriter写入前数据清理处理模式:
- append: 写入前不做任何处理,DataX hdfswriter直接使用filename写入,并保证文件名不冲突,
- nonConflict:如果目录下有fileName前缀的文件,直接报错
encoding
- 类型: 单选
- 必须: 否
- 默认值: utf-8
- 说明: 描述:写文件的编码配置。
com.qlangtech.tis.plugin.datax.DataXSparkWriter
显示名: Spark
提供者: DataX
费用: 😄
社区版(免费)配置项说明:
hiveserver2
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
fsName
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 描述:Hadoop hdfs文件系统namenode节点地址。格式:hdfs://ip:端口;例如:hdfs://127.0.0.1:9000
分区保留数
类型: 整型数字
必须: 是
默认值: 2
说明:
每进行一次DataX导入在Hive表中会生成一个新的分区,现在系统分区名称为
pt格式为开始导入数据的时间戳
分区时间戳格式
类型: 单选
必须: 是
默认值: yyyyMMddHHmmss
说明:
每进行一次DataX导入在Hive表中会生成一个新的分区,现在系统分区名称为'pt'格式为开始导入数据的当前时间戳,格式为
yyyyMMddHHmmss或者yyyyMMdd
自动建表
- 类型: 单选
- 必须: 是
- 默认值: on
- 说明: 解析Reader的元数据,自动生成Writer create table DDL语句
fileType
- 类型: 单行文本
- 必须: 是
- 默认值: TEXT
- 说明: 描述:文件的类型,目前只支持用户配置为"text"
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.datax.DataXHiveWriter.getDftTemplate()
- 说明: 无特殊情况请不要修改模版内容,避免不必要的错误
writeMode
类型: 单选
必须: 是
默认值: append
说明:
hdfswriter写入前数据清理处理模式:
- append: 写入前不做任何处理,DataX hdfswriter直接使用filename写入,并保证文件名不冲突,
- nonConflict:如果目录下有fileName前缀的文件,直接报错
encoding
- 类型: 单选
- 必须: 否
- 默认值: utf-8
- 说明: 描述:写文件的编码配置。
com.qlangtech.tis.plugin.paimon.datax.PaimonPartition
com.qlangtech.tis.plugin.paimon.datax.pt.OffPaimonPartition
显示名: off
全路径名: com.qlangtech.tis.plugin.paimon.datax.pt.OffPaimonPartition
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.datax.pt.OnPaimonPartition
显示名: on
全路径名: com.qlangtech.tis.plugin.paimon.datax.pt.OnPaimonPartition
费用: 😄
社区版(免费)配置项说明:
分区字段
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.config.spark.SparkConnStrategy
com.qlangtech.tis.config.spark.impl.StandaloneConnStrategy
显示名: Standalone
全路径名: com.qlangtech.tis.config.spark.impl.StandaloneConnStrategy
费用: 😄
社区版(免费)配置项说明:
master
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.config.spark.impl.YarnConnStrategy
显示名: Yarn
费用: 😄
社区版(免费)配置项说明:
yarnSite
类型: 富文本
必须: 是
默认值: com.qlangtech.tis.config.spark.impl.YarnConnStrategy.dftYarnSiteContent()
说明:
<?xml version="1.0"?>
<configuration>
<!-- Site specific YARN configuration properties -->
<!--RM的主机名 -->
<property>
<name>yarn.resourcemanager.hostname</name>
<value>192.168.28.200</value>
</property>
<!--RM对客户端暴露的地址,客户端通过该地址向RM提交应用程序、杀死应用程序等-->
<property>
<name>yarn.resourcemanager.address</name>
<value>${yarn.resourcemanager.hostname}:8032</value>
</property>
<!--RM对AM暴露的访问地址,AM通过该地址向RM申请资源、释放资源等-->
<property>
<name>yarn.resourcemanager.scheduler.address</name>
<value>${yarn.resourcemanager.hostname}:8030</value>
</property>
<!--RM对外暴露的web http地址,用户可通过该地址在浏览器中查看集群信息-->
<property>
<name>yarn.resourcemanager.webapp.address</name>
<value>${yarn.resourcemanager.hostname}:8088</value>
</property>
<!--RM对NM暴露地址,NM通过该地址向RM汇报心跳、领取任务等-->
<property>
<name>yarn.resourcemanager.resource-tracker.address</name>
<value>${yarn.resourcemanager.hostname}:8031</value>
</property>
<!--RM对管理员暴露的访问地址,管理员通过该地址向RM发送管理命令等-->
<property>
<name>yarn.resourcemanager.admin.address</name>
<value>${yarn.resourcemanager.hostname}:8033</value>
</property>
</configuration>
com.qlangtech.tis.plugin.paimon.datax.bucket.PaimonBucketKeys
com.qlangtech.tis.plugin.paimon.datax.bucket.impl.PaimonBucketKeysOFF
显示名: off
全路径名: com.qlangtech.tis.plugin.paimon.datax.bucket.impl.PaimonBucketKeysOFF
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.datax.bucket.impl.PaimonBucketKeysON
显示名: on
全路径名: com.qlangtech.tis.plugin.paimon.datax.bucket.impl.PaimonBucketKeysON
费用: 😄
社区版(免费)配置项说明:
bucket-key
类型: 单选
必须: 是
默认值: 无
说明:
Specify the paimon distribution policy. Data is assigned to each bucket according to the hash value of bucket-key.
If you specify multiple fields, delimiter is ','.
If not specified, the primary key will be used; if there is no primary key, the full row will be used.
com.qlangtech.tis.extension.OneStepOfMultiSteps
com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep1
显示名: 第一步
全路径名: com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep1
费用: 😄
社区版(免费)配置项说明:
大模型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 用于推断本体的LLM接口
目标对象(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 选择需要大模型分析的目标对象
com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep2Execute
显示名: 第三步
全路径名: com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep2Execute
费用: 😄
社区版(免费)配置项说明:
推理结果
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep2Prompt
显示名: 第二步
全路径名: com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep2Prompt
费用: 😄
社区版(免费)配置项说明:
Value Type 提示词
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.ontology.impl.infer.OntologyResourceInferenceConfig.valueType.getPrompt()
- 说明: 用于LLM推理使用生成Value Type提示词,可按照需要修改
Glossary(同义词)提示词
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.ontology.impl.infer.OntologyResourceInferenceConfig.glossary.getPrompt()
- 说明: 用于LLM推理使用生成Glossary提示词,可按照需要修改
Shared Property 提示词
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.ontology.impl.infer.OntologyResourceInferenceConfig.sharedPropertyConfig.getPrompt()
- 说明: 用于LLM推理使用生成Shared Property提示词,可按照需要修改
com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep3Execute
显示名: 第五步
全路径名: com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep3Execute
费用: 😄
社区版(免费)配置项说明:
推理结果
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep3Prompt
显示名: 第四步
全路径名: com.qlangtech.tis.plugin.ontology.impl.infer.InferOntologyFromLLMStep3Prompt
费用: 😄
社区版(免费)配置项说明:
Link Type提示词
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.ontology.impl.infer.OntologyResourceInferenceConfig.linkerType.getPrompt()
- 说明: 用于LLM推理使用生成Link Type提示词,可按照需要修改
com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeBackingObjectType
显示名: 第二步
全路径名: com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeBackingObjectType
费用: 😄
社区版(免费)配置项说明:
左对象
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
右对象
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
连接对象
- 类型: 单行文本
- 必须: 是
- 默认值: Join Reference
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeJoinTableDataset
显示名: 第二步
全路径名: com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeJoinTableDataset
费用: 😄
社区版(免费)配置项说明:
左对象
- 类型: 单行文本
- 必须: 是
- 默认值: Reference
- 说明: 无
右对象
- 类型: 单行文本
- 必须: 是
- 默认值: Reference
- 说明: 无
连接表
- 类型: 单行文本
- 必须: 是
- 默认值: Join Reference
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeObjectTypeForeignKeys
显示名: 第二步
全路径名: com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeObjectTypeForeignKeys
费用: 😄
社区版(免费)配置项说明:
左对象(事实表)
- 类型: 单行文本
- 必须: 是
- 默认值: Reference
- 说明: 对应事实表实例,Cardinality对应:1 or N
映射基数(Cardinality)
- 类型: 单选
- 必须: 是
- 默认值: MANY_ONE
- 说明: 左对象(事实表)中的实例对应到右对象(维度表)实体中实例的数量映射规则
右对象(维度表)
- 类型: 单行文本
- 必须: 是
- 默认值: Reference
- 说明: 对应维度表实例,Cardinality对应1
com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeSetter
显示名: 第一步
全路径名: com.qlangtech.tis.plugin.ontology.impl.linker.RelationshipTypeSetter
费用: 😄
社区版(免费)配置项说明:
关系类型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeProfile
显示名: 第一步
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeProfile
费用: 😄
社区版(免费)配置项说明:
对象名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 本体对象类型的名称
资源绑定
- 类型: 单行文本
- 必须: 是
- 默认值: Unbound
- 说明: 无
别名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 对象的业务别名
描述
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 对象的业务描述信息
com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeProperties
显示名: 第二步
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypeProperties
费用: 😄
社区版(免费)配置项说明:
属性(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypePropertiesRelevant
显示名: 第三步
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.ObjectTypePropertiesRelevant
费用: 😄
社区版(免费)配置项说明:
主键设置
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 无
标题键
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 标题键(Title Key)用于展示本体对象实例的可读名称。选择后,该属性将作为对象的显示标题,在列表和详情页面中作为主要展示字段使用。
com.qlangtech.tis.plugin.ontology.impl.valuetype.ConstraintsOfValueType
显示名: 第二步
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.ConstraintsOfValueType
费用: 😄
社区版(免费)配置项说明:
约束规则
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.valuetype.MetadataOfValueType
显示名: 第一步
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.MetadataOfValueType
费用: 😄
社区版(免费)配置项说明:
类型名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 值类型的唯一标识名称
描述
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 值类型的详细说明
类型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSelectDataSource
显示名: 第一步
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSelectDataSource
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
数据库名
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSelectTable
显示名: 第二步
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSelectTable
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
目标表
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 选一张需要进行Joiner操作的目标表
缓存加速
- 类型: 单行文本
- 必须: 是
- 默认值: on
- 说明: 通过开启缓存,使得执行Join过程中,让外表可以在缓存中命中,避免重复在数据库中查询,从而提升数据同步效率
com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSetMatchConditionAndCols
显示名: 第三步
全路径名: com.qlangtech.tis.plugin.datax.transformer.impl.joiner.JoinerSetMatchConditionAndCols
费用: 😄
社区版(免费)插件包: tis-transformer.tpi
配置项说明:
匹配条件
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 设置主表与外表的匹配条件,如果主表在执行join过程中匹配到多条外表记录,则只取第一条
过滤条件
- 类型: 多选
- 必须: 否
- 默认值: 无
- 说明: 在JOIN时对主表或维表进行过滤,例如:A.valid='1' AND B.status='active'
前缀
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 在输出列前添加前缀,避免与主表记录名称冲突
目标列
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 从目标表记录里提取的列(s)
跳过错误
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 执行过程中如发生错误,是否直接跳过错误?
com.qlangtech.tis.plugin.paimon.datax.bucket.PaimonBucket
com.qlangtech.tis.plugin.paimon.datax.bucket.impl.DynamicPaimonBucket
显示名: Dynamic
全路径名: com.qlangtech.tis.plugin.paimon.datax.bucket.impl.DynamicPaimonBucket
费用: 😄
社区版(免费)配置项说明:
target-row-num
类型: 整型数字
必须: 是
默认值: 2000000
说明:
If the bucket is -1, for primary key table, is dynamic bucket mode, this option controls the target row number for one bucket.
initial-buckets
类型: 整型数字
必须: 否
默认值: 无
说明:
Initial buckets for a partition in assigner operator for dynamic bucket mode.
max-buckets
类型: 整型数字
必须: 否
默认值: -1
说明:
Max buckets for a partition in dynamic bucket mode, It should either be equal to -1 (unlimited), or it must be greater than 0 (fixed upper bound).
assigner-parallelism
类型: 整型数字
必须: 否
默认值: 无
说明:
Parallelism of assigner operator for dynamic bucket mode, it is related to the number of initialized bucket, too small will lead to insufficient processing speed of assigner.
com.qlangtech.tis.plugin.paimon.datax.bucket.impl.FixPaimonBucket
显示名: Fixed
全路径名: com.qlangtech.tis.plugin.paimon.datax.bucket.impl.FixPaimonBucket
费用: 😄
社区版(免费)配置项说明:
bucket
类型: 整型数字
必须: 是
默认值: 无
说明:
Bucket number for file store.
It should either be equal to -1 (dynamic bucket mode), -2 (postpone bucket mode), or it must be greater than 0 (fixed bucket mode).
com.qlangtech.tis.plugin.paimon.datax.bucket.impl.PostponePaimonBucket
显示名: Postpone
全路径名: com.qlangtech.tis.plugin.paimon.datax.bucket.impl.PostponePaimonBucket
费用: 😄
社区版(免费)
com.qlangtech.tis.config.kerberos.Krb5Res
com.qlangtech.tis.kerberos.impl.SystemPathKrb5Res
显示名: SystemPath
费用: 😄
社区版(免费)配置项说明:
path
- 类型: 单行文本
- 必须: 是
- 默认值: /etc/krb5.conf
- 说明: config file
krb5.conflocated in system path
com.qlangtech.tis.kerberos.impl.UploadKrb5Res
显示名: Upload
费用: 😄
社区版(免费)配置项说明:
- file
- 类型: 文件
- 必须: 是
com.qlangtech.tis.plugin.ontology.BasicOntologyPropertyTypeRef
com.qlangtech.tis.plugin.ontology.impl.typeref.DefaultPropertyTypeRef
显示名: Default
全路径名: com.qlangtech.tis.plugin.ontology.impl.typeref.DefaultPropertyTypeRef
费用: 😄
社区版(免费)配置项说明:
类型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
值类型
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.typeref.SharedPropertyTypeRef
显示名: Shared Property
全路径名: com.qlangtech.tis.plugin.ontology.impl.typeref.SharedPropertyTypeRef
费用: 😄
社区版(免费)配置项说明:
共享属性
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 引用已定义的共享属性
值类型
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.AuthToken
com.qlangtech.tis.plugin.aliyun.AccessKey
显示名: accessKey
费用: 😄
社区版(免费)配置项说明:
keyId
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: aliyun服务的accessId,用在私有云环境下,例如自建Elasticsearch,服务端如不需要连接凭证,则该项可为空
密码
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: aliyun服务的accessKeySecret,用在私有云环境下,例如自建Elasticsearch,服务端如不需要连接凭证,则该项可为空
com.qlangtech.tis.plugin.aliyun.NoneToken
显示名: none
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.aliyun.UsernamePassword
显示名: user
费用: 😄
社区版(免费)配置项说明:
用户名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 用在私有云环境下,例如自建Elasticsearch,服务端如不需要连接凭证,则该项可为空
密码
- 类型: 密码
- 必须: 否
- 默认值: 无
- 说明: 用在私有云环境下,例如自建Elasticsearch,服务端如不需要连接凭证,则该项可为空
com.qlangtech.tis.config.ParamsConfig
🔐com.qlangtech.tis.plugin.alert.impl.DingTalkAlertChannel
显示名: DingTalk_Chan
全路径名: com.qlangtech.tis.plugin.alert.impl.DingTalkAlertChannel
提供者: TIS
费用: 🔐
社区协作配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 实例的唯一性名称,取一个方便记忆的名称
Access Token
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 钉钉机器人的Webhook URL中的access_token参数值。创建机器人后在Webhook地址中获取
加签密钥
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 钉钉机器人的加签密钥(Secret),用于验证请求合法性。如果机器人启用了加签功能则必填
@所有人
- 类型: 单选
- 必须: 否
- 默认值: false
- 说明: 是否在消息中@所有群成员
@指定成员
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 需要@的成员手机号,多个手机号用英文逗号分隔。被@的人会收到额外的消息提醒
模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.alert.impl.DingTalkAlertChannel.loadDefaultTpl()
- 说明: 报警信息模版(velocity),请谨慎修改避免不必要的错误。可用变量: title, subject, jobName, status, startTime, endTime, duration, link, restart, restartIndex, totalRestart等
🔐com.qlangtech.tis.plugin.alert.impl.LarkAlertChannel
显示名: Lark_Chan
提供者: TIS
费用: 🔐
社区协作配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 实例的唯一性名称,取一个方便记忆的名称
Webhook URL
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 飞书群机器人的Webhook完整地址。在群设置中添加自定义机器人后获取
签名密钥
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 飞书机器人的签名密钥(Secret),用于验证请求合法性。如果机器人启用了签名验证则必填
@所有人
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 是否在消息中@所有群成员
模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.alert.impl.LarkAlertChannel.loadDefaultTpl()
- 说明: 报警信息模版(velocity),请谨慎修改避免不必要的错误。可用变量: title, subject, jobName, status, startTime, endTime, duration, link, restart, restartIndex, totalRestart等
🔐com.qlangtech.tis.plugin.alert.impl.WeComAlertChannel
显示名: WeCom_Chan
提供者: TIS
费用: 🔐
社区协作配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 实例的唯一性名称,取一个方便记忆的名称
Webhook URL
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 企业微信群机器人的Webhook完整地址。在群设置中添加机器人后获取
@成员UserID
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 需要@的成员UserID列表,多个用英文逗号分隔。使用@all可以@所有人
@成员手机号
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 需要@的成员手机号列表,多个用英文逗号分隔。仅在群内成员手机号在企业通讯录中时有效
模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.alert.impl.WeComAlertChannel.loadDefaultTpl()
- 说明: 报警信息模版(velocity),请谨慎修改避免不必要的错误。可用变量: title, subject, jobName, status, startTime, endTime, duration, link, restart, restartIndex, totalRestart等
com.qlangtech.tis.plugin.HttpEndpoint
显示名: httpToken
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
endpoint
- 类型: 单行文本
- 必须: 是
- 默认值: http://oss.aliyuncs.com
- 说明: Server的EndPoint地址,例如http://oss.aliyuncs.com
认证方式
- 类型: 单行文本
- 必须: 否
- 默认值: none
- 说明: 无
com.qlangtech.tis.plugin.aliyun.AliyunEndpoint
显示名: aliyunToken
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
endpoint
- 类型: 单行文本
- 必须: 是
- 默认值: http://oss.aliyuncs.com
- 说明: Server的EndPoint地址,例如http://oss.aliyuncs.com
认证方式
- 类型: 单行文本
- 必须: 否
- 默认值: accessKey
- 说明: 无
com.qlangtech.tis.plugin.datax.DataXGlobalConfig
显示名: DataX-global
费用: 😄
社区版(免费)配置项说明:
名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
channel
- 类型: 整型数字
- 必须: 是
- 默认值: 3
- 说明: 无
最大错误记录数
- 类型: 整型数字
- 必须: 是
- 默认值: 0
- 说明: 无
最大错误百分比
- 类型: 单行文本
- 必须: 是
- 默认值: 0.02
- 说明: 无
配置模版
- 类型: 富文本
- 必须: 是
- 默认值: com.qlangtech.tis.datax.IDataxGlobalCfg.getDefaultTemplate()
- 说明: 无
com.qlangtech.tis.plugin.datax.server.FTPServer
显示名: FTPServer
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
protocol
类型: 单选
必须: 是
默认值: ftp
说明:
SFTP 和 FTP 非常相似,都支持批量传输(一次传输多个文件),文件夹 / 目录导航,文件移动,文件夹 / 目录创建,文件删除等。但还是存在着差异,SFTP 和 FTP 之间的区别:
链接方式不同
FTP 使用 TCP 端口 21 上的控制连接建立连接。而 SFTP 是在客户端和服务器之间通过 SSH 协议 (TCP 端口 22) 建立的安全连接来传输文件。
安全性不同
SFTP 使用加密传输认证信息和传输的数据,所以使用 SFTP 相对于 FTP 是非常安全。
效率不同
SFTP 这种传输方式使用了加密解密技术,所以传输效率比普通的 FTP 要低得多。
使用的协议不同
FTP 使用 TCP / IP 协议。而,SFTP 是 SSH 协议的一部分,它是一种远程登录信息。
安全通道
FTP 不提供任何安全通道来在主机之间传输文件;而 SFTP 协议提供了一个安全通道,用于在网络上的主机之间传输文件。
host
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 描述:ftp服务器地址。
port
- 类型: 整型数字
- 必须: 是
- 默认值: 21
- 说明: 描述:ftp服务器端口。
timeout
- 类型: 整型数字
- 必须: 否
- 默认值: 60000
- 说明: 描述:连接ftp服务器连接超时时间,单位毫秒。默认值:60000(1分钟)
连接模式
类型: 单选
必须: 是
默认值: PASV
说明:
连接模式(主动模式或者被动模式)。该参数只在传输协议是标准ftp协议时使用,值只能为:PORT (主动),PASV(被动)。两种模式主要的不同是数据连接建立的不同。
对于Port模式,是客户端在本地打开一个端口等服务器去连接建立数据连接,
而Pasv模式就是服务器打开一个端口等待客户端去建立一个数据连接。
username
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 描述:ftp服务器访问用户名。
password
- 类型: 密码
- 必须: 是
- 默认值: 无
- 说明: 描述:ftp服务器访问密码。
com.qlangtech.tis.plugin.datax.elastic.ElasticEndpoint
显示名: elasticToken
全路径名: com.qlangtech.tis.plugin.datax.elastic.ElasticEndpoint
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
endpoint
- 类型: 单行文本
- 必须: 是
- 默认值: http://oss.aliyuncs.com
- 说明: Server的EndPoint地址,例如http://oss.aliyuncs.com
认证方式
- 类型: 单行文本
- 必须: 否
- 默认值: none
- 说明: 无
com.qlangtech.tis.plugin.datax.LocalDataXJobSubmitParams
显示名: DataXSubmitParams
全路径名: com.qlangtech.tis.plugin.datax.LocalDataXJobSubmitParams
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: local_submit_params
- 说明: 设置一个有意义的名称作为标识
管道任务并发数
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.datax.DataXJobSubmitParams.dftParallelism()
- 说明: 在单个管道同步过程中允许任务并发数目
单节点最大Worker数
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.datax.DataXJobSubmitParams.DEFAULT_MAX_INSTANCES_PER_NODE
- 说明: Akka集群中每个节点最多创建的TaskWorker实例数。每个实例同一时刻处理一个任务,此值控制单节点最大并发任务数
任务超时时间
- 类型: 时间跨度
- 必须: 是
- 默认值: 10
- 说明: 执行单个DataX 表任务执行超时时间。超过设置的超时时间,TIS会主动将任务关闭。单位:小时
内存规格
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: 执行DataX任务申请内存规格,默认为1024兆,如执行大表同步任务请按照实际需求量设置自定义规格
ForkJvm
类型: 单选
必须: 是
默认值: true
说明:
是否以独立JVM进程方式执行子任务。开启后,每个子任务将通过 java -classpath 命令fork一个独立的JVM进程来运行,子任务拥有独立的内存空间和类加载器,与主进程隔离。关闭时,子任务将在当前JVM进程内以线程方式执行。
建议在以下场景开启:
- 子任务内存消耗大,需要独立的JVM堆内存配置
- 子任务依赖的第三方库与主进程存在类冲突
- 需要防止子任务异常导致主进程崩溃
注意:只有在开发环境下才能设置为‘否’不然有不可预测的错误发生
集群最大Worker总数
- 类型: 整型数字
- 必须: 是
- 默认值: com.qlangtech.tis.datax.DataXJobSubmitParams.DEFAULT_MAX_TOTAL_INSTANCES
- 说明: Akka集群中所有节点的TaskWorker实例总数上限。ClusterRouterPool不会创建超过此总数的Worker实例
com.qlangtech.tis.config.spark.impl.DefaultSparkConnGetter
显示名: SparkConn
全路径名: com.qlangtech.tis.config.spark.impl.DefaultSparkConnGetter
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
连接方式
类型: 单行文本
必须: 是
默认值: 无
说明:
客户端连接Spark服务端可选择以下连接方式之一:
- Amazon EC2: scripts that let you launch a cluster on EC2 in about 5 minutes
- Standalone Deploy Mode: launch a standalone cluster quickly without a third-party cluster manager
- Mesos: deploy a private cluster using Apache Mesos
- YARN: deploy Spark on top of Hadoop NextGen (YARN)
- Kubernetes: deploy Spark on top of Kubernetes
例如,选择Standalone Deploy Mode模式模式,可设置:
spark://192.168.28.201:7077
com.qlangtech.tis.config.yarn.YarnConfig
显示名: yarn
费用: 😄
社区版(免费)配置项说明:
- name
- 类型: 单行文本
- 必须: 是
- rmAddress
- 类型: 单行文本
- 必须: 是
- schedulerAddress
- 类型: 单行文本
- 必须: 是
com.qlangtech.tis.hive.DefaultHiveConnGetter
显示名: HiveConn
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
dbName
- 类型: 单行文本
- 必须: 是
- 默认值: default
- 说明: Hive 数据库使用的库名,请在执行任务前先创建完成
metaStoreUrls
- 类型: 单行文本
- 必须: 是
hiveAddress
- 类型: 单行文本
- 必须: 是
userToken
- 类型: 单行文本
- 必须: 是
com.qlangtech.tis.config.k8s.impl.DefaultK8sContext
显示名: k8s
提供者: TIS
费用: 😄
社区版(免费)插件包: tis-k8s-plugin.tpi
配置项说明:
名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
连接地址
类型: 单行文本
必须: 是
默认值: 无
说明:
使用命令
kubectl cluster-info获取当前K8S集群的根路径.
Yaml配置内容
类型: 富文本
必须: 是
默认值: 无
说明:
为了通过CS模式连接K8S服务端可以先通过kubectl config命令生成服务端连接的证书配置文件,config命令请查看 kubectl-commands#config
执行
kubectl config view --flatten=true将得到的内容粘贴到上面输入框中TIS中有较多组件是运行在K8S容器中的,需要在TIS运行环境中安装部署K8S环境。有多种方式安装K8S环境,详细请查看
com.qlangtech.tis.kerberos.KerberosCfg
显示名: kerberos
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
principal
类型: 单行文本
必须: 是
默认值: 无
说明:
Kerberos 下的用户可以称为 Principal,缩写可以是 pric(见于一些配置文件中),由三个部分组成,分别是 primary, instance 和 realm。Kerberos principal 用于使用 Kerberos 做为安全加固的系统中,来代表一个用户唯一的身份。primary 又称为用户 user component,可以是任意的字符串或者就是操作系统下的用户名等等。
然后接着的部分叫做 instance,是用来给某个角色的用户或者服务来创建 principal 的。一个 instance,会被 "/" 和 primary 分隔。最后一个部分是 realm,概念上很像 DNS 上的 domain 域名,可以用来定义一组相似的对象,也可以说 realm 定义了一组 principals。每一个 realm 可以有私有的配置,包括 KDC 的地址和加密的算法,都可以独立存在。有些大型公司通常会创建一个独立的 realm 来分发管理员的权限。
Kerberos 给 principal 指定 ticket 票据,让他们可以访问用 Kerberos 做安全加固的 Hadoop 服务。principal 可以形如: username/fully.qualified.domain.name@YOUR_REALM.COM。username 是指原型 Hadoop 服务的 Unix 账户,例如 hdfs 或者 mapred 之类的。
而对于个人用户(指那些需要访问集群,比如 Hive Client 或者 HDFS Client 连接的这些),username 也是指 Unix 账号,例如 Tony, runzhliu 之类。只包含 primary 的 principal 也是可以接受的,例如 runzhliu@YOUR_REALM.COM。
keytabPath
类型: 文件
必须: 是
默认值: 无
说明:
Keytab 就是一个包含了(若干)principals 和一个加密了的 principal key的文件。一个 Keytab 文件每个 host 都是唯一的,因为 principal 的定义了包含了 hostname 的。这个文件可以用来认证,而不需要传递公开的密码,因为只要有这个 Keytab 就可以代表这个 principal 来操作 Hadoop 的服务。所以说 Keytab 是需要保管好的。
krb5Res
类型: 单行文本
必须: 是
默认值: SystemPath
说明:
maintains key-value pairs of Kerberos configurable constants from configuration file or from user specified system properties.
The content is path of file with default path '/etc/krb5.conf'
There are two types of input method
Upload
By upload a File that the content is compatible with '/etc/krb5.conf'
SystemPath
By reference to the path of
krb5.confwith default location of '/etc/krb5.conf'
com.qlangtech.plugins.incr.flink.common.FlinkCluster
显示名: Flink-Cluster
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
JMAddress
类型: 单行文本
必须: 是
默认值: 127.0.0.1:8081
说明:
The JobManager is serving the web interface accessible at localhost:8081
maxRetry
类型: 整型数字
必须: 是
默认值: 1
说明:
The number of retries the client will attempt if a retryable operations fails.
retryDelay
类型: 整型数字
必须: 是
默认值: 3
说明:
The time that the client waits between retries (See also
rest.retry.max-attempts).单位:
秒
com.qlangtech.plugins.incr.flink.launch.clustertype.StandaloneFlinkDeployingAIAssistSupport
显示名: Deploy Local Flink
全路径名: com.qlangtech.plugins.incr.flink.launch.clustertype.StandaloneFlinkDeployingAIAssistSupport
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: flink_standalone_deploy_ai_assist
- 说明: 无
Flink部署目录
- 类型: 单行文本
- 必须: 是
- 默认值: /opt/misc
- 说明: 设置本地Flink部署目录
插件目录
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.manage.common.Config.getDataDir().getAbsolutePath()
- 说明: 无
slot
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: 默认Standalone部署方式slot数量,TaskManager需要的内存=tmMemory * slot(请慎重设置slot数量)
tmMemory
类型: 字节规格容量
必须: 是
默认值: 1728
说明:
Total Process Memory size for the TaskExecutors. This includes all the memory that a TaskExecutor consumes, consisting of Total Flink Memory, JVM Metaspace, and JVM Overhead. On containerized setups, this should be set to the container memory. See also 'taskmanager.memory.flink.size' for total Flink memory size configuration.
单位:
mb
主机地址
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.realtime.utils.NetUtils.getHost()
- 说明: 部署flink所在的地址,需要是与TIS控制台同一个主机节点地址
Flink Port
- 类型: 整型数字
- 必须: 是
- 默认值: 8081
- 说明: Flink 暴露的的REST API Http 端口
com.qlangtech.tis.plugin.tdfs.DFSResMatcher
com.qlangtech.tis.plugin.datax.resmatcher.MetaAwareDFSResMatcher
显示名: ByMeta
全路径名: com.qlangtech.tis.plugin.datax.resmatcher.MetaAwareDFSResMatcher
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.resmatcher.WildcardDFSResMatcher
显示名: Wildcard
全路径名: com.qlangtech.tis.plugin.datax.resmatcher.WildcardDFSResMatcher
费用: 😄
社区版(免费)配置项说明:
wildcard
类型: 单行文本
必须: 是
默认值: 无
说明:
路径中可以使用统配符匹配资源目录下的所有匹配的文件资源
Checks a fileName to see if it matches the specified wildcard matcher, always testing case-sensitive.
<p>
The wildcard matcher uses the characters '?' and '*' to represent a
single or multiple (zero or more) wildcard characters.
This is the same as often found on Dos/Unix command lines.
The check is case-sensitive always.
</p>wildcardMatch("c.txt", "*.txt") --> true wildcardMatch("c.txt", "*.jpg") --> false wildcardMatch("a/b/c.txt", "a/b/*") --> true wildcardMatch("c.txt", "*.???") --> true wildcardMatch("c.txt", "*.????") --> false- N.B. the sequence "*?" does not work properly at present in match strings.
遍历层数
- 类型: 整型数字
- 必须: 是
- 默认值: 1
- 说明: 描述:允许遍历文件夹的最大层数。
com.qlangtech.tis.plugin.datax.kingbase.KingBaseDispatch
com.qlangtech.tis.plugin.datax.kingbase.dispatch.Off
显示名: off
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.kingbase.dispatch.On
显示名: on
费用: 😄
社区版(免费)配置项说明:
备机地址
类型: 富文本
必须: 是
默认值: 无
说明:
备机地址,可配置多条,按行分隔,每行一条地址,样例如下:
192.168.8.223:54321
192.168.8.130:54321
loadRate
- 类型: 整型数字
- 必须: 是
- 默认值: 0
- 说明: 主机读负载率,备机之间轮询平分,取值范围0-100,例如0表示读语句全部分发备机,100表示读语句全部发送主机
com.qlangtech.tis.plugin.datax.kafka.reader.StartOffset
com.qlangtech.tis.plugin.datax.kafka.reader.offsets.CommittedOffsets
显示名: Committed Offset
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.offsets.CommittedOffsets
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.kafka.reader.offsets.EarliestOffsets
显示名: Earliest Offset
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.offsets.EarliestOffsets
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.kafka.reader.offsets.EarliestWhenNoneCommittedOffsets
显示名: Earliest When None Committed Offset
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.offsets.EarliestWhenNoneCommittedOffsets
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.kafka.reader.offsets.LatestOffsets
显示名: Latest Offset
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.offsets.LatestOffsets
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.kafka.reader.offsets.TimestampOffsets
显示名: Timestamp Offset
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.offsets.TimestampOffsets
费用: 😄
社区版(免费)配置项说明:
- timestamp
- 类型: 日期
- 必须: 是
com.qlangtech.tis.plugin.ds.DataSourceCatalog
com.qlangtech.tis.plugin.ds.impl.CatalogDefault
显示名: default
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ds.impl.CatalogSpecific
显示名: customize
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 需要连接的 Doris catalog 名称,例如访问 Paimon 外表时填写 paimon
com.qlangtech.tis.hive.HiveMeta
com.qlangtech.tis.hive.HiveMeta
显示名: HiveMeta
费用: 😄
社区版(免费)配置项说明:
元数据地址
类型: 单行文本
必须: 是
默认值: thrift://{{hiveserver}}:9083
说明:
Hive元数据服务地址,用于获取Hive中存放的表的元数据信息
地址格式如:
thrift://{{hiveserver}}:9083
userToken
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 当选择为'on', 用户需要填写用户名和密码
com.qlangtech.tis.plugin.ontology.Ontology
com.qlangtech.tis.plugin.ontology.impl.glossary.DefaultOntologyGlossary
显示名: Glossary
全路径名: com.qlangtech.tis.plugin.ontology.impl.glossary.DefaultOntologyGlossary
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
实例名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 取一个合适的名称用以鉴别词汇的唯一性
同义词(s)
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 为术语设置同义词,用于ChatBI自然语言匹配
描述
- 类型: 富文本
- 必须: 是
- 默认值: 无
- 说明: 词汇的详细功能描述信息
指向目标
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 术语映射到的本体元素
com.qlangtech.tis.plugin.ontology.impl.linker.DefaultOntologyLinker
显示名: Link Type
全路径名: com.qlangtech.tis.plugin.ontology.impl.linker.DefaultOntologyLinker
提供者: TIS
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.impl.objtype.DefaultOntologyObjectType
显示名: ObjectType
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.DefaultOntologyObjectType
提供者: TIS
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.impl.sharedproperty.DefaultOntologySharedProperty
显示名: Shared Property
全路径名: com.qlangtech.tis.plugin.ontology.impl.sharedproperty.DefaultOntologySharedProperty
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
属性名
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 共享属性唯一标识名称
描述
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 属性的业务含义说明
别名
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 属性的对外展示别名
类型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.ontology.impl.valuetype.DefaultOntologyValueType
显示名: Value Type
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.DefaultOntologyValueType
提供者: TIS
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.catalog.CatalogLock
com.qlangtech.tis.plugin.paimon.catalog.lock.CatalogLockOFF
显示名: off
全路径名: com.qlangtech.tis.plugin.paimon.catalog.lock.CatalogLockOFF
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.catalog.lock.CatalogLockON
显示名: on
全路径名: com.qlangtech.tis.plugin.paimon.catalog.lock.CatalogLockON
费用: 😄
社区版(免费)配置项说明:
type
类型: 单选
必须: 否
默认值: 无
说明:
The Lock Type for Catalog, such as 'hive', 'zookeeper'.
check-max-sleep
类型: 时间跨度
必须: 是
默认值: 8
说明:
The maximum sleep time when retrying to check the lock.
unit:Second
acquire-timeout
类型: 时间跨度
必须: 是
默认值: 8
说明:
The maximum time to wait for acquiring the lock.
unit:Minute
com.qlangtech.tis.plugin.datax.kafka.reader.subscriptionmethod.KafkaSubscriptionMethod
com.qlangtech.tis.plugin.datax.kafka.reader.subscriptionmethod.KafkaListOfTopics
显示名: List Of Topics
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.subscriptionmethod.KafkaListOfTopics
费用: 😄
社区版(免费)配置项说明:
Topics
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: multiple topics,use common"," as separator
com.qlangtech.tis.plugin.datax.kafka.reader.subscriptionmethod.KafkaManuallyAssignAListOfPartitions
显示名: List Of Partitions
全路径名: com.qlangtech.tis.plugin.datax.kafka.reader.subscriptionmethod.KafkaManuallyAssignAListOfPartitions
费用: 😄
社区版(免费)配置项说明:
topic:partition
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.datax.kafka.reader.subscriptionmethod.KafkaSubscribeToAllTopicsMatchingSpecifiedPattern
显示名: Topics Match Specified Pattern
费用: 😄
社区版(免费)配置项说明:
Topic Pattern
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 无
com.qlangtech.tis.plugin.datax.SelectedTabExtend
com.qlangtech.tis.plugins.incr.flink.chunjun.sink.SinkTabPropsExtends
显示名: SinkTabPropsExtends
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.sink.SinkTabPropsExtends
费用: 😄
社区版(免费)配置项说明:
tabName
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@624494d4
- 说明: 无
incrMode
类型: 单选
必须: 是
默认值: Insert
说明:
控制写入数据到目标表采用 insert into 或者 replace into 或者 ON DUPLICATE KEY UPDATE 语句
com.qlangtech.tis.plugins.incr.flink.chunjun.sink.UniqueKeySetter
显示名: UniqueKeySetter
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.sink.UniqueKeySetter
费用: 😄
社区版(免费)配置项说明:
tabName
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@349996a6
- 说明: 无
com.qlangtech.tis.plugins.incr.flink.chunjun.source.SelectedTabPropsExtends
显示名: SelectedTabPropsExtends
全路径名: com.qlangtech.tis.plugins.incr.flink.chunjun.source.SelectedTabPropsExtends
费用: 😄
社区版(免费)配置项说明:
tabName
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@24731caf
- 说明: 无
轮询策略
类型: 单行文本
必须: 是
默认值: RunInterval
说明:
间隔轮询,开启后会根据pollingInterval轮询间隔时间周期性的从数据库拉取数据。开启间隔轮询还需配置参数pollingInterval,increColumn,可以选择配置参数startLocation。若不配置参数startLocation,任务启动时将会从数据库中查询增量字段最大值作为轮询的起始位置。
splitPk
类型: 单选
必须: 否
默认值: 无
说明:
描述:当speed配置中的channel大于1时指定此参数,Reader插件根据并发数和此参数指定的字段拼接sql,使每个并发读取不同的数据,提升读取速率。
注意: 推荐splitPk使用表主键,因为表主键通常情况下比较均匀,因此切分出来的分片也不容易出现数据热点。 目前splitPk仅支持整形数据切分,不支持浮点、字符串、日期等其他类型。如果用户指定其他非支持类型,ChunJun将报错。 如果channel大于1但是没有配置此参数,任务将置为失败。
必选:否 参数类型:String 默认值:无
where
类型: 单行文本
必须: 否
默认值: 无
说明:
描述:筛选条件,reader插件根据指定的column、table、where条件拼接SQL,并根据这个SQL进行数据抽取。在实际业务场景中,往往会选择当天的数据进行同步,可以将where条件指定为gmt_create > time。 注意:不可以将where条件指定为limit 10,limit不是SQL的合法where子句。 必选:否 参数类型:String 默认值:无
com.qlangtech.tis.plugin.datax.mongo.MongoSelectedTabExtend
显示名: MongoSelectedTabExtend
全路径名: com.qlangtech.tis.plugin.datax.mongo.MongoSelectedTabExtend
费用: 😄
社区版(免费)配置项说明:
tabName
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@e27d97b
- 说明: 无
过滤
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 遍历MongoDB Collection只读取部分记录集,需要填写合适的查询条件
com.qlangtech.tis.plugins.incr.flink.connector.UpdateMode
com.qlangtech.tis.plugins.incr.flink.connector.impl.InsertType
显示名: Insert
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.impl.InsertType
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.connector.impl.ReplaceType
显示名: Replace
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.impl.ReplaceType
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.connector.impl.UpdateType
显示名: Update
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.impl.UpdateType
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.connector.impl.UpsertType
显示名: Upsert
全路径名: com.qlangtech.tis.plugins.incr.flink.connector.impl.UpsertType
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.OntologyDomain
com.qlangtech.tis.plugin.ontology.impl.domain.DefaultOntologyDomain
显示名: Ontology
全路径名: com.qlangtech.tis.plugin.ontology.impl.domain.DefaultOntologyDomain
费用: 😄
社区版(免费)配置项说明:
域名称
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 本体域全局唯一标识
默认域
- 类型: 单选
- 必须: 是
- 默认值: false
- 说明: 如设置为'是',则在例如openClaw的使用场景中不需要设置本体域即可使用该本体域中的本体对象
com.qlangtech.tis.plugins.incr.flink.cdc.mysql.startup.StartupOptions
com.qlangtech.tis.plugins.incr.flink.cdc.mysql.startup.LatestStartupOptions
显示名: LATEST_OFFSET
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.mysql.startup.LatestStartupOptions
费用: 😄
社区版(免费)
com.qlangtech.tis.plugins.incr.flink.cdc.mysql.startup.TimestampStartupOptions
显示名: TIMESTAMP
全路径名: com.qlangtech.tis.plugins.incr.flink.cdc.mysql.startup.TimestampStartupOptions
费用: 😄
社区版(免费)配置项说明:
开始时间
- 类型: 日期
- 必须: 是
- 默认值: 无
- 说明: timestamp for the startup offsets, as milliseconds from epoch.
com.qlangtech.tis.plugin.ontology.impl.objtype.OntologyPrimaryKeySetter
com.qlangtech.tis.plugin.ontology.impl.objtype.impl.primarykeysetter.NonePrimaryKey
显示名: off
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.impl.primarykeysetter.NonePrimaryKey
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.impl.objtype.impl.primarykeysetter.PrimaryKey4OneField
显示名: on
全路径名: com.qlangtech.tis.plugin.ontology.impl.objtype.impl.primarykeysetter.PrimaryKey4OneField
费用: 😄
社区版(免费)配置项说明:
主键
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 主键(Primary Key)用于唯一标识本体对象实例。选择后,该属性将作为对象的唯一标识符,在数据同步和查询时作为主要索引使用。
com.qlangtech.tis.plugin.ontology.OntologyDomainManipulate
com.qlangtech.tis.plugin.ontology.EnableChatBI
显示名: Enable ChatBI
提供者: TIS
费用: 😄
社区版(免费)配置项说明:
任务名称
- 类型: 单行文本
- 必须: 是
- 默认值: com.qlangtech.tis.plugin.ontology.EnableChatBI.KEY_ID_NAME
- 说明: 推断任务的唯一标识
大模型
- 类型: 单选
- 必须: 是
- 默认值: 无
- 说明: 用于自动化SQL生成推理LLM接口
检索
- 类型: 单行文本
- 必须: 是
- 默认值: Retrieval Config
- 说明: Neo4j GraphRAG 检索相关参数配置
重试
- 类型: 单行文本
- 必须: 是
- 默认值: Retry Config
- 说明: LLM 重试和超时相关参数配置
SQL校验
- 类型: 单行文本
- 必须: 是
- 默认值: Validation Config
- 说明: SQL 校验相关参数配置(关键字白名单、EXPLAIN 校验等)
执行
- 类型: 单行文本
- 必须: 是
- 默认值: Execution Config
- 说明: SQL 执行相关参数配置(结果集限制、超时等)
追踪
- 类型: 单行文本
- 必须: 是
- 默认值: Trace Config
- 说明: Trace 日志相关参数配置(保留策略、自动清理等)
com.qlangtech.tis.plugin.ontology.InferOntologyFromLLMHost
显示名: Infer Ontology From LLM
全路径名: com.qlangtech.tis.plugin.ontology.InferOntologyFromLLMHost
提供者: TIS
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.paimon.datax.utils.PaimonSnapshot
com.qlangtech.tis.plugin.paimon.datax.utils.PaimonSnapshot
显示名: default
全路径名: com.qlangtech.tis.plugin.paimon.datax.utils.PaimonSnapshot
费用: 😄
社区版(免费)配置项说明:
num-retained.min
类型: 整型数字
必须: 是
默认值: 10
说明:
The minimum number of completed snapshots to retain. Should be greater than or equal to 1.
num-retained.max
类型: 整型数字
必须: 是
默认值: 2147483647
说明:
The maximum number of completed snapshots to retain. Should be greater than or equal to the minimum number.
time-retained
类型: 时间跨度
必须: 是
默认值: 1
说明:
The maximum time of completed snapshots to retain.
unit:hour
com.qlangtech.tis.plugin.datax.SelectedTab
com.qlangtech.tis.plugin.datax.doris.DorisSelectedTab
显示名: DorisSelectedTab
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
表别名
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 可以为表名设置一个别名,这样同步到目标端的表名会以此别名作为表名
主键(s)
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@3ef396c9
- 说明: 选择列作为表的主键
Sequence列
类型: 单行文本
必须: 否
默认值: off
说明:
用户需要确保每次更新记录该列的值会递增,支持使用:整型数字、DATE、DATETIME类型的列,通过设置Sequence可以保证在乱序情况下可以保证数据不会发生脏写
详细请查阅 Doris文档:https://doris.apache.org/zh-CN/docs/dev/data-operate/update-delete/sequence-column-manual
where
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 筛选条件,MysqlReader根据指定的column、table、where条件拼接SQL,并根据这个SQL进行数据抽取。在实际业务场景中,往往会选择当天的数据进行同步,可以将where条件指定为gmt_create > $bizdate 。注意:不可以将where条件指定为limit 10,limit不是SQL的合法where子句。 where条件可以有效地进行业务增量同步。如果不填写where语句,包括不提供where的key或者value,DataX均视作同步全量数据。
同步列
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 需要同步的数据列
com.qlangtech.tis.plugins.datax.kafka.writer.KafkaSelectedTab
显示名: KafkaSelectedTab
全路径名: com.qlangtech.tis.plugins.datax.kafka.writer.KafkaSelectedTab
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
表别名
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 可以为表名设置一个别名,这样同步到目标端的表名会以此别名作为表名
主键(s)
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@7857cb1d
- 说明: 选择列作为表的主键
分区字段
- 类型: 单选
- 必须: 否
- 默认值: 无
- 说明: kafka sink分区字段
where
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 筛选条件,MysqlReader根据指定的column、table、where条件拼接SQL,并根据这个SQL进行数据抽取。在实际业务场景中,往往会选择当天的数据进行同步,可以将where条件指定为gmt_create > $bizdate 。注意:不可以将where条件指定为limit 10,limit不是SQL的合法where子句。 where条件可以有效地进行业务增量同步。如果不填写where语句,包括不提供where的key或者value,DataX均视作同步全量数据。
同步列
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 需要同步的数据列
com.qlangtech.tis.plugin.datax.mongo.MongoWriterSelectedTab
显示名: MongoWriterSelectedTab
全路径名: com.qlangtech.tis.plugin.datax.mongo.MongoWriterSelectedTab
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
表别名
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 可以为表名设置一个别名,这样同步到目标端的表名会以此别名作为表名
主键(s)
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@34f24a11
- 说明: 选择列作为表的主键
upsert
类型: 单行文本
必须: 是
默认值: off
说明:
指定了传输数据时更新的信息,当设置为‘on’时,表示针对相同的replaceKey做更新操作,详细功能介绍请查看 DataX Mongodb Writer
where
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 筛选条件,MysqlReader根据指定的column、table、where条件拼接SQL,并根据这个SQL进行数据抽取。在实际业务场景中,往往会选择当天的数据进行同步,可以将where条件指定为gmt_create > $bizdate 。注意:不可以将where条件指定为limit 10,limit不是SQL的合法where子句。 where条件可以有效地进行业务增量同步。如果不填写where语句,包括不提供where的key或者value,DataX均视作同步全量数据。
同步列
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 需要同步的数据列
com.qlangtech.tis.plugin.paimon.datax.PaimonSelectedTab
显示名: PaimonSelectedTab
全路径名: com.qlangtech.tis.plugin.paimon.datax.PaimonSelectedTab
费用: 😄
社区版(免费)配置项说明:
name
- 类型: 单行文本
- 必须: 是
表别名
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 可以为表名设置一个别名,这样同步到目标端的表名会以此别名作为表名
主键
- 类型: 单选
- 必须: 是
- 默认值: com.qlangtech.tis.trigger.util.UnCacheString@6d45dd4
- 说明: 选择列作为表的主键
分区键
类型: 单行文本
必须: 是
默认值: off
说明:
Apache Paimon 的分区功能是其表设计中的核心特性之一,它通过逻辑划分数据来提高查询效率和管理便捷性。以下是分区功能的全面介绍:
一、分区核心概念
什么是分区?
- 逻辑数据划分:根据指定列的值将表数据分割成独立的子集
- 物理存储映射:每个分区对应文件系统上的独立目录
- 查询优化基础:实现分区剪枝(Partition Pruning)加速查询
分区 vs 分桶
特性 分区(Partition) 分桶(Bucket) 目的 数据管理/查询优化 并行处理/文件控制 划分依据 业务逻辑(日期、地区等) 哈希算法(主键/指定列) 物理表现 独立目录 同一目录下的不同文件 查询优化 分区剪枝 桶过滤 典型场景 时间序列数据 分布式处理
sequence
类型: 单行文本
必须: 是
默认值: off
说明:
在 Apache Paimon 中配置 Sequence ID 主要用于处理多路写入(如 CDC 数据)时的更新顺序问题,确保在相同主键下保留最新版本的数据。以下是详细配置步骤和注意事项:
核心概念
- Sequence ID:一个单调递增的字段(如时间戳、版本号),用于解决更新冲突。当主键相同时,Paimon 会保留 Sequence ID 值最大的记录。
- 使用场景:适用于 CDC 数据同步(如 MySQL binlog)、多流写入等需要保证数据最终一致性的场景。
bucketField
类型: 单行文本
必须: 是
默认值: off
说明:
在 Apache Paimon 中,bucket-key 是一个关键的分桶字段配置,它决定了数据在桶内的分布方式。这个参数与 bucket 模式密切相关,但在不同桶模式下其作用和有效性有显著差异。下面我将详细解释:
🔄
bucket-key在不同桶模式下的有效性- 固定桶模式 (
bucket > 0) - ✅ 完全有效且推荐使用 - 动态桶模式 (
bucket = -1) ⚠️ 有条件有效 限制:- 仅当
bucket-key= 主键(或主键子集) 时才有效 - 如果设置非主键字段,Paimon 会静默忽略该配置
- 仅当
- 延迟桶模式 (
bucket = -2) ❌ 完全无效 原因:- 延迟桶模式写入时不立即分桶
- 数据以临时文件存储,Compaction 时才分桶
bucket-key在写入阶段无法生效
💡 最佳实践总结
桶模式 bucket-key是否有效推荐配置策略 固定桶 (>0) ✅ 有效 设置为高频过滤/JOIN的字段 动态桶 (-1) ⚠️ 仅当等于主键时有效 必须设置为表的主键字段 延迟桶 (-2) ❌ 无效 改用 partition+sort-key替代方案- 固定桶模式 (
where
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 筛选条件,MysqlReader根据指定的column、table、where条件拼接SQL,并根据这个SQL进行数据抽取。在实际业务场景中,往往会选择当天的数据进行同步,可以将where条件指定为gmt_create > $bizdate 。注意:不可以将where条件指定为limit 10,limit不是SQL的合法where子句。 where条件可以有效地进行业务增量同步。如果不填写where语句,包括不提供where的key或者value,DataX均视作同步全量数据。
同步列
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 需要同步的数据列
com.qlangtech.tis.plugin.ontology.impl.valuetype.ValueConstraint
com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Enum4Integer
显示名: Enum
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Enum4Integer
费用: 😄
社区版(免费)配置项说明:
可用值
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 设置整数属性的可用枚举值列表
com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Enum4String
显示名: Enum
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Enum4String
费用: 😄
社区版(免费)配置项说明:
可用值
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 设置字符串属性的可用枚举值列表
忽略大小写
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 匹配枚举值时是否忽略大小写
com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4Decimal
显示名: Range
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4Decimal
费用: 😄
社区版(免费)配置项说明:
最小值
- 类型: 浮点数字
- 必须: 是
- 默认值: 无
- 说明: 小数属性的最小允许值
最大值
- 类型: 浮点数字
- 必须: 是
- 默认值: 无
- 说明: 小数属性的最大允许值
com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4Integer
显示名: Range
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4Integer
费用: 😄
社区版(免费)配置项说明:
最小值
- 类型: 整型数字
- 必须: 是
- 默认值: 无
- 说明: 整数属性的最小允许值
最大值
- 类型: 整型数字
- 必须: 是
- 默认值: 无
- 说明: 整数属性的最大允许值
com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4String
显示名: Range
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4String
费用: 😄
社区版(免费)配置项说明:
最小长度
- 类型: 整型数字
- 必须: 是
- 默认值: 无
- 说明: 字符串的最小允许长度
最大长度
- 类型: 整型数字
- 必须: 是
- 默认值: 无
- 说明: 字符串的最大允许长度
com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4TimeStamp
显示名: Range
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Range4TimeStamp
费用: 😄
社区版(免费)配置项说明:
最早时间
- 类型: 日期
- 必须: 是
- 默认值: 无
- 说明: 时间戳属性的最早允许值
最晚时间
- 类型: 日期
- 必须: 是
- 默认值: 无
- 说明: 时间戳属性的最晚允许值
com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Regex
显示名: Regex
全路径名: com.qlangtech.tis.plugin.ontology.impl.valuetype.constraints.Regex
费用: 😄
社区版(免费)配置项说明:
正则表达式
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 约束字符串格式的正则表达式
com.qlangtech.plugins.incr.flink.cdc.mongdb.MongoCDCStartupOptions
com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.startup.Initial
显示名: INITIAL
全路径名: com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.startup.Initial
费用: 😄
社区版(免费)配置项说明:
pollMaxBatchSize
类型: 整型数字
必须: 否
默认值: 无
说明:
Maximum number of change stream documents to include in a single batch when polling for new data. This setting can be used to limit the amount of data buffered internally in the connector.
- Default:
1024
- Default:
pollAwaitTimeMillis
类型: 整型数字
必须: 否
默认值: 无
说明:
The amount of time to wait before checking for new results on the change stream.
- Default:
1000
- Default:
heartbeatIntervalMillis
类型: 整型数字
必须: 否
默认值: 无
说明:
The length of time in milliseconds between sending heartbeat messages. Heartbeat messages contain the post batch resume token and are sent when no source records have been published in the specified interval. This improves the resumability of the connector for low volume namespaces.
Use
0to disable.
com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.startup.LatestOffset
显示名: LATEST_OFFSET
全路径名: com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.startup.LatestOffset
费用: 😄
社区版(免费)
com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.startup.Timestamp
显示名: TIMESTAMP
全路径名: com.qlangtech.plugins.incr.flink.cdc.mongdb.impl.startup.Timestamp
费用: 😄
社区版(免费)配置项说明:
开始时间
- 类型: 日期
- 必须: 是
- 默认值: 无
- 说明: timestamp for the startup offsets, as milliseconds from epoch.
com.qlangtech.tis.plugin.ontology.PropertyRoleType
com.qlangtech.tis.plugin.ontology.impl.role.DimensionRole
显示名: Dimension
全路径名: com.qlangtech.tis.plugin.ontology.impl.role.DimensionRole
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.impl.role.IdentifierRole
显示名: Identifier
全路径名: com.qlangtech.tis.plugin.ontology.impl.role.IdentifierRole
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.impl.role.MeasureRole
显示名: Measure
全路径名: com.qlangtech.tis.plugin.ontology.impl.role.MeasureRole
费用: 😄
社区版(免费)配置项说明:
关联链路
- 类型: 多选
- 必须: 是
- 默认值: 无
- 说明: 通过 Link 关联到目标对象的链路,目前最多支持一跳,用于在链路末端的对象上取值进行聚合计算
聚合函数
- 类型: 单行文本
- 必须: 是
- 默认值: 无
- 说明: 对链路末端对象类型施加的聚合方式,例如求和、平均值、计数、去重计数、最大值、最小值等
单位
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 度量值的单位,例如:元、个、次,留空表示无单位
精度
- 类型: 整型数字
- 必须: 否
- 默认值: 无
- 说明: 度量值的小数位数精度,留空表示不限制精度
com.qlangtech.tis.plugin.ontology.impl.role.TimeDimensionRole
显示名: TimeDimension
全路径名: com.qlangtech.tis.plugin.ontology.impl.role.TimeDimensionRole
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.ontology.impl.role.UnknownRole
显示名: Unknown
全路径名: com.qlangtech.tis.plugin.ontology.impl.role.UnknownRole
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilter
com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilteOff
显示名: off
全路径名: com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilteOff
费用: 😄
社区版(免费)
com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilterNormalQuery
显示名: normalQuery
全路径名: com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilterNormalQuery
费用: 😄
社区版(免费)配置项说明:
query
类型: 富文本
必须: 是
默认值: 无
说明:
MongoDB 普通过滤文档集合查询语法,具体可以查询 文档:https://www.mongodb.com/docs/manual/tutorial/query-documents/
com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilterOn
显示名: rangeQuery
全路径名: com.qlangtech.tis.plugin.datax.mongo.reader.ReaderFilterOn
费用: 😄
社区版(免费)配置项说明:
ObjectId
- 类型: 单选
- 必须: 是
- 默认值: true
- 说明: 以下查询条件,作为MongoDB 主键的ObjectId类型使用
下边界
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
上边界
- 类型: 单行文本
- 必须: 否
- 默认值: 无
- 说明: 无
com.qlangtech.tis.hive.Hms
com.qlangtech.tis.hive.Hms
显示名: HMS
费用: 😄
社区版(免费)配置项说明:
hiveAddress
- 类型: 单行文本
- 必须: 是
- 默认值: {ip|host}:10000
- 说明: 描述:Hive Thrift Server2。格式:ip:端口;例如:127.0.0.1:9000
userToken
- 类型: 单行文本
- 必须: 是
- 默认值: off
- 说明: 当选择为'on', 用户需要填写用户名和密码