基本概念
➢ algo:算法,GBase UP 提供的机器学习算法。
➢ dataSource:数据源,可以来自于数据库表或 HDFS 文件。
➢ dataset:数据集。数据源经过预处理过程生成的数据,直接用于模型训练。
➢ model:模型。经过训练后生成,用于模型的评估和预测,是机器学习算法的核心。
1. ADD_ALGORITHM(alg_name,train_class,evaluate_class,evaluate_type,predict_class)
功能:在 GBase UP 中注册算法族。 参数说明:
alg_name:算法族的名称;
train_class:训练算法的类名;
evaluate_class:评估算法的类名;
evaluate_type:评估算法的类型,如果直接使用训练好的模型进行评估则取值为 0,如 果根据评估参数重新计算模型进行评估则取值为 1;
predict_class:预测算法的类名。 示例:将“kmeans”算法族注册到 GBase UP。
gccli> call UPEXTDB.ADD_ALGORITHM( ‘kmeans ',
‘com.gbase.ml.core.kmeans.KMeansTrain’,
‘com.gbase.ml.core.kmeans.KMeansEvaluate’,
1,
‘com.gbase.ml.core.kmeans. KMeansPredict_tb’);
DELETE_ALGORITHM(alg_name)
功能:在 GBase UP 中注销算法族。
参数说明:
alg_name:算法族的名称;
示例:注销“kmeans”算法族。
gccli> call UPEXTDB.DELETE_ALGORITHM( 'kmeans' );
3. SHOW_ALGORITHMS()
功能:显示所有已注册的算法族。 示例:显示算法族。
gccli> call UPEXTDB.SHOW_ALGORITHMS();


4. CREATE_MODEL(model_name, alg_name, train_set, test_set)
功能:创建模型。 参数说明:
model_name:自定义模型的名称;
alg_name:模型所使用的算法族的名称;
train_set:训练数据集,用于训练模型,可以是表、视图或 HDFS 文件;
test_set:测试数据集,用于评估模型,可以是表、视图或 HDFS 文件。
示例 1:创建模型,模型名为 kmeans_cust_model,使用算法族为 kmeansForCust,训练集和测试 集分别是 spark_ml 库中的 t_cust_train_data 表和 t_cust_enva_data 表。
gccli>call UPEXTDB.CREATE_MODEL ( 'kmeans_cust_model',
'kmeansForCust',
'spark_ml.t_cust_train_data',
'spark_ml.t_cust_enva_data');
示例 2:创建模型,训练集和测试集都是 HDFS 文件,/up/sparkml/data/features_train 为训练 集目录,/up/sparkml/data/features_test 为测试集目录。
gccli>call UPEXTDB.CREATE_MODEL( 'naiveBayes_model',
'naiveBayes',
'/up/sparkml/data/features_train',
'/up/sparkml/data/features_test');




