暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

GBASE分享部分接口规范

郑小雯 2023-11-06
95

基本概念

➢ algo:算法,GBase UP 提供的机器学习算法。

➢ dataSource:数据源,可以来自于数据库表或 HDFS 文件。

➢ dataset:数据集。数据源经过预处理过程生成的数据,直接用于模型训练。

➢ model:模型。经过训练后生成,用于模型的评估和预测,是机器学习算法的核心。  

1. ADD_ALGORITHM(alg_name,train_class,evaluate_class,evaluate_type,predict_class)

功能:在 GBase UP 中注册算法族。 参数说明:

 alg_name:算法族的名称;

 train_class:训练算法的类名;

 evaluate_class:评估算法的类名;

 evaluate_type:评估算法的类型,如果直接使用训练好的模型进行评估则取值为 0,如 果根据评估参数重新计算模型进行评估则取值为 1;

 predict_class:预测算法的类名。 示例:将“kmeans”算法族注册到 GBase UP。 

 gccli> call UPEXTDB.ADD_ALGORITHM( ‘kmeans ', 

 ‘com.gbase.ml.core.kmeans.KMeansTrain’, 

 ‘com.gbase.ml.core.kmeans.KMeansEvaluate’, 

 1, 

 ‘com.gbase.ml.core.kmeans. KMeansPredict_tb’);  

DELETE_ALGORITHM(alg_name)

功能:在 GBase UP 中注销算法族。 

 参数说明:

 alg_name:算法族的名称;

 示例:注销“kmeans”算法族。

 gccli> call UPEXTDB.DELETE_ALGORITHM( 'kmeans' );

3. SHOW_ALGORITHMS()

功能:显示所有已注册的算法族。 示例:显示算法族。

 gccli> call UPEXTDB.SHOW_ALGORITHMS();  




4. CREATE_MODEL(model_name, alg_name, train_set, test_set)

功能:创建模型。 参数说明:

 model_name:自定义模型的名称;

 alg_name:模型所使用的算法族的名称;

 train_set:训练数据集,用于训练模型,可以是表、视图或 HDFS 文件;

 test_set:测试数据集,用于评估模型,可以是表、视图或 HDFS 文件。 

 示例 1:创建模型,模型名为 kmeans_cust_model,使用算法族为 kmeansForCust,训练集和测试 集分别是 spark_ml 库中的 t_cust_train_data 表和 t_cust_enva_data 表。

 gccli>call UPEXTDB.CREATE_MODEL ( 'kmeans_cust_model',

 'kmeansForCust',

 'spark_ml.t_cust_train_data',

 'spark_ml.t_cust_enva_data'); 

 示例 2:创建模型,训练集和测试集都是 HDFS 文件,/up/sparkml/data/features_train 为训练 集目录,/up/sparkml/data/features_test 为测试集目录。 

 gccli>call UPEXTDB.CREATE_MODEL( 'naiveBayes_model', 

 'naiveBayes',

 '/up/sparkml/data/features_train', 

 '/up/sparkml/data/features_test');  

「喜欢这篇文章,您的关注和赞赏是给作者最好的鼓励」
关注作者
【版权声明】本文为墨天轮用户原创内容,转载时必须标注文章的来源(墨天轮),文章链接,文章作者等基本信息,否则作者和墨天轮有权追究责任。如果您发现墨天轮中有涉嫌抄袭或者侵权的内容,欢迎发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论