

半结构化数据分析能力(Variant):轻松处理 JSON、XML 等灵活的数据类型 智能索引能力升级: 全文检索:内置 BM25 算法,支持高性能关键词搜索与相关性排序,应对精确匹配场景。 向量检索: 集成 ANN 算法索引,支持高维向量相似性搜索,实现基于语义的匹配。 混合检索与分析(Hybrid Search):可同时结合关键词、向量及结构化过滤进行查询,大幅提升召回率与准确度。 AI 原生化:内置 AI Functions,可直接调用 Embedding 模型、大语言模型(LLM)等。 面向 Agent 的 MCP 交互能力:支持与 AI Agent 便捷且高效协同,使其成为智能体可信赖的数据与工具中枢。

用户画像与行为分析:融合用户的结构化行为数据(点击、购买)与非结构化反馈(评论、客服对话),通过 AI 理解情绪与意图,自动关联行为异动与根本原因,实现从“看到现象”到“解释原因”的闭环。 智能风控与审计:在传统规则和指标风控基础上,引入交易备注、申诉文本等非结构化数据,通过语义分析识别潜在欺诈模式,将隐形的风险信号转化为可预警的规则。 制造与 IoT 预测性维护:关联设备时序传感器数据与维修日志文本,通过混合检索快速匹配历史故障案例,实现故障根因的智能定位与预测性维护建议。 产品反馈与洞察分析:汇聚来自论坛、工单、客服的分散用户反馈,通过 Doris + AI 将海量非结构化内容转化为可量化、可分析的产品洞察,驱动功能优化与决策。
SelectDB Cloud(https://selectdb.com/cloud) 不绑定特定云厂商,可在阿里云、华为云、AWS 等多个云平台上以 SaaS 模式部署,并支持 BYOC(自带云)模式,充分满足数据合规与成本控制需求。 阿里云瑶池数据库 SelectDB 版(https://www.aliyun.com/product/selectdb?utm_content=g_1000410296) 作为阿里云原生服务,与 VPC、RAM 权限、监控等云服务无缝集成,提供类似在用户 VPC 内部署的网络体验,让用户享受更便捷的云端管理能力。
场景实战:基于 SelectDB + AI 的产品反馈洞察系统
那么,具体如何实现呢?在接下来的实战指南中,我们将以 SelectDB 产品经理的身份讲解。以“物化视图”这一功能为例,我们是如何借助 SelectDB + AI,搭建一个用于收集、整合与分析全域用户反馈的智能洞察系统。


CREATE TABLE forum_questions (
question_id BIGINT, --问题ID
user_id BIGINT, --提问用户ID
title STRING, --标题
content STRING, --用户提问和回复的内容
INDEX idx_content (`content`) USING INVERTED PROPERTIES("lower_case" = "true", "parser" = "chinese", "support_phrase" = "true")
)
UNIQUE KEY(question_id)
DISTRIBUTED BY HASH(question_id) BUCKETS 2
PROPERTIES (
"replication_num" = "1"
);
CREATE TABLE forum_question_embeddings (
user_id BIGINT NOT NULL, -- 原问题所属用户
question_id BIGINT NOT NULL, -- 原问题ID
chunk_id BIGINT NOT NULL AUTO_INCREMENT, -- 文本切片 ID(每片对应一条向量)
content_chunk STRING NOT NULL, -- 文本切片内容
embedding array<float> NOT NULL, -- 1024维向量
INDEX ann_index (embedding) USING ANN PROPERTIES(
"index_type"="hnsw",
"metric_type"="inner_product",
"dim"="1024",
"quantizer"="flat"
)
)
DUPLICATE KEY(user_id, question_id, chunk_id)
DISTRIBUTED BY HASH(user_id) BUCKETS 2
PROPERTIES (
"replication_num" = "1"
);
CREATE TABLE parsed_results (
id BIGINT NOT NULL AUTO_INCREMENT, -- 主键ID
feedback_id BIGINT NOT NULL, -- 用户反馈ID(外键关联 forum_questions)
parsed_data VARIANT NOT NULL -- 解析结果(任意 JSON 数据)
)
UNIQUE KEY(id)
DISTRIBUTED BY HASH(id) BUCKETS 2
PROPERTIES (
"replication_num" = "1"
);
CREATE RESOURCE"qwen-text-embedding-v4"
PROPERTIES (
'type' = 'ai',
'ai.provider_type' = 'QWen',
'ai.endpoint' = 'https://dashscope.aliyuncs.com/compatible-mode/v1',
'ai.model_name' = 'text-embedding-v4',
'ai.api_key' = 'xxx',
'ai.temperature' = '0.7',
'ai.max_token' = '1024',
'ai.max_retries' = '3',
'ai.retry_delay_second' = '1',
'ai.dimensions' = '1024'
);
CREATE RESOURCE"glm-4-flash-250414"
PROPERTIES (
'type' = 'ai',
'ai.provider_type' = 'QWen',
'ai.endpoint' = 'https://dashscope.aliyuncs.com/compatible-mode/v1',
'ai.model_name' = 'qwen-flash',
'ai.api_key' = 'xxx',
'ai.temperature' = '0.7',
'ai.max_token' = '-1',
'ai.max_retries' = '3',
'ai.retry_delay_second' = '1'
);
WITH raw AS (
SELECT
question_id,
user_id,
content,
LENGTH(content) AS content_len
FROM forum_questions
),
t AS (
SELECT 0 AS d UNION ALL SELECT 1 UNION ALL SELECT 2 UNION ALL SELECT 3 UNION ALL SELECT 4
UNION ALL SELECT 5 UNION ALL SELECT 6 UNION ALL SELECT 7 UNION ALL SELECT 8 UNION ALL SELECT 9
),
num AS (
SELECT
(a.d * 100 + b.d * 10 + c.d + 1) AS n
FROM t a
CROSS JOIN t b
CROSS JOIN t c
),
chunks AS (
SELECT
r.user_id,
r.question_id,
SUBSTRING(r.content, (n - 1) * 400 + 1, 400) AS content_chunk
FROM raw r
JOIN num ON (n - 1) * 400 + 1 <= r.content_len
)
INSERT INTO forum_question_embeddings (user_id, question_id, content_chunk, embedding)
SELECT
user_id,
question_id,
content_chunk,
EMBED("qwen-text-embedding-v4", content_chunk) AS embedding
FROM chunks;
SET @extract_prompt = "你是一名专业的产品反馈分析助手。现提供一段来自用户的反馈文本(feedback_text),请从中提取与“物化视图(Materialized View, MV)”相关的关键信息,并以严格的 JSON 格式输出。
如果反馈文本与 MV 无关,或无法识别任何相关信息,则直接返回字符串 NULL。
请从 feedback_text 中提取以下信息并生成 JSON:
{
\"used_external_source\": \"用户是否提到使用了哪些外部数据源,例如 MySQL、Oracle、Hive、Iceberg 等。如果未提及则为 null。\",
\"transparent_rewrite\": \"是否使用或提到透明改写(true / false / null)。\",
\"usage_scenario\": \"用户描述的使用场景。若无则为 null。\",
\"problems_or_gaps\": \"用户认为 MV 不足或存在的问题。若无则为 null。\",
\"other_insights\": \"任何与 MV 相关、对产品改进有价值的额外信息。若无则为 null。\"
}
要求:
1. 输出内容必须是纯 JSON,对象必须以 { 开头、以 } 结尾。
2. 禁止输出任何 Markdown 代码块标记,如 json、、json、``` 等。
3. 禁止输出任何额外文字、描述、解释、前缀或后缀。
4. 不得在 JSON 外输出换行、空格或注释。";
INSERT INTO parsed_results (feedback_id, parsed_data)
SELECT
question_id,
AI_GENERATE(
'glm-4-flash-250414',
concat(@extract_prompt ,'\nfeedback_text: ```' ,content, '```')
) AS extracted_info
FROM forum_questions where search('content:物化视图');
SELECT
lower(CAST(c.used_external_source ASstring)) AS used_external_source,
COUNT(*)
FROM (
SELECT
a.parsed_data.usage_scenario,
a.parsed_data.transparent_rewrite,
a.parsed_data.used_external_source AS used_external_source,
a.parsed_data.problems_or_gaps,
a.parsed_data.other_insights,
b.content
FROM parsed_results a
JOIN forum_questions b ON a.feedback_id = b.question_id
WHERE a.parsed_data.used_external_source != ""
AND a.parsed_data.used_external_source != "null"
) c
GROUP BY lower(CAST(c.used_external_source ASstring));
--向量检索文本
SET @search_text="数据时效性差、 ETL 延迟、物化视图刷新不及时、数据不实时、实时查询不满足业务、报表延迟、同步滞后、时延高、更新慢、不能满足实时监控需求、数据落地慢、数据延时影响决策";
--存储有"数据时效性的痛点或需求"的用户的临时表
CREATE TEMPORARY TABLE retrieved_question_ids (
question_id BIGINT
)
UNIQUE KEY(question_id)
DISTRIBUTED BY HASH(question_id) BUCKETS 2
PROPERTIES (
"replication_num" = "1"
);
insert into retrieved_question_ids(question_id)
SELECT question_id --向量检索
FROM forum_question_embeddings
where inner_product_approximate(
embedding,
EMBED("qwen-text-embedding-v4", @search_text)
) > 0.5
union ALL
select a.question_id from
(
SELECT question_id,score() as relevance --全文检索
FROM forum_questions
where content MATCH_ANY '时效性 实时 延迟 延时 更新不及时 刷新慢 滞后'
ORDER BY relevance DESC
LIMIT 100
)a;
SELECT
lower(CAST(c.used_external_source AS STRING)) AS used_external_source,
COUNT(DISTINCT c.question_id) AS feedback_cnt
FROM (
SELECT
a.feedback_id AS question_id,
a.parsed_data.used_external_source AS used_external_source
FROM parsed_results a
JOIN retrieved_question_ids r
ON a.feedback_id = r.question_id
WHERE a.parsed_data.used_external_source ISNOTNULL
AND a.parsed_data.used_external_source != ""
AND lower(a.parsed_data.used_external_source) != "null"
) c
GROUP BY lower(CAST(c.used_external_source AS STRING))
ORDER BY feedback_cnt DESC;


- END -
更多标杆企业信赖
智慧金融与政企:财通证券|东北证券|度小满|国金证券|国信证券|杭银消金|杭州银行|河北幸福消费金融|河南农商银行|汇添富基金|金融壹账通|陆金所控股|霖梓控股|拉卡拉|某公安厅|平安人寿 | Planet|奇富科技|上海证券 | 同程数科|通联支付|泰康养老|无锡锡商银行|星云零售信贷|星火保 | 宇信科技|银联商务|易生支付|浙江头部银行|招商信诺人寿|招联金融|中信银行信用卡中心|中泰证券|360 数科|360 企业安全浏览器
互联网与文娱:菜鸟|抖音集团|斗鱼|叮咚买菜|浩瀚深度|京东|工商信息查询平台|货拉拉|快手|荔枝微课|票务平台|墨迹天气|MiniMax|奇安信|趣丸科技|顺丰科技|腾讯音乐|天眼查|网易|网易游戏|网易严选|网易云信|网易云音乐|小米|小鹅通|迅雷|约苗|字节跳动|知乎|360 商业化
企业服务与新经济:宝尊科技| 波司登|Cisco|橙联|度言|观测云|慧策|快成物流|领健|领创|灵犀科技|名创优品|Moka BI|美联物业|麦当劳|钱大妈|拈花云科|森马 |思必驰|顺丰科技|上海家化 | 物易云通|云积互动|有赞|雨润集团|纵腾集团|中通快递
先进智造与电信:爱玛|长安汽车|海信集团|恒瑞医药|极越汽车|金风科技|科大讯飞|岚图汽车|Lifewit|哪吒科技|四川航空|上汽通用五菱|三星电子|蜀海供应链|赢家服饰|特步|天翼云|雅迪|中国联通
作为基于 Apache Doris 的商业化公司,飞轮科技秉承着 “开源技术创新”和“实时数仓服务”双轮驱动的战略,在投入资源大力参与 Apache Doris 社区研发和推广的同时,基于 Apache Doris 内核打造了聚焦于企业大数据实时分析需求的企业级产品 SelectDB ,面向新一代需求打造世界领先的实时分析能力。自 2022 年成立以来,获得 IDG 资本、红杉中国、襄禾资本等顶级 VC 的近 10 亿元融资,创下了近年来开源基础软件领域的新纪录。




