暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

国内首场 Unstructured Data Meetup 收官!GenAI 如何连接非结构化数据?

ZILLIZ 2024-06-05
390


近日,国内首场 Unstructured Data Meetup 圆满收官!本次 Meetup 由向量数据库领军者 Zilliz 创办的,同时还邀请到来自 MOSS & OpenMOSS、蚂蚁集团、LangChain 中国社区的技术专家,分享行业对于 GenAI 如何连接非结构化数据的思考。


以下是本次 Unstructured Data Meetup 的重点内容:


  • MOSS & OpenMOSS 团队核心成员 程沁源《From MOSS to OpenMOSS: 对话式大语言模型的构建与探索》

  • Zilliz 开发者布道师 李成龙《Milvus 2.4 新特性揭秘 & Milvus Lite上新》

  • 蚂蚁集团数据基础设施部门工程师 陈柯廷 《基于 AI 原生数据应用开发框架 DB-GPT 的探索及创新》

  • LangChain 中国社区发起人 康轶文《2024 我对AI的态度和创业思考》


01.

From MOSS to OpenMOSS: 对话式大语言模型的构建与探索


MOSS & OpenMOSS 团队核心成员程沁源带领我们深入了解了从MOSS到OpenMOSS的对话式大语言模型的构建与探索之旅。他首先阐述了语言模型的基本原理,即预测下一个词(NTP),并展示了通过预训练,NTP损失可以以可预测的方式下降,显著提升了模型的预测准确率。


接着,他介绍了 ChatGPT 的训练流程,包括监督微调、人类偏好建模和对齐三个关键步骤。随后,他详细阐述了MOSS模型的构建过程,这是一款面向中文场景的对话式语言模型,它通过跨语言继续预训练、与真实用户意图分布对齐、偏好感知训练和多工具增强等方法,实现了对话能力的提升。


程沁源还分享了 MOSS 训练过程中的关键技术,如中文继续预训练、词表扩展、渐进参数解冻等,以及 MOSS-SFT 和 MOSS-PAT 的实验结果,展示了 MOSS 在有用性、诚实性和无害性方面的卓越表现。


最后,程沁源向我们展示了 OpenMOSS 的探索,这是一个开放的研究平台,旨在推动对话式大语言模型的发展。他介绍了教会大模型说“我不知道”的方法,数据混合定律的探索,多模态模型的构建,以及逆向大模型内在机制的解释,为语言模型的未来研究提供了新的思路和方向。


02.

Milvus 2.4 新特性揭秘 & Milvus Lite上新


Zilliz 开发者布道师李成龙主要介绍了 Milvus 2.4 的新特性以及最新发布的轻量级 Milvus——Milvus Lite。他表示,Milvus 2.4  不仅增加了诸如 Multi-Vector 多向量列、Grouping search 聚合搜索、Inverted Index 倒排索引、Milvus CDC 生态工具、GPU index 百倍加速、FP16/BF16 support 新数据格式、Sparse vector(beta) 稀疏向量、Embedding Libs 集成 Embedding 等新功能特性,同时也对 SDK、MMap optimization 等进行了优化。


随后,李成龙提到了 Milvus Lite。作为轻量级的 Milvus,Milvus Lite 支持 grpc server,接口与 Milvus 一致。Milvus Lite 还支持 Mac OS、Linux;支持Jupyter Notebook Google Colab。此外,Milvus Lite 已经和 pymilvus 集成,安装 pymilvus(>=2.4.3)后即可使用。


最后,李成龙还向大家介绍了 Milvus 北极星计划。Milvus 北极星计划旨在汇集和团结 Milvus 社区的热心用户及开发者,组成社区大使团队,根据不同朋友擅长的能力(Coding、写作、沟通、布道、活动组织等),在社区中分配职责,共同建设运营 Milvus 社区,为社区发展壮大探索方向。最终将 Milvus 社区打造为一个充满活力、创新开放、团结互助的全球化社区。


满足以下条件中的任意一条便有机会加入:Milvus 用户或贡献者、对 Milvus 社区有过贡献(投稿文章、交流群问答)、参与过 Milvus 产品升级或功能更新、参与过 Milvus 社区活动(技术分享、线下活动交流)、深度向量检索使用或研究用户。


03.

基于 AI 原生数据应用开发框架 DB-GPT 的探索及创新


蚂蚁集团数据基础设施部门工程师陈柯廷分享了 DB-GPT 带来的 AI Native 数据应用开发探索。


他提到,2023 年 ChatGPT 的横空出世,引爆了生成式人工智能。同年 4 月,带着改变数据库在 AI 时代新交互方式的憧憬,DB-GPT 应运而生,很快便发布了第一个可运行版本。DB-GPT 旨在构建大模型领域的基础设施,让围绕数据构建大模型应用更简单、更方便。


截至目前,DB-GPT 开源社区已经聚合了超过 6 个子项目,拥有超过 12,000 Star。


据陈柯廷介绍,DB-GPT 的架构分为 7 层,从最底层的环境、模型微调(主要还是做Text2SQL)、到智能体表达式语言协议、以及最核心的功能模块层(提供了标准的多模型服务组件、RAG 标准组件、Agents 组件等)、再到整个 DB-GPT 的服务层提供领域的标准 API 和各种服务。应用层则包含了各种使用的应用场景和具体的 DB-GPT 智能应用,同时,DB-GPT 定义了一套完整的基于数据的 AI 可视化协议,提供通用的数据+AI 的可视化。整个架构还包括了对监控、推理成本、反馈、测试等能力的扩展,也支持快速的容器化部署或者和 Ray 结合使用。在实践应用方面,DB-GPT 包括智能问答、大数据平台 Copilot、智能数仓助手等。


04.

2024 我对 AI 的态度和创业思考


康轶文分享了他 2023 年直面 AI 的经历以及 2024 年对 AI 的态度和创业思考。2023 年上半年,康轶文对 AI 的态度是兴奋、迷茫、焦虑、放下、慢慢来、夯实基础、动手做;2023 年下半年,他的态度发生了转变,变成认识模型能力边界、持续学习提高自己。


2024 年,康轶文提到,对于 AI 必须理解和实操的点有 6 个,包括:理解大模型、单字接龙、训练方式,token  path ;理解向量、使用过向量数据库,Milvus;理解“把答案给大模型让他告诉提问者” ;实际开发过 RAG 产品,理解错误回答发生的原因;实际操作微调过大大小小的模型,体验过他们的差别;理解微调模型在未来流程里的落地位置和重要性。理解和实操过后,可以获得:解决方案选型、模型能力边界、成本预估、实现周期、人才判断…


未来,康轶文提到自己的创业方向会是数据研磨。数据研磨”是指对数据进行细致的处理、分析和补充。在数据领域,通过各种方法和技术对大量数据进行仔细地筛选、整理、修正、挖掘等操作,以获取更准确、更有价值的信息或使数据达到特定的颗粒度和质量标准。数据研磨的应用场景包括:模型训练数据集制作、知识库数据预处理、零散数据挖掘。


以上就是本次 Meetup 的全部内容了,微信后台回复关键词「5.31上海」可获取讲师 PPT。


推荐阅读



文章转载自ZILLIZ,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论