暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

井喷开源大模型有啥吗?数据要素市场卡在哪儿?数据安全图谱、图数据库金融应用、最常用开源数据库PG数据迁移、AI芯片、数据治理··

321



点击箭头处“蓝色字”,关注我们哦!!





行业快讯与友商动态 2024年第13期:




本周热点众多,开源大模型越来越越多,越来越强,表型令人刮目相看。MistralAI首次推出 大模型Mixtral 8x22B,以其令人瞩目的1760亿个参数和65,000个token的上下文长度,预示着人工智能领域的一次重大飞跃,是迄今为止最强大的开源 AI 模型之一。

而马斯克的人工智能初创公司 xAI 推出了大模型 Grok-1.5V ,除了强大的文本功能外,Grok 还能处理各种视觉信息,包括文档、图表、截图和照片。但是开源大模型的威力到底在哪儿呢?

数据要素市场卡在哪儿?数据要素全景、数据安全图谱独包括哪些企业?图数据库金融领域独有哪些典型应用?最常用数据库PG数据迁移出了新工具,AI芯片井喷了!

本周焦点
1.IDC《数据要素全景研究》报告出炉,星环科技等代表厂商入选
2.深度分析数据要素市场建设现状、问题和建议,CMF专题报告发布
3.公共数据进入数据要素市场模式研究

大数据
4.网易有数数据开发与治理平台V8.0全新发布,SQL Copilot上线!
5.Starburst将发布其基 Iceberg的湖仓一体托管服务
6.Databricks 为能源行业提供增强的数据分析和智能
7.新的Collibra治理解决方案旨在增强 AI 项目的数据可靠性
8.数据注释解决方案公司Sama推出Sama Red Team,提升 AI 模型的安全性和可靠性
9.Grafana Labs在GrafanaCON 上公布开源项目几大更新
10.Gathid 使用有向图模型推出新的身份治理解决方案

数据库
11.前沿研究院发布《高性能图数据库金融应用白皮书》
12.长文本杀不死RAG:SQL+向量驱动大模型和大数据新范式,MyScale AI数据库正式开源
13.标准化图存储格式GraphAr 正式加入 Apache 孵化器
14.Neon 向全球市场推出其无服务器Postgres平台
15.PeerDB 筹集了 360万美元种子轮资金,以推进 PostgreSQL 的数据移动

数据安全
16.IDC MarketGlance:中国数据安全市场图谱报告发布
17.《反保险欺诈工作办法》将发布,含数据安全、网络安全、个人信息保护等内容
18.让业务更安全!天融信发布AI时代一体化数据安全解决方案
19.安全公司Cyber decacorn Wiz以3.5亿美元收购CDR公司Gem Security
20.PVML筹集800万美元,以通过差分隐私技术保护对敏感数据的访问

AI
21.百度智能体开发工具AgentBuilder:让每个人、每个组织都成为智能体的开发者
22.MistralAI首次推出 Mixtral 8x22B,迄今为止最强大的开源 AI 模型之一
23.马斯克xAI发布Grok-1.5,超越OpenAI的GPT-4V
24.英特尔推出最新的人工智能芯片Gaudi 3,三大优势与英伟达竞争升温



本周焦点


01

IDC《数据要素全景研究》报告出炉,星环科技等代表厂商入选


近日,国际权威IT咨询机构IDC发布了《数据要素全景研究》,该报告分析了当前数据要素市场主要需求、市场活动、参与主体、落地形式以及各环节重点情况,并绘制数据价值流动图和数据要素风险蝴蝶模型以供市场参考。星环科技凭借在数据要素领域的卓越表现和领先实力,作为数据要素代表厂商入选IDC《数据要素全景研究》报告及其数据要素市场图谱V1.0。


报告指出,数据作为社会发展和生产生活之上产生的虚拟资产,需要与其他生产要素协同,其价值体现需要与技术、公司、人才做绑定,数据不应该被视为一种独立的货币价值流通物。IDC 认为,数据要素产业与大数据产业的不同,重点在于产业核心为需要围绕数据要素应用来开展服务,即企业提供的解决方案,需要适配、面向数据流通场景。



02

深度分析数据要素市场建设现状、问题和建议,CMF专题报告发布


4月13日,CMF宏观经济热点问题研讨会(第83期)于线上举行,并发布《数据要素市场建设:现状、问题和建议》报告。报告围绕以下三个方面展开:数据要素市场建设的现状,、数据要素市场建设的问题,数据要素市场建设的建议。


目前数据要素流通交易的主要模式主要有以下三种:第一,企业间直接交易数据;第二,数据交易平台撮合;第三,提供API接口进行数据服务。


数据要转化为生产要素,发挥要素作用,需经过资源化、数据共享、交易流通和分析应用的数据价值化过程,依赖云服务、隐私计算、人工智能等数字技术和数据中心等基础设施支撑,并需要清晰、透明、一致的监管政策保障数据要素市场秩序。据此,可将数据要素市场分为三个层级,分别为支撑层、价值层、政策层。支撑层是数据要素的基础设施及技术支撑,价值层包括数据供应商、数据交易机构和分析应用方,政策层是指构建统一数据标准、推动公共数据开放、激励市场主体数据共享、科学界定数据产权等。


03

公共数据进入数据要素市场模式研究


共数据是数据要素市场的重要组成部分,其如何进入数据要素市场以及其参与数据要素市场的模式分为几类,学界对此少有研究。


通过梳理和比较,深入挖掘国内外公共数据参与数据要素市场的模式类型,归纳得出公共数据进入数据要素市场有两大类、五种模式,包括一级市场(授权运营)+二级市场(场内交易)模式,公共数据开发利用+场外交易模式,依托数据平台构建公共数据流通市场模式,借助数据经纪商、数据中介的交易模式,以及通过(公共)数据信托参与数据市场模式等。


在此归纳基础上,演绎出公共数据进入数据要素市场的理想模式,这一理想模式分为数据获取、数据产品生产、数据产品交易三个各有其独特特征的环节,可为我国公共数据进入数据要素市场的策略选择提供参考。


大数据


04

网易有数数据开发与治理平台V8.0全新发布,SQL Copilot上线!


网易有数数据开发与治理平台EasyData-V8.0版本来袭,带来最新产品和功能升级!指标平台、低代码数据开发、SOL Copilot等全新产品,以及新版离线开发IDE、全链路的资产地图血缘等重点功能,助您重塑企业数据价值,实现效率与创新的双重飞跃。


指标平台通过一次定义、多次复用、自动计算,为企业提供准确、一致、可信的指标服务。同时集成物化视图能力,支持不同引和BI报表对接,助力企业用户快速构建以“指标”为核心的业务洞察和经营管理能力。


低代码数据开发支持可视化拖拽的方式实现数据的加工,极大降低数据开发人员的使用门槛,让不擅长或不了解SOL的用户,也能轻松完成数据加工任务的开发,并减少因人工编写代码带来的数据质量问题。


SQL Copilot通过网易自研大模型帮助数据开发者实时进行代码补全,简化编码过程,提供更流畅的开发体验,为开发人员节省大量宝贵的时间,提升SOL开发效率。在离线开发与自助分析产品中均可以体验该功能。


05

Starburst将发布其基于 Iceberg的湖仓一体托管服务


Starburst Data销售开源Trino分布式查询引擎的商业版本,最近宣布在其Galaxy云上建立一个完全托管的Icehouse数据湖。


Icehouse是一个开源的湖仓一体,结合了 Trino 和 Apache Iceberg 存储。湖仓一体是一种新型的数据架构,它将数据湖的灵活性与数据仓库的性能相结合。Iceberg 是一种开源数据表格式,专为数据仓库和数据湖设计,支持大容量存储的 SQL 表。


Iceberg 的模式演化功能允许表的数据结构随时间变化。它跟踪表中的所有数据版本,包括添加、更新和删除。它还可以轻松与流行的大数据处理框架集成,例如 Apache Spark、Apache Flink 和 Apache Hive。


06

Databricks 为能源行业提供增强的数据分析和智能


大数据公司 Databricks 宣布推出用于能源行业的专用数据智能平台,旨在使能源行业的客户能够利用大量数据流并将其用于业务洞察,并为生成式人工智能工作负载提供数据。


Databricks Data Intelligence Platform for Energy使能源供应商能够使用他们最敏感的信息,而不会出现任何隐私风险。


该产品将为能源公司领导者提供更全面、实时的运营视图,帮助他们应对能源行业最关键的挑战,如实时资产性能、管理和维护。例如,能源供应商可以更有效地收集、分析和可视化来自电网、风力涡轮机、管道和机器等物理资产的基于传感器的数据,并使用这些信息实时监控其性能。


该产品还将支持增强的能源预测,从而最大限度地减少不确定性。它有助于驯服风能、太阳能和水力发电的不可预测性,将复杂的机器学习算法与天气预报、性能数据、价格趋势和需求预测相结合。这将有助于能源供应商更准确地预测和管理需求,从而加强其资源配置,以最大限度地提高盈利能力。


客户还可以使用该平台采用更主动和预测性的方法来优化电网。通过部署高级计量基础设施,公用事业提供商将能够利用高级分析和预测建模,实时了解其电网运营状态。反过来,这意味着更好的负载预测,更准确地预测停电的能力,从而平衡供需,提高电网的整体稳定性。


07

新的Collibra治理解决方案旨在增强 AI 项目的数据可靠性


数据管理初创公司Collibra公布了几项产品创新,旨在使用户能够更轻松地查找、管理和访问数据。


排在首位的是 Collibra AI Government,一款专为人工智能和风险团队设计的解决方案,可提供全面的可见性和控制,同时确保跨工具和用例使用可靠的数据。


推出 Collibra AI,一组新的生成式 AI 功能,使组织能够使用机器学习和人工智能来自动化数据质量和数据治理功能。


推出Collibra Data Notebook,一项旨在帮助处理整个企业不断增长的数据量和种类的服务。该服务允许数据团队更简单地查询、重用和共享数据,从而克服孤立的 SQL 数据笔记本缺乏与数据目录和数据治理解决方案集成的问题。使用Collibra Data Notebook,组织可以从通过 Collibra 找到的数据中获得更多上下文、含义和见解。


Collibra 的更新引入了一系列旨在增强数据治理、可用性和用户体验的功能。Collibra Data Notebook提供对受治理数据的 SQL 访问,从而实现高效的查询、探索和见解共享。更新的用户界面通过改进的可用性元素(如对比度和颜色)以及可自定义的资产页面,使数据治理更易于访问,从而提供量身定制的用户体验。


08

数据注释解决方案公司Sama推出Sama Red Team,提升 AI 模型的安全性和可靠性


数据注释解决方案初创公司 Sama 推出 Sama Red Team,一项旨在帮助开发人员主动提高人工智能模型安全性和可靠性的新服务。


Sama Red Team 利用机器学习工程师、应用科学家和人机交互设计师的专业知识来评估模型的公平性和保障措施,检查是否符合法律,并安全地揭露和纠正文本、图像、语音搜索和其他模式中的问题。


Sama的新服务,正式名称为Samasource Impact Sourcing Inc.,旨在解决生成式AI模型可能在公共安全保障、隐私保护和遵守法律方面存在问题的问题。Sama Red Team 在模型向公众公开之前测试潜在的漏洞,并为开发人员提供修补问题所需的见解。


Sama Red Team 的功能包括能够对模型进行严格的测试,以评估其在四个关键领域的性能:公平性、隐私性、公共安全和合规性。通过公平性测试,该服务模拟可能导致模型产生“冒犯性或歧视性内容”的真实场景。隐私测试涉及制作提示,旨在使模型披露敏感数据,例如个人身份信息、密码或有关模型本身的专有信息,以确保遵守隐私标准。


另一个功能是公共安全测试,该团队扮演对手的角色,以评估模型对现实世界威胁的承受能力,例如网络攻击、安全漏洞甚至导致大规模人员伤亡的场景。


09

Grafana Labs在GrafanaCON 上公布开源项目几大更新


Grafana Labs以其开源可视化仪表板而闻名,在其年度会议 GrafanaCon 上公布了几项产品更新。Grafana Labs 成立于 2014 年,最初是一个为时间序列指标制作更友好的仪表板工具的副项目,现已呈指数级增长,现在拥有多个项目和超过2000万用户。


该公司的旗舰开源数据可视化平台Grafana 11.0版本发布。借助新版本,现在可以更轻松、更快速地连接用户数据、共享和编辑仪表板以及响应事件。该平台还为数据可视化提供了更多选项。


该公司现在提供了一个 Explore Metric 模块,该模块可以识别问题的根本原因,而无需对开源 Prometheus 发起查询,Prometheus 是 Grafana Cloud 可观测性平台的核心。


Grafana Labs 还推出了 Explore Logs,它为浏览 Loki 日志提供了无查询体验。用户不必依赖 LogQL 来导航和筛选日志。新的 Grafana 应用程序现在扩展了核心 API,以提供更强大的集成。用户可以与 Tempo 和 Traces 集成,以便在跟踪范围内更好地了解配置文件。


10

Gathid 使用有向图模型推出新的身份治理解决方案


澳大利亚身份和访问架构公司 Gathid推出一种新的身份和访问治理解决方案,使用有向图模型进行高效的异常检测,并在复杂的信息技术基础设施之间实现无缝集成。


该解决方案旨在实现跨各种 IT 基础架构的快速部署、即时适用性和集成,旨在满足对可扩展且经济高效的身份管理的需求。


Gathid 认为,现有的身份和访问管理解决方案需要集中式方法,导致依赖单个或少数供应商来促进大规模连续部署,从而维护所有系统之间的实时身份并发。大规模部署的购买、迁移和启用成本很高,这正是 Gathid 旨在通过其新解决方案产生影响的地方。


该产品与现有基础设施集成,可帮助组织应对日益复杂的身份安全挑战。Gathid 使用有向图模型的新颖应用来改进身份和访问,并采用资源节约型方法,可以在混合和多云环境中的断开连接的系统中运行。


每天都会从头开始重建身份模型,使组织摆脱系统同步和不完整的增量报告的约束。如果自动化遗漏了任何一个节拍,Gathid 会突出显示任何遗漏的内容,并将重点引向关键的合规清理领域。据称,持续的每日刷新周期对于维护准确、始终合规的访问生态系统至关重要。


该技术通过有效集成来自各种来源的数据(包括数字平台、运营技术和物理访问控制系统)来促进快速部署,而无需管理权限或复杂的集成。该平台旨在使各种规模的组织都能访问且负担得起的身份治理,分析基于角色的访问和角色挖掘,即使是传统、气隙或专用系统也是如此。


数据库


11

前沿研究院发布《高性能图数据库金融应用白皮书》


前沿研究院编写了《高性能图数据库金融应用白皮书》,介绍图数据库技术特点、在金融行业的应用、技术标准等内容,并展示了五个获奖案例企业是如何借助图数据库技术助力金融机构实现数据价值的最大化,提升业务效率,降低风险,并推动创新。


报告认为,图数据库金融典型应用包括金融风险管理、金融欺诈检测、知识图谱构建和市场营销分析等。


图数据库国际标准上,图数据库系统的选型,一个非常重要的工具就是基准测试程序,英文叫 Benchmark,它会模拟真实的场景对系统进行测试,是比较标准的测试程序。LDBC(The Linked Data Benchmark Council) 是全球知名的非盈利性技术协会,目前有三个 Benchmark,一个是基于语义网络的 RDF 图,一个是图分析,另外就是社交网络的图 SNB。


图数据主要挑战包括四个:大数据的挑战、新硬件的挑战、接口语言的挑战和数据建模的挑战。


12

长文本杀不死RAG:SQL+向量驱动大模型和大数据新范式,MyScale AI数据库正式开源


经过近 6 年的开发和数次版本迭代,MyScaleDB 已于近期开源,欢迎所有开发者和企业用户在 GitHub 上 Star,并开启使用 SQL 构建生产级 AI 应用的新玩法!


MyScale AI 数据库(MyScaleDB)基于高性能的 SQL 列式存储数据库打造,自研高性能和高数据密度的向量索引算法,并针对 SQL 和向量的联合查询对检索和存储引擎进行了深度的研发和优化,是全球第一个综合性能和性价比大幅超越了专用向量数据库的 SQL 向量数据库产品。


得益于 SQL 数据库在海量结构化数据场景长期的打磨,MyScaleDB 同时支持海量向量和结构化数据,包括字符串、JSON、空间、时序等多种数据类型的高效存储和查询,并将在近期推出功能强大的倒排表和关键字检索功能,进一步提高 RAG 系统的精度并替代 Elasticsearch 等系统。


13

标准化图存储格式GraphAr 正式加入 Apache 孵化器


Apache GraphAr (incubating) 是一个开源的标准化图数据存储文件格式,提供高效灵活的格式设计和多语言支持,旨在实现图数据的高效存储和检索。近期,GraphAr 项目正式被纳入 Apache 软件基金会(ASF,Apache Software Foundation)的孵化器,成为 ASF 孵化项目。


在未来一段时间,GraphAr 社区将专注于:


• 以社区驱动的方式持续完善 GraphAr 的能力,适配包含图学习,知识图谱,图计算和图数据库等不同类型的图系统或图存储。


• 扩展文件格式,提供更多语言 SDK、支持更多文件类型和数据类型等。


• 通过应用过滤下推、压缩编码等技术,实现更高效的读写性能。


• 提供更加简洁、友好的用户使用体验。


14

Neon 向全球市场推出其无服务器Postgres平台


开源数据库初创公司Neon.tech 宣布其创新平台无服务器 Postgres 平台从技术预览版过渡到式发布。该数据库用例一年内从 6,000 个增长到超过 700,000 个。


Neon 开发了一个 Postgres 平台,重新定义了现代应用程序的开发人员体验。该平台的无服务器功能使开发人员团队能够通过分支共享相同的架构和数据来更高效地工作,而缩放至零功能则允许单个开发人员运行单独的数据库而不会产生高成本,从而确保成本效益。


Neon 现在是全球数千家公司值得信赖的解决方案,它利用数据库分支、缩放至零和自动缩放等功能来提高运营效率。展望未来,Neon 对即将推出的新功能和改进感到兴奋,有望进一步巩固其在无服务器数据库技术和开发人员工作流解决方案方面的领导地位。


15

PeerDB 筹集了 360万美元种子轮资金,以推进 PostgreSQL 的数据移动


领先的PostgreSQL数据移动平台PeerDB 宣布获得360万美元的种子轮融资,继续建立其工程团队,推动其上市和客户获取计划,并支持其增长。PeerDB 的收入每两个月翻一番。


Postgres 正在成为世界数据库,也是企业和中小企业事实上的主要数据库。现有的数据移动和 ETL 工具不是为 Postgres 构建的——由于同步速度太慢、缺乏可靠性和缺乏原生功能,它们经常大规模失败。


在 PeerDB通过并行快照和处理现有 ETL 工具中不存在的复制槽周围的细微差别等基本优化,专注于构建一个专门用于 Postgres 的 TB 级系统。Postgres专家团队不仅提供数据移动服务,而且还成为客户团队的重要组成部分,提供有关数据库调优和查询优化的建议。


数据安全


16

IDC MarketGlance:中国数据安全市场图谱报告发布


IDC发布了《Market Glance:中国数据安全市场图谱,2024》,展示了中国数据安全市场的构成和格局,遴选出不同细分市场领域的主要技术服务供应商,绘制出市场地图。内容涵盖了信息保护、数字信任、数据安全服务等领域的主要厂商。


中国数据安全市场在未来五年会保持持续向上增长,预估五年复合增长率将达到15.6%。在这一过程中,数据安全市场会有如下趋势:


数据分类分级与数据安全合规咨询的地位日益凸显,这两者不仅为数据的合规利用和保护提供了明确的指引,还是企业和组织确保数据安全、规避法律风险的重要保障,也是企业构建安全、可信数据环境的重要基石。


数据安全能力和组件的系统化整合,已成为技术供应商发展的又一重要趋势,将推动数据安全市场向更全面、综合的解决方案演进,以满足日益复杂的安全需求,并提升整个市场的竞争力。


数据安全发展正经历从合规到主动防御的转变,企业需构建适应自身需求的防御体系,持续投入资源完善安全策略和技术,确保在数字经济时代中保持竞争优势。


17

《反保险欺诈工作办法》将发布,含数据安全、网络安全、个人信息保护等内容


4月11日,国家金融监督管理总局发布《反保险欺诈工作办法(征求意见稿)》(以下简称《办法》)。


《办法》要求,保险机构和行业组织应按照职责分工统筹网络安全、数据安全与创新发展,依法履行安全保护义务,完善管理制度,加强网络安全和数据安全防护,保障必要的人员和资源投入,采取网络安全、数据安全管理和技术措施,确保反欺诈信息系统安全可控运行。


《办法》要求,金融监管总局及其派出机构定期对保险机构欺诈风险管理体系的健全性和有效性进行检查和评价,包括:网络安全、数据安全和个人信息保护情况。


《办法》要求,保险机构应建立反欺诈风险管理信息系统或将现有信息系统嵌入相关功能,做好业务要素数据内部标准与行业标准衔接,确保欺诈风险管理相关数据的真实、完整、准确、规范。保险机构应依法处理和使用消费者个人信息和行业数据信息,保证数据安全性和完备性。


《办法》要求,银保信公司、地方保险行业协会和反欺诈组织、保险机构等应严格遵守个人信息保护法律法规,加强个人信息全生命周期管理,建立信息收集、存储、使用、加工、传输、提供、删除等制度机制,明确信息使用用途和信息处理权责,严格管控信息使用的范围和权限。未经信息主体授权或法律法规许可,任何机构不得以书面形式、口头形式或者其他形式对外公开、提供个人信息。


18

让业务更安全!天融信发布AI时代一体化数据安全解决方案


天融信发布面向AI时代的一体化数据安全解决方案,包含天韧、天剑、天权、天盈、天享、天界六大部分,全面应对数据破坏、数据泄露、数据滥用三大安全风险,重点保障数据开发利用、数据交换共享及数据跨境流动三大典型价值释放场景,助力中小企业快速、全面、低成本解决数据安全问题,守护业务安全。



19

安全公司Cyber decacorn Wiz以3.5亿美元收购CDR公司Gem Security


网络安全独角兽 Wiz以 3.5 亿美元收购以色列初创公司 Gem Security,保护云环境免受黑客攻击的平台开发商。


Gem 开发了云检测和响应 (CDR) 平台,迄今为止已筹集了3400 万美元。去年 9 月,该公司在A轮融资中筹集了 2300 万美元。


Wiz 成立于 2020 年,为企业提供了一个用于扫描其云环境以查找网络安全问题平台。该软件会发现代码漏洞、可供更多用户访问的数据集以及其他弱点。此外,Wiz 可以发现黑客何时试图利用这些弱点发起网络攻击。


在推出平台一年半后,该公司披露其年度经常性收入已达到1亿美元。几周前,Wiz宣布,这个数字已经增加了两倍多,达到3.5亿美元。这家软件制造商获得了 9 亿美元的资金支持,超过 40% 的财富 100 强公司都是客户。


20

PVML筹集800万美元,以通过差分隐私技术保护对敏感数据的访问



PVML是一家以色列初创公司,正在使用人工智能技术来增强对组织最敏感数据的访问。该公司今天表示,已经完成了800万美元的种子轮融资。


这家初创公司创建了一个安全的数据访问平台,可以分析机器学习并将其应用于最敏感的数据。它的系统基于数学保证的私有输出的概念,通过在其计算中引入随机化来实现的。


通过其平台,PVML可以帮助公司连接、提供对多个数据源的访问并保证其隐私,这意味着即使是最敏感的数据也可以获得实时、实时的见解。


AI


21

百度智能体开发工具AgentBuilder:让每个人、每个组织都成为智能体的开发者


“未来,自然语言将成为新的通用编程语言,你只要会说话,就可以成为一名开发者,用自己的创造力改变世界。


4月16日,Create 2024百度AI开发者大会在深圳举办。百度创始人、董事长兼首席执行官李彦宏发表了题为《人人都是开发者》的主旨演讲。他认为,大模型和生成式AI将彻底改变开发者这个群体。


“AI正在掀起一场创造力革命,未来开发应用就像拍短视频一样简单,人人都是开发者,人人都是创造者。”


百度已经为开发者们准备好了三大“开箱即用”的工具,包括智能体开发工具AgentBuilder、AI原生应用开发工具AppBuilder、各种尺寸的模型定制工具ModelBuilder。“这三个工具,都代表了先进生产力。”


值得一提的是,李彦宏现场分享了百度在开发AI原生应用上的具体思路,并表示:“这是我们百度根据过去一年的实践,踩了无数的坑,交了高昂的学费换来的。”这三个开发AI原生应用的思路分别是:MoE、小模型和智能体。


会上,李彦宏正式发布了文心大模型4.0的工具版。他还透露,截至目前,文心一言用户数已经突破2亿。“文心大模型已成为中国领先、应用广泛的AI基础模型。”


得益于文心大模型的强大,开发者通过文心4.0降维裁剪出来的更小尺寸模型,明显要比直接拿开源模型调出来的,在同等尺寸下效果更好;同等效果下,成本明显更低。“大家以前用开源觉得便宜,其实在大模型场景下,开源是最贵的。所以开源模型会越来越落后。”


22

MistralAI首次推出 Mixtral 8x22B,迄今为止最强大的开源 AI 模型之一


近日,Mistral AI 公司宣布了一项重大突破:推出了其最新的大型语言模型 Mixtral 8x22B。这一模型以其令人瞩目的1760亿个参数和65,000个token的上下文长度,预示着人工智能领域的一次重大飞跃。


在人工智能的世界里,参数的数量往往是衡量模型能力的一个重要指标。而Mistral AI 的 Mixtral 8x22B 模型,无疑在这一指标上树立了新的标杆。该模型不仅在参数数量上超越了此前的 Mixtral 8x7B 模型,更在多项基准测试中超越了业界的其他重量级选手,如 Llama 2 70B 模型。


Mixtral 8x22B 采用了先进的专家混合(MoE)架构,这一架构的优势在于其能够在广泛的任务范围内实现高效的计算和性能提升。这种架构的设计,使得模型在处理复杂问题时更加得心应手,同时也为未来的AI应用开辟了新的可能性。


值得一提的是,尽管模型规模庞大,但每次前向传播仅需要大约440亿个活跃参数。这一设计不仅使得 Mixtral 8x22B 的使用更加便捷,也大幅降低了经济成本,使得更多的开发者和研究人员能够无障碍地探索和利用这一模型的潜力。


Mixtral 8x22B 的发布,不仅是开源人工智能领域的一个重要里程碑,更是 Mistral AI 对于推动合作和开放的AI生态环境的一次有力宣言。该模型宽松的 Apache 2.0 许可证,进一步强调了该公司致力于打破成本和访问权限障碍,促进AI技术的普及和发展。


23

马斯克xAI发布Grok-1.5,超越OpenAI的GPT-4V


埃隆-马斯克的人工智能初创公司 xAI 推出了 Grok-1.5V ,这是第一代多模态模型。除了强大的文本功能外,Grok 还能处理各种视觉信息,包括文档、图表、截图和照片。


Grok-1.5V 将很快提供给早期测试者和现有的 Grok 用户。


Grok-1.5V 的显著特点是能够理解真实世界的空间概念,在 RealWorldQA 基准测试中超过了其他模型--这是衡量一个模型对物理环境实际掌握程度的重要标准。


在与 GPT-4V、Claude 3 Sonnet、Claude 3 Opus 和 Gemini Pro 1.5 等领先模型的对比分析中,Grok-1.5V 在多项基准测试中都显示出了竞争优势,凸显了其多功能性和实力。


Grok-1.5V 的突出特点之一是能将复杂的视觉信息转化为可执行代码。例如,当给定一个描述猜谜游戏的流程图时,Grok-1.5V 可以轻松地将其转换为 Python 代码,展示了它在解决问题场景中的实际应用。


展望未来,Grok-1.5V 的开发人员预计,Grok-1.5V 在图像、音频和视频方面的多模态能力将得到显著提升,这预示着我们有望打造出有益的人工通用智能(AGI),全面了解宇宙并与之互动。


Grok-1.5V是继xAI最近推出的Grok-1.5之后的又一款产品,具有更强的推理能力和12.8万个标记的上下文长度。Grok-1.5 尤其在编码和数学相关任务方面有显著改进。它在 MMLU、GSM8K 和 HumanEval 等各种基准测试中均击败了 Mistral Large。


24

英特尔推出最新的人工智能芯片Gaudi 3,三大优势与英伟达竞争升温


4月9日,英特尔推出了其最新的人工智能芯片Gaudi 3。这家芯片制造商急于生产可以训练和部署大型AI模型的半导体,例如支持OpenAI的ChatGPT的模型。


新的 Gaudi 3 芯片的能效是英伟达前一代产品H100 GPU的两倍多,并且可以比H100 GPU 快一倍半。同时Gaudi 3 还有不同的配置,例如在一块主板上捆绑八个 Gaudi 3 芯片或可以插入现有系统的卡。


英特尔在Meta 的开源 Llama 和阿布扎比支持的 Falcon 等模型上测试了该芯片。Gaudi 3可以帮助训练或部署模型,包括Stable Diffusion或OpenAI的Whisper语音识别模型。


英特尔表示,其芯片使用的功率低于英伟达的芯片。


据估计,英伟达拥有80%的AI芯片市场,其图形处理器(GPU)在过去一年中一直是AI构建者的首选高端芯片。




扫码关注




END



文章转载自Hadoop大数据应用,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论