ESP-GMF v1.0 正式发布:一站式构建音视频与 AI 应用

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
ESP-GMF v1.0 正式发布:一站式构建音视频与 AI 应用
7457点击    2026-07-31 01:30

ESP-GMF v1.0 正式发布:一站式构建音视频与 AI 应用


乐鑫信息科技 (688018.SH) 正式发布 ESP-GMF (General Multimedia Framework) v1.0,这是 ESP-GMF 首个官方正式版本,也是乐鑫多媒体软件生态发展的重要里程碑。


💡 什么是 ESP-GMF?


ESP-GMF 是一套面向乐鑫 SoC 的统一多媒体开发框架,通过统一的数据流模型、组件体系和开发架构,将音频、视频及 AI 多媒体能力整合到同一平台,为开发者提供更加高效、灵活且易扩展的开发体验。


相较于此前主要聚焦音频应用的 ESP-ADF (Audio Development Framework),ESP-GMF 在架构设计、硬件支持范围以及代码复用能力等方面进行了全面升级,可覆盖从音频播放、录音,到 AI 语音、视频通话、蓝牙音频、图像渲染等丰富应用场景。


✨ 构建统一


多媒体软件平台


随着音频、视频及 AI 应用不断融合,多媒体开发正朝着更加复杂、多样化的方向发展。


ESP-GMF 通过统一的软件架构,将乐鑫原本分散的多媒体能力进行了整合,构建起统一的数据流 (Data Stream) 模型、模块化组件体系以及可扩展的 Pipeline 架构,为音频、视频及 AI 多媒体应用提供一致的开发方式。开发者无需在多个框架之间切换,即可在同一开发体系中完成不同类型多媒体应用的开发,大幅降低学习成本,提高代码复用率。


与此同时,乐鑫同步构建了 ESP Multimedia Core。作为 ESP-GMF 的底层能力支撑,ESP Multimedia Core 将媒体协议、音视频编解码器、音频算法及图像处理算法等基础能力统一沉淀为底层库,为 ESP-GMF 及未来更多多媒体产品提供长期稳定的软件基础,并将持续伴随乐鑫多媒体生态不断演进。


📖 ESP-GMF v1.0


首个 API 稳定版本


ESP-GMF v1.0 是框架首个 API Stable 官方版本。本次发布统一了此前多个开发版本,将所有官方组件升级至 1.0.x,意味着后续版本将在保持 API 稳定性的基础上持续演进,更适合产品开发与长期维护。此次版本主要带来了以下更新:


全部官方组件升级至 1.0.x


所有官方组件均完成正式版本发布,公共 API 已趋于稳定,为产品开发提供长期兼容保障。


新增四大核心模块


ESP-GMF v1.0 新增多个关键能力模块,包括:


  • esp_player:全新的嵌入式多媒体播放器,支持解复用、解码、音视频渲染及 Seek。
  • esp_asrc:音频采样率转换模块,可完成采样率、位深及声道转换,支持软硬件协同加速。
  • esp_video_render:视频与 UI 渲染模块,支持多显示后端、双路视频流、Overlay 及 Widget 系统。
  • gmf_fft:固定点 FFT/IFFT 运算模块,支持 ESP32-S31、ESP32-P4、ESP32-S3 等芯片硬件加速。


🎸 多媒体能力


进一步完善


结合新增组件,ESP-GMF v1.0 构建起一套完整的音频、视频、多模态 AI 及蓝牙多媒体能力体系,形成覆盖内容采集、处理、播放、渲染与传输的统一功能接口,为开发者提供更加完整、高效的多媒体开发体验。


ESP-GMF v1.0 正式发布:一站式构建音视频与 AI 应用


  • ESP Capture 提供统一的音视频采集入口,集成设备接入、格式转换、编码、图像处理、Overlay、同步及复用等能力,并支持自动协商、并行流传输和本地存储,可广泛应用于多模态 AI、WebRTC、直播推流及远程监控等场景。
  • ESP Player 提供从解封装、解码到音视频渲染的一站式播放能力,支持本地文件、HTTP(S)、HLS 等多种媒体源,并集成音视频同步、播放控制、Seek 和倍速播放等功能,帮助开发者快速构建稳定流畅的多媒体播放应用。
  • ESP Audio Simple Player 提供轻量级纯音频播放方案,支持 MP3、AAC、FLAC、WAV、Opus 等主流格式以及多种音源,并可自动完成解码和音频格式转换,让应用以更低资源开销实现高效音频播放。
  • ESP Video Render 提供高性能视频合成与显示能力,支持多路视频流、Overlay UI、一体化渲染以及 LCD、LVGL 等显示后端,可满足视频播放器、智能显示、机器人及摄像头预览等应用需求。
  • ESP Audio Render 面向多路音频融合与高品质输出,支持 PCM 混音、音效处理及后处理能力,可灵活实现背景音乐与 TTS 混播、通知音叠加及语音交互等典型场景。
  • ESP BT Audio 统一整合经典蓝牙与 LE Audio 能力,支持 A2DP、HFP、AVRCP、BAP、TMAP 等协议,并可无缝接入 ESP-GMF 流水线。开发者还可结合官方提供的基础蓝牙音频例程,快速体验 LE Audio、Auracast 等典型应用,加快蓝牙音频产品开发。


🪄 面向多款乐鑫 SoC


持续优化


ESP-GMF v1.0 持续针对 ESP32-S31、ESP32-P4 和 ESP32-S3 等乐鑫 SoC 进行优化。其中,ESP32-S31 新增 V4L2 摄像头支持,并支持 MJPEG 转 RGB 解码、多区域视频 Overlay、音视频渲染示例以及 FFT、PPA 硬件加速等能力,为 AI 摄像头、智能显示、人机交互终端等应用提供更加完善的开发支持。


此外,新版本还进一步优化了开发工具链。esp_board_manager 已独立为单独组件,示例工程统一采用 esp-bmgr-assist python 包管理开发板资源,使不同项目之间的配置方式更加一致,进一步提升开发效率。


立即体验 ESP-GMF v1.0


ESP-GMF v1.0 已正式开源,开发者可前往 ESP-GMF GitHub 仓库获取源码,并结合官方文档、完整版本更新说明和乐鑫通用多媒体框架指南,快速体验统一多媒体开发框架带来的音频、视频及 AI 多媒体开发能力。如果您想了解更多技术细节,可以查看 ESP-GMF 技术博客。


欢迎开发者体验并通过 GitHub Issue 或乐鑫开发者社区分享反馈,与我们共同完善 ESP-GMF 多媒体开发生态。


项目地址:https://github.com/espressif/esp-gmf/blob/main/README_CN.md



文章来自于微信公众号 “乐鑫朋友圈”,作者 “乐鑫朋友圈”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales