EzAudio – 腾讯联合约翰霍普金斯大学推出的文本到音频生成模型
EzAudio是由约翰霍普金斯大学和腾讯AI实验室共同推出的...
PaliGemma 2是Google DeepMind基于Gemma 2语言模型家族推出的新一代视觉语言模型(VLM),作为PaliGemma模型的升级版。结合SigLIP-So400m视觉编码器和不同规模的Gemma 2模型,支持多种分辨率,基于多阶段训练具备广泛的知识迁移能力。PaliGemma 2在多种学术任务上表现出色,尤其在大型模型和高分辨率配置下性能显著,同时在OCR、音乐乐谱识别和医学图像报告生成等新领域也取得了突破。
官网:https://huggingface.co/collections/google/paligemma-2-release-67500e1e1dbfdd4dee27ba48