Alibaba ATH的AI音乐模型,一行文字生成含歌词、演唱和编曲的完整歌曲
Happy Shrimp是阿里巴巴ATH于2026年8月17日推出的AI音乐模型。该模型将音乐视为具有自身语法、语义和上下文的语言,能够将歌词、旋律、编曲和演唱统筹规划,实现端到端的完整曲目生成,无需分别拼凑各个部分。它理解专业音乐术语和日常语言,支持强大的提示控制。产品处于公开测试阶段,与太合音乐集团建立战略合作伙伴关系,并在2026阿那亚虾米音乐节上亮相。价格方面,提供免费层级,也有不同功能和时长的付费套餐可供选择,定位为满足用户轻松创作完整音乐的需求。
快速、准确、私密的语音转文字工具,支持多平台及AI工作流
Aqua Voice是一款语音转文字工具,支持Mac、Windows、iPhone等多平台及AI工作流。其主要优点是快速、准确、私密,能将语音实时转化为清晰文本。产品背景在于满足人们摆脱传统键盘输入,提高输入效率的需求。页面未提及价格信息。该产品定位为提高用户生产力,让用户告别打字,通过语音完成各种文本输入工作。
全球最快语音转文字API,低延迟,跨语言方言,速度与精准度兼备。
Pulse是Smallest.ai推出的一款语音转文字API,其核心技术在于能够以低于70毫秒的超低延迟对全球各种口音、语言和方言进行实时转录,且不损失准确性。该产品定位为满足不同行业对语音转录的高效、精准需求,适用于医疗、法律、金融、媒体、客户支持和企业等多个领域。价格方面,提供按需付费的模式,无月承诺,可随使用量扩展。其主要优点包括行业领先的准确率和速度,在30种语言中实现最低的单词错误率,还具备自动说话人标签、实时情感分析和语言识别等附加功能。
免费图像和文字转3D模型生成器,无需注册,一分钟出结果。
Meshy AI是一款免费的在线工具,可将图像或文字提示转化为带纹理的3D模型。它的重要性在于为3D模型制作提供了便捷、高效的解决方案,降低了制作门槛。主要优点包括完全免费、无需注册、生成速度快,支持多种格式导出。背景是基于多个开源AI模型开发,有Microsoft TRELLIS 2、Tencent Hunyuan3D 2.1等。产品定位是面向广大3D创作者,提供一个快速、易用的3D模型生成平台。
AI 3D 模型生成器,可从文字和图片生成可打印 3D 模型。
Crisp3D 是一款专为 3D 打印打造的 AI 3D 工作室。其重要性在于简化了 3D 模型生成流程,让无 3D 建模经验的用户也能轻松创建模型。主要优点包括无需复杂建模技能、提供完整的 3D 打印工具集、集成多种 AI 模型、可直连切片软件等。产品背景方面,它满足了 3D 打印创作者将创意快速转化为实物的需求。价格方面,文中未详细说明,但提到付费用户可将生成模型用于商业项目,推测有付费模式。定位是服务于 3D 打印相关的各类人群,如爱好者、专业设计师等。
将播客和YouTube视频转为可搜索文字稿,还能生成摘要、导图等。
Readpodcast AI是一款基于网页的生产力工具,可将Spotify、Apple Podcasts播客单集或YouTube视频转换为带时间戳和说话人识别的可搜索文字稿。其重要性在于帮助用户更高效地从音频和视频内容中获取信息。主要优点包括支持多种语言、提供AI摘要、关键要点、精彩金句和思维导图,还能基于完整文稿与AI对话。产品背景是为了满足人们从播客和视频学习的需求。价格方面,有免费套餐每月提供150积分,也有Lite、Standard、Pro等付费订阅方案,适合不同使用频率和需求的用户。
免费创建带声音视频,输入想法或图片,几分钟获电影级AI视频
MiniMax H3是一款真正的多模态AI视频生成器,专为实际制作工作构建。它能将文字、图片、音频和视频片段转化为电影级视频,一次性理解所有参考素材。其优势在于多模态参考、精确编辑和商业级输出,能将任意参考素材融合到一个镜头中,通过自然语言指令进行编辑,以清晰的1440p分辨率配合原生立体声输出商业级成品。该产品支持免费试用,付费方面有年度计划五折优惠活动。它定位为满足各类创作者需求,无论是内容创作、营销推广还是专业影视制作等场景都适用。
将视频和音频转为可搜索、学习、总结、翻译的定时文本
Transcript Video是一款基于网页的工具,可将YouTube视频、普通视频和音频转化为可搜索的定时文本。其重要性在于帮助用户更高效地处理音视频内容,节省时间和精力。主要优点包括支持多种输入源、可生成多种学习资料、具备翻译功能等。产品有免费和付费计划,定位为帮助用户将音视频内容转化为知识资产,适用于学习、研究、内容创作等场景。
線上學習平台,含雅思、多益等課程,用AI校正口語和寫作
智慧學習備考平台是PREPEDU推出的線上學習平台,提供雅思、多益等考試的線上課程。平台運用獨家Prep Edu AI技術,通過虛擬房間技術讓用戶進行口語和寫作練習,並利用先進的AI進行校正。其重要性在於打破了時間和空間的限制,讓用戶可以在家進行模擬考試和學習。平台的主要優點包括提供個人化學習路徑、有大量的練習題目和測驗、AI校正精準、有學習進度追蹤功能等。價格方面,雅思考試費用台灣地區不同類型考試有所不同,如IELTS Academic與General Training為NT 8300元,IELTS for UKVI為NT 9100元;香港地區皆為HKD 2685元。平台定位於幫助學生提升英語能力,順利通過各類英語考試。
免费开源桌面AI语音输入应用,支持多语言和上下文写作
OpenTypeless是一款免费开源的桌面端AI语音输入应用,它支持多达99种语言,具有多提供商语音转文字、AI文本润色等功能。其重要性在于为用户提供便捷的语音输入方式,提高写作效率。该应用可用于邮件、聊天、文档和技术工作等场景,支持多种主流AI提供商,无供应商锁定问题。价格方面完全免费,定位是为需要高效语音输入和文本处理的用户提供解决方案。
在线免费AI图像文本编辑器,无损替换图片文字,保留字体等属性。
EditTextImage是一款在线AI工具,无需Photoshop或设计技能即可编辑图片中的文字。其重要性在于为用户提供了便捷的文字编辑解决方案,能节省时间和成本。主要优点包括:保持原始字体、颜色、大小和透视不变;处理速度快,平均12秒完成编辑;输出2K分辨率结果。产品背景是满足用户在各种场景下对图片文字编辑的需求。价格方面,有不同的套餐可供选择,如9.90美元30个信用点、19.90美元66个信用点、29.90美元120个信用点,且新用户注册可获得1个免费信用点。定位是面向有图片文字编辑需求的各类用户,无论是个人还是工作室。
Claude Code高级语音听写,速达4倍,转录快,14天免费试用。
VoiceAppear是由Veni Vidi Validus GmbH开发的桌面听写应用,支持Windows和macOS系统。它可以将语音输入转换为文字,尤其适用于Claude Code CLI,能让用户更快地编写提示信息。其主要优点包括:输入速度比打字快达4倍,转录时间不到500毫秒;自动格式化命令和变量;支持超过100种语言和口音;可从任何应用程序开始听写。产品提供14天免费试用,无需信用卡。它的定位是提高开发者和文字工作者的输入效率,减少打字时间,加速项目输出。
Windows系统级AI语音听写、文本与图像处理软件,免费使用。
MachinesFluent是一款专为Windows系统设计的AI软件,提供系统级的听写、文本处理和图像处理功能。它具有多个语音引擎,支持通过BYOK连接各大AI提供商,可离线或基于云运行。该产品定位为提高工作效率,让用户通过语音输入替代打字。价格方面,提供免费版本,包含无限本地听写、4种免费本地语音模型等;也有付费的Pro版本,分终身制(79美元)和月付制(9美元),提供更多高级AI和云转录功能。
Tripo AI 3D 模型生成器可将文本和图片几秒内转为可用于生产的3D模型。
Tripo AI 3D 模型生成器是一款在线的AI 3D模型生成工具,集成在一个流畅的工作流程中,能将文字、图片或草图快速转化为可用于生产的3D资产。其主要优点在于速度快,能将数小时的人工3D作业缩短至秒级完成;成本低,借助智能算法提高效率从而降低成本;功能强大,具备文字和图片生成3D模型、智能分割、AI纹理、绑骨与动画等多种功能。产品背景是为了满足创意行业对于高效3D建模的需求。该产品提供免费试用,无需注册,支持导出GLB/STL/OBJ格式,用于游戏和3D打印等领域,定位是为全球创作者提供更智能、更简化的3D建模解决方案。
StrikeScribe是一款AI语音转文字和会议转录软件,支持100多种语言。
StrikeScribe是一款专注于语音转文字和会议转录的AI软件。其重要性在于能够高效、准确地将语音内容转化为文字,节省人工记录的时间和精力。主要优点包括无需注册即可上传转录、无会议机器人干扰、支持100多种语言以及提供AI洞察。产品背景方面,它为解决会议记录、音频视频转录等场景的需求而开发。价格方面,提供免费的访客上传功能,还有免费套餐和付费计划,付费计划可享受无限转录和AI洞察。定位是为需要高效转录服务的个人和企业提供解决方案。
免費AI唇語同步影片產生器,無需錄音,幾秒生成逼真影片。
Lip Sync AI 是一款免費的線上影片生成器,利用先進的AI技術實現音訊與影片中口部和面部動作的同步。其重要性在於能夠幫助創作者輕鬆製作引人入勝的影片,無需動畫技能。主要優點包括超流暢唇形同步、支援多角色和多語言、零技能門檻、免費試用且無浮水印等。該平台適用於廣告、社群、線上學習等多種場景。新使用者可免費試用,匿名存取享有1次免費生成,登入使用者每天獲得50積分,每24小時重置,無需預付即可日常使用。
Veo 4 AI是由谷歌驱动的视频生成与编辑器,可创建高质量视频。
Veo 4 AI是一个AI视频生成平台,由谷歌提供支持。它为用户提供了一个专注的工作空间,可从书面提示、图像参考、脚本、语音想法和创意方向中创建视频概念。其主要优点包括操作简单,能让用户在不依赖复杂制作流程的情况下,快速将早期想法转化为成熟的视频概念。该平台适用于创作者、营销人员、电商品牌、代理商、开发者和企业等。关于价格,页面提到有免费访问,具体付费模式未详细说明。
© 2026 AIbase 备案号:闽ICP备08105208号-14