需求人群:
["开发者:对于开发者而言,EvoForge的前沿编码功能能帮助他们高效地进行代码编写、审查和调试。其原创内核和丰富的本地工具,如能读取任何文档、驱动浏览器和桌面、保持持久的shell会话等,为开发者提供了一个强大的本地开发环境。此外,系统的技能拓展能力也有助于开发者将成功的开发经验转化为新的技能,提高开发效率。", "创作者:包括电影制作人、音乐创作者、图像设计师等。他们可以利用EvoForge的多模态输入输出功能,实现从创意到作品的快速转化。导演控制台为电影创作提供了便捷的方式,能生成镜头、编排时间线等;图像和音乐生成功能则满足了创作者在视觉和听觉方面的创意需求。", "金融从业者:EvoForge内置的金融相关技能,如股票评估、股权基本面分析、DCF估值等,能帮助金融从业者进行更准确的市场分析和决策。此外,DEX套利设计等功能也为他们在数字货币领域的投资和交易提供了支持。"]
使用场景示例:
开发者使用EvoForge进行项目开发,利用其前沿编码功能和本地工具,高效完成代码编写和调试工作,同时通过技能拓展功能将成功的开发经验转化为新技能,提高后续开发效率。
电影制作人通过EvoForge的导演控制台进行电影创作。输入创作概要后,系统自动生成镜头、旁白和音乐,制作人在多轨道时间线上进行调整和编辑,最终导出高质量的电影作品。
金融从业者利用EvoForge内置的金融技能,对股票市场进行分析和评估。通过股票评估、DCF估值等功能,制定合理的投资策略,提高投资收益。
产品特色:
前沿编码:基于原创内核进行前沿水平的编码工作,具备工具表面上下文引擎、内存管理、审批机制、沙箱编排等功能,所有这些都用Rust语言构建,能从内核层面保障高效、稳定的代码编写和运行。
多模态输入输出:支持视觉、听觉、文本、图像、语音、音乐和视频等多种模态的输入和输出。例如,它可以理解图片、音频、视频、文本等内容,并能生成相关的图片、语音、音乐、视频等,且每个模态的处理都是基于本地原生能力,并非简单的插件拼凑。
导演控制台:用户可以通过导演控制台进行电影创作。输入创作概要,系统就能生成成品电影。在创作过程中,用户可以控制旁白、生成镜头、安排多轨道时间线,进行镜头替换、音乐调整、撤销操作和导出等,实现与智能体共同创作的功能。
技能拓展:内置54种原创技能,这些技能来自真实项目和参考代码。并且,系统能够根据成功的工作轨迹提炼出新的技能,新技能经过比较和回归测试后可得到推广应用。
多方式任务协调:提供Lead和Swarm两种任务协调方式。通过Lead模式可以分配工作,在Swarm模式下,各个专家可以从共享任务板中认领任务,并使用租赁和同行备注来管理任务。
使用教程:
步骤1:访问产品官网https://evoforge.cc/,下载适用于Windows或macOS系统的EvoForge桌面客户端。
步骤2:安装下载好的客户端程序,完成安装后启动EvoForge。
步骤3:根据自身需求选择相应的功能模块。例如,若要进行编码工作,可使用前沿编码功能;若要创作电影,可打开导演控制台。
步骤4:在使用过程中,根据系统提示输入必要的信息或指令。如在导演控制台中输入电影创作概要,在前沿编码功能中输入代码等。
步骤5:对系统生成的结果进行审查和调整。例如,在电影创作中对生成的镜头、旁白和音乐进行修改,在编码工作中对生成的代码进行调试和优化。
步骤6:完成所有操作后,根据需求导出最终结果,如导出电影作品、保存代码文件等。
浏览量:0
个人AGI,有原创内核,支持多模态,内置54种技能,可本地运行。
EvoForge是一款可在本地计算机运行的个人AGI。其核心优势在于拥有原创的代理内核,而非基于他人命令行的外壳程序,采用前沿编码技术,由内核层面构建,使用Rust语言编写,确保了在各个层级的高效运行和处理能力。它支持多种模态的输入输出,包括视觉、听觉、文本、图像、语音、音乐和视频等,还配备导演控制台,方便用户创作电影,同时内置54种原创技能并能自我拓展。产品定位为满足个人用户在多种领域的智能化生产力需求,文档未提及价格信息。
前沿的多模态大型语言模型
NVLM-D-72B是NVIDIA推出的一款多模态大型语言模型,专注于视觉-语言任务,并且通过多模态训练提升了文本性能。该模型在视觉-语言基准测试中取得了与业界领先模型相媲美的成绩。
Fotol AI是强大AI解决方案的终极中心,提供AGI技术和服务。
Fotol AI是一个提供AGI技术和服务的网站,致力于为用户提供强大的人工智能解决方案。其主要优点包括先进的技术支持、丰富的功能模块和广泛的应用领域。Fotol AI的定位为成为用户探索AGI的首选平台,并为用户提供灵活多样的AI解决方案。
前沿级多模态大型语言模型
NVLM 1.0是NVIDIA ADLR推出的前沿级多模态大型语言模型系列,它在视觉-语言任务上达到了业界领先水平,与顶级专有模型和开放访问模型相媲美。该模型在多模态训练后,甚至在纯文本任务上的准确性上也有所提高。NVLM 1.0的开源模型权重和Megatron-Core训练代码为社区提供了宝贵的资源。
多模态12B参数模型,结合视觉编码器处理图像和文本。
Pixtral-12B-2409是由Mistral AI团队开发的多模态模型,包含12B参数的多模态解码器和400M参数的视觉编码器。该模型在多模态任务中表现出色,支持不同尺寸的图像,并在文本基准测试中保持最前沿的性能。它适用于需要处理图像和文本数据的高级应用,如图像描述生成、视觉问答等。
多模态大型语言模型,支持图像和文本处理。
Llama-3.2-11B-Vision 是 Meta 发布的一款多模态大型语言模型(LLMs),它结合了图像和文本处理的能力,旨在提高视觉识别、图像推理、图像描述和回答有关图像的一般问题的性能。该模型在常见的行业基准测试中的表现超过了众多开源和封闭的多模态模型。
Grok 4是xAI推出的革命性AI模型,具备先进的推理能力、多模态功能和专业编码特性。
Grok 4是xAI推出的最新版本大型语言模型,于2025年7月正式发布。它具有领先的自然语言、数学和推理能力,是顶级模型AI。Grok 4代表了巨大的进步,跳过了预期的Grok 3.5版本,以在激烈的AI竞争中加快进展。
前沿级多模态AI模型,提供图像和文本理解
Pixtral Large是Mistral AI推出的一款前沿级多模态AI模型,基于Mistral Large 2构建,具备领先的图像理解能力,能够理解文档、图表和自然图像,同时保持Mistral Large 2在文本理解方面的领先地位。该模型在多模态基准测试中表现优异,特别是在MathVista、ChartQA和DocVQA等测试中超越了其他模型。Pixtral Large在MM-MT-Bench测试中也展现了竞争力,超越了包括Claude-3.5 Sonnet在内的多个模型。该模型适用于研究和教育用途的Mistral Research License (MRL),以及适用于商业用途的Mistral Commercial License。
首个多模态 Mistral 模型,支持图像和文本的混合任务处理。
Pixtral 12B 是 Mistral AI 团队开发的一款多模态 AI 模型,它能够理解自然图像和文档,具备出色的多模态任务处理能力,同时在文本基准测试中也保持了最先进的性能。该模型支持多种图像尺寸和宽高比,能够在长上下文窗口中处理任意数量的图像,是 Mistral Nemo 12B 的升级版,专为多模态推理而设计,不牺牲关键文本处理能力。
大型多模态模型,处理多图像、视频和3D数据。
LLaVA-NeXT是一个大型多模态模型,它通过统一的交错数据格式处理多图像、视频、3D和单图像数据,展示了在不同视觉数据模态上的联合训练能力。该模型在多图像基准测试中取得了领先的结果,并在不同场景中通过适当的数据混合提高了之前单独任务的性能或保持了性能。
消除幻觉,多模态RAG不忘信息,智能编排前沿模型,任务表现卓越
Sup AI是一款AI平台,具备实时对数概率置信度评分消除幻觉、多模态检索增强生成(RAG)避免遗忘、智能编排前沿模型等功能。其主要优点在于能在各种任务中展现绝对优势,适用于全球用户。产品于2025年创立,总部位于美国加利福尼亚州山景城。提供多种价格方案,包括免费计划供学生和普通用户使用,Plus计划面向开发者,Pro计划针对高级用户,Super计划适用于研究人员和团队。
多模态图像生成模型
Instruct-Imagen是一个多模态图像生成模型,通过引入多模态指令,实现对异构图像生成任务的处理,并在未知任务中实现泛化。该模型利用自然语言整合不同的模态(如文本、边缘、风格、主题等),标准化丰富的生成意图。通过在预训练文本到图像扩散模型上进行两阶段框架的微调,采用检索增强训练和多样的图像生成任务微调,使得该模型在各种图像生成数据集上的人工评估结果表明,其在领域内与先前的任务特定模型相匹配或超越,并展现出对未知和更复杂任务的有希望的泛化能力。
Google DeepMind旗舰多模态AI,1M上下文,具备博士级推理与高级编码能力
Gemini 3 Pro是Google DeepMind基于Transformer架构构建的多模态基础模型。其重要性在于为各领域提供强大的AI支持,能处理多种类型的输入和输出。主要优点包括博士级推理能力、100万输入token的长上下文处理、多模态深度理解、智能编码和动态思维等。产品背景是Google为满足复杂任务需求而研发。价格方面,API输入2美元/100万token,输出12美元/100万token(≤200k token多模态价格不同),Google AI Plus月费19.99美元可获得应用和Workspace试用机会。定位是用于代理任务和“氛围编码”等复杂智能任务的高端模型。
VideoLLaMA3是前沿的多模态基础模型,专注于图像和视频理解。
VideoLLaMA3是由DAMO-NLP-SG团队开发的前沿多模态基础模型,专注于图像和视频理解。该模型基于Qwen2.5架构,结合了先进的视觉编码器(如SigLip)和强大的语言生成能力,能够处理复杂的视觉和语言任务。其主要优点包括高效的时空建模能力、强大的多模态融合能力以及对大规模数据的优化训练。该模型适用于需要深度视频理解的应用场景,如视频内容分析、视觉问答等,具有广泛的研究和商业应用潜力。
多模态大型模型,处理文本、图像和视频数据
Valley是由字节跳动开发的尖端多模态大型模型,能够处理涉及文本、图像和视频数据的多种任务。该模型在内部电子商务和短视频基准测试中取得了最佳结果,比其他开源模型表现更优。在OpenCompass测试中,与同规模模型相比,平均得分大于等于67.40,在小于10B模型中排名第二。Valley-Eagle版本参考了Eagle,引入了一个可以灵活调整令牌数量并与原始视觉令牌并行的视觉编码器,增强了模型在极端场景下的性能。
多模态大型模型,处理文本、图像和视频数据
Valley-Eagle-7B是由字节跳动开发的多模态大型模型,旨在处理涉及文本、图像和视频数据的多种任务。该模型在内部电子商务和短视频基准测试中取得了最佳结果,并在OpenCompass测试中展现出与同规模模型相比的卓越性能。Valley-Eagle-7B结合了LargeMLP和ConvAdapter构建投影器,并引入了VisionEncoder,以增强模型在极端场景下的性能。
智能编码助手,提升开发效率
通义灵码是一款专为开发者设计的智能编码助手,支持多种开发环境,包括JetBrains IDEs、Visual Studio Code、Visual Studio等。它通过集成先进的AI技术,帮助开发者快速完成编码任务,提高编码效率和质量,适用于各种编程语言和开发场景。
多模态视觉语言模型
MouSi是一种多模态视觉语言模型,旨在解决当前大型视觉语言模型(VLMs)面临的挑战。它采用集成专家技术,将个体视觉编码器的能力进行协同,包括图像文本匹配、OCR、图像分割等。该模型引入融合网络来统一处理来自不同视觉专家的输出,并在图像编码器和预训练LLMs之间弥合差距。此外,MouSi还探索了不同的位置编码方案,以有效解决位置编码浪费和长度限制的问题。实验结果表明,具有多个专家的VLMs表现出比孤立的视觉编码器更出色的性能,并随着整合更多专家而获得显著的性能提升。
多模态AI模型,图像理解与生成兼备
Mini-Gemini是由香港中文大学终身教授贾佳亚团队开发的多模态模型,具备精准的图像理解能力和高质量的训练数据。该模型结合图像推理和生成,提供不同规模的版本,性能与GPT-4和DALLE3相媲美。Mini-Gemini采用Gemini的视觉双分支信息挖掘方法和SDXL技术,通过卷积网络编码图像并利用Attention机制挖掘信息,同时结合LLM生成文本链接两个模型。
统一多模态视频生成系统
UniVG是一款统一多模态视频生成系统,能够处理多种视频生成任务,包括文本和图像模态。通过引入多条件交叉注意力和偏置高斯噪声,实现了高自由度和低自由度视频生成。在公共学术基准MSR-VTT上实现了最低的Fr'echet视频距离(FVD),超越了当前开源方法在人类评估上的表现,并与当前闭源方法Gen2不相上下。
先进的多模态大型语言模型
InternVL2_5-2B-MPO是一个多模态大型语言模型系列,展示了卓越的整体性能。该系列基于InternVL2.5和混合偏好优化构建。它集成了新增量预训练的InternViT与各种预训练的大型语言模型,包括InternLM 2.5和Qwen 2.5,使用随机初始化的MLP投影器。该模型在多模态任务中表现出色,能够处理包括图像和文本在内的多种数据类型,适用于需要理解和生成多模态内容的场景。
前沿级多模态大型语言模型,实现视觉-语言任务的先进性能。
NVLM 1.0是一系列前沿级的多模态大型语言模型(LLMs),在视觉-语言任务上取得了与领先专有模型和开放访问模型相媲美的先进成果。值得注意的是,NVLM 1.0在多模态训练后,其文本性能甚至超过了其LLM主干模型。我们为社区开源了模型权重和代码。
InternVL3开源:7种尺寸覆盖文、图、视频处理,多模态能力扩展至工业图像分析
InternVL3是由OpenGVLab开源发布的多模态大型语言模型(MLLM),具备卓越的多模态感知和推理能力。该模型系列包含从1B到78B共7个尺寸,能够同时处理文字、图片、视频等多种信息,展现出卓越的整体性能。InternVL3在工业图像分析、3D视觉感知等领域表现出色,其整体文本性能甚至优于Qwen2.5系列。该模型的开源为多模态应用开发提供了强大的支持,有助于推动多模态技术在更多领域的应用。
多模态原生混合专家模型
Aria是一个多模态原生混合专家模型,具有强大的多模态、语言和编码任务性能。它在视频和文档理解方面表现出色,支持长达64K的多模态输入,能够在10秒内描述一个256帧的视频。Aria模型的参数量为25.3B,能够在单个A100(80GB)GPU上使用bfloat16精度进行加载。Aria的开发背景是满足对多模态数据理解的需求,特别是在视频和文档处理方面。它是一个开源模型,旨在推动多模态人工智能的发展。
情感丰富的多模态语言模型
EMOVA(EMotionally Omni-present Voice Assistant)是一个多模态语言模型,它能够进行端到端的语音处理,同时保持领先的视觉-语言性能。该模型通过语义-声学解耦的语音分词器,实现了情感丰富的多模态对话,并在视觉-语言和语音基准测试中达到了最先进的性能。
最强大的代理和编码模型,具备最佳的多模态理解能力。
Gemini 3 Pro Preview 是 Google 最新推出的最强大模型,旨在解决复杂的代理问题,具备强大的编码能力和先进的推理能力。该模型相较于之前的版本,在复杂指令跟随方面有显著改进,输出效率更高。它具有 1M 的上下文窗口和多模态理解能力,适用于各种数据类型的输入,如音频、图像、视频、文本和 PDF。
© 2026 AIbase 备案号:闽ICP备08105208号-14