产品库

Berkeley Function-Calling Leaderboard（伯克利函数调用排行榜）是一个专门用来评估大型语言模型（LLMs）准确调用函数（或工具）能力的在线平台。该排行榜基于真实世界数据，定期更新，提供了一个衡量和比较不同模型在特定编程任务上表现的基准。它对于开发者、研究人员以及对AI编程能力有兴趣的用户来说是一个宝贵的资源。

AI评估编程

Open LLM Leaderboard

开放的大型语言模型排行榜

Open LLM Leaderboard是一个由Hugging Face提供的空间，旨在展示和比较各种大型语言模型的性能。它为开发者、研究人员和企业提供了一个平台，可以查看不同模型在特定任务上的表现，从而帮助用户选择最适合自己需求的模型。

大型语言模型性能比较

hallucination-leaderboard

一个用于比较大型语言模型在总结短文档时产生幻觉的排行榜。

该产品是一个由Vectara开发的开源项目，用于评估大型语言模型（LLM）在总结短文档时的幻觉产生率。它使用了Vectara的Hughes幻觉评估模型（HHEM-2.1），通过检测模型输出中的幻觉来计算排名。该工具对于研究和开发更可靠的LLM具有重要意义，能够帮助开发者了解和改进模型的准确性。

LLM 幻觉检测

SuperCLUE

领先的AI评测基准，衡量和比较AI模型性能。

SuperCLUE是一个用于评估和比较大型语言模型性能的在线平台。它提供了多种任务和排行榜，旨在为AI研究者和开发者提供一个标准化的测试环境。SuperCLUE支持各种AI应用场景，包括数学推理、代码生成、超长文本处理等，能够帮助用户准确评估模型在不同任务上的表现和能力。

中文精选

AI评测模型性能

LMSYS Chatbot Arena Leaderboard

大型语言模型 (LLM) 性能评测的众包开放平台

LMSys 聊天机器人竞技场排行榜是一个用于评估大型语言模型 (LLM) 性能的众包开放平台。它利用 Elo 排名系统对 LLM 进行排名，排名依据是超过 30 万用户投票的结果。用户可以在网站上与不同的 LLM 进行互动，并根据其对话质量进行投票。该排行榜可用于追踪不同 LLM 的发展趋势，并为研究人员和开发者提供基准测试工具。

大型语言模型 (LLM)自然语言处理 (NLP)

AITopRank

发现2024年最佳AI工具

AI Top Rank是一个专注于AI工具发现和推广的平台，旨在帮助用户发现和使用最新的AI工具，促进AI技术的普及和应用。平台提供每周更新的AI工具排行榜，用户可以投票支持自己喜爱的工具，也可以提交自己的AI工具进行推广。

国外精选

AI 工具

Prometheus-Eval

用于评估其他语言模型的开源工具集

Prometheus-Eval 是一个用于评估大型语言模型（LLM）在生成任务中表现的开源工具集。它提供了一个简单的接口，使用 Prometheus 模型来评估指令和响应对。Prometheus 2 模型支持直接评估（绝对评分）和成对排名（相对评分），能够模拟人类判断和专有的基于语言模型的评估，解决了公平性、可控性和可负担性的问题。

开源语言模型

versy

利用Text-to-Space创建交互式虚拟体验

Versy.ai | Text-to-Space是一个通过文本提示创建交互式虚拟体验的工具。它不仅可以构建3D体验，还可以让生成式人工智能构建逃脱房间、排行榜、产品配置体验等。让您超越3D，进入元宇宙的时代。

虚拟体验逃脱房间

RULER 是一种新的合成基准，为长文本语言模型提供了更全面的评估。它扩展了普通检索测试，涵盖了不同类型和数量的信息点。此外，RULER 引入了新的任务类别，如多跳跟踪和聚合，以测试超出检索从上下文中的行为。在 RULER 上评估了 10 个长文本语言模型，并在 13 个代表性任务中获得了表现。尽管这些模型在普通检索测试中取得了几乎完美的准确性，但在上下文长度增加时，它们表现得非常差。只有四个模型（GPT-4、Command-R、Yi-34B 和 Mixtral）在长度为 32K 时表现得相当不错。我们公开源 RULER，以促进对长文本语言模型的全面评估。

长文本语言模型

SFR-Judge

加速模型评估和微调的智能评估工具

SFR-Judge 是 Salesforce AI Research 推出的一系列评估模型，旨在通过人工智能技术加速大型语言模型（LLMs）的评估和微调过程。这些模型能够执行多种评估任务，包括成对比较、单项评分和二元分类，同时提供解释，避免黑箱问题。SFR-Judge 在多个基准测试中表现优异，证明了其在评估模型输出和指导微调方面的有效性。

人工智能评估工具

promptbench

统一的语言模型评估框架

PromptBench是一个基于Pytorch的Python包,用于评估大型语言模型(LLM)。它为研究人员提供了用户友好的API,以便对LLM进行评估。主要功能包括:快速模型性能评估、提示工程、对抗提示评估以及动态评估等。优势是使用简单,可以快速上手评估已有数据集和模型,也可以轻松定制自己的数据集和模型。定位为LLM评估的统一开源库。

基准评估

P-MMEval

多语言多任务基准测试，用于评估大型语言模型（LLMs）

P-MMEval是一个多语言基准测试，覆盖了基础和能力专业化的数据集。它扩展了现有的基准测试，确保所有数据集在语言覆盖上保持一致，并在多种语言之间提供平行样本，支持多达10种语言，涵盖8个语言家族。P-MMEval有助于全面评估多语言能力，并进行跨语言可转移性的比较分析。

多语言基准测试

FACTS Grounding

用于评估大型语言模型事实性的最新基准

FACTS Grounding是Google DeepMind推出的一个全面基准测试，旨在评估大型语言模型（LLMs）生成的回应是否不仅在给定输入方面事实准确，而且足够详细，能够为用户提供满意的答案。这一基准测试对于提高LLMs在现实世界中应用的信任度和准确性至关重要，有助于推动整个行业在事实性和基础性方面的进步。

AI 语言模型

KnowEdit

知识编辑基准测试，用于评估大型语言模型的知识编辑方法。

KnowEdit是一个专注于大型语言模型（LLMs）的知识编辑基准测试。它提供了一个综合的评估框架，用于测试和比较不同的知识编辑方法在修改特定领域内LLMs行为时的有效性，同时保持跨各种输入的整体性能。KnowEdit基准测试包括六个不同的数据集，涵盖了事实操作、情感修改和幻觉生成等多种编辑类型。该基准测试旨在帮助研究者和开发者更好地理解和改进知识编辑技术，推动LLMs的持续发展和应用。

知识编辑大型语言模型

Patronus GLIDER

用于评估文本、对话和RAG设置的通用评估模型

Patronus GLIDER是一个经过微调的phi-3.5-mini-instruct模型，可以作为通用评估模型，根据用户定义的标准和评分规则来评判文本、对话和RAG设置。该模型使用合成数据和领域适应数据进行训练，覆盖了183个指标和685个领域，包括金融、医学等。模型支持的最大序列长度为8192个token，但经过测试可以支持更长的文本（高达12000个token）。

文本评估对话系统

FullStack Bench

评估大型语言模型作为全栈开发者的能力

FullStack Bench是一个多语言的全栈编程基准测试，涵盖了广泛的应用领域和16种编程语言的3K测试样本，显著推动了代码语言模型在现实世界代码开发场景中的相关能力。该产品代表了编程语言模型在全栈开发领域的应用，其重要性在于能够评估和提升模型在实际编程任务中的表现，对于开发者和AI研究者来说都是一个宝贵的资源。

全栈开发编程语言模型

FiddleCube

快速生成问答数据，评估语言模型。

FiddleCube是一个专注于数据科学领域的产品，它能够快速地从用户的数据中生成问答对，帮助用户评估大型语言模型（LLMs）。它提供了准确的黄金数据集，支持多种问题类型，并能够通过度量标准来评估数据的准确性。此外，FiddleCube还提供了诊断工具，帮助用户找出并改进性能不佳的查询。

国外精选

数据科学模型评估

Deepmark AI

Generative AI 模型评估工具

Deepmark AI 是一款用于评估大型语言模型（LLM）的基准工具，可在自己的数据上对各种任务特定指标进行评估。它与 GPT-4、Anthropic、GPT-3.5 Turbo、Cohere、AI21 等领先的生成式 AI API 进行预集成。

人工智能大型语言模型

AIGCRank大语言模型API价格对比

汇总和比较全球主要AI模型提供商的价格信息

AIGCRank大语言模型API价格对比是一个专门汇总和比较全球主要AI模型提供商的价格信息的工具。它为用户提供最新的大语言模型（LLM）的价格数据，包括一些免费的AI大模型API。通过这个平台，用户可以轻松查找和比较OpenAI、Claude、Mixtral、Kimi、星火大模型、通义千问、文心一语、Llama 3、GPT-4、AWS和Google等国内外主要API提供商的最新价格，确保找到最适合自己项目的模型定价。

中文精选

AI 价格比较

OpenScholar_ExpertEval

专家评估界面和数据评估脚本

OpenScholar_ExpertEval是一个用于专家评估和数据评估的界面和脚本集合，旨在支持OpenScholar项目。该项目通过检索增强型语言模型合成科学文献，对模型生成的文本进行细致的人工评估。产品背景基于AllenAI的研究项目，具有重要的学术和技术价值，能够帮助研究人员和开发者更好地理解和改进语言模型。

专家评估数据评估

BlueLM蓝心大模型

vivo自主研发的智能语言理解模型

蓝心大模型是vivo自主研发的智能语言理解模型,具有70亿模型参数量,可以处理32K上下文长度。它基于260TB的多语言训练语料,拥有强大的语言理解能力,可以广泛应用于内容创作、知识问答、逻辑推理、代码生成等场景,持续为用户提供安全可靠的人机交互体验。该模型已通过严格的安全合规检测,输出结果安全合规。

中文精选

语言模型自然语言处理

Openlayer

AI模型测试评估工具

Openlayer是一个评估工具，适用于您的开发和生产流程，帮助您自信地发布高质量的模型。它提供强大的测试、评估和可观察性，无需猜测您的提示是否足够好。支持LLMs、文本分类、表格分类、表格回归等功能。通过实时通知让您在AI模型失败时获得通知，让您自信地发布。

AI 模型测试

Llama-3-Patronus-Lynx-8B-Instruct-v1.1

开源幻觉评估模型

Patronus-Lynx-8B-Instruct-v1.1是基于meta-llama/Meta-Llama-3.1-8B-Instruct模型的微调版本，主要用于检测RAG设置中的幻觉。该模型经过CovidQA、PubmedQA、DROP、RAGTruth等多个数据集的训练，包含人工标注和合成数据。它能够评估给定文档、问题和答案是否忠实于文档内容，不提供超出文档范围的新信息，也不与文档信息相矛盾。

文本生成幻觉评估

Reflect

AI助力健康与健身

Reflect是一款由AI技术驱动的健康与健身应用，提供24/7的个人辅导和指导，实时监测和纠正用户的动作，记录用户的进步并提供全球排行榜和互动活动。同时，Reflect还为教练和创作者提供全面的健康和健身工具，帮助他们扩大在线业务规模。

健康健身

隐私政策

用户协议

意见反馈网站地图

用户协议

AIbase服务使用协议，由享联科技有限公司实施、托管和运营。客户必须同意这些条款才能使用服务。

本网站及位于 AIbase.com 及其他子域名的服务，包括网页 App、小程序 App、移动端 App（统称为“本 App”）是享联科技有限公司的著作权产品。

通过访问或使用本网站，您表示接受这些条款（代表您本人或您代表的实体），并声明和保证您有权、权力和能力遵守这些条款（代表您本人或您代表的实体）。如果您未满 18 岁，您不得访问或使用本网站或接受这些条款。如果您不同意这些条款的所有规定，请不要访问和/或使用本 App。除了以下协议外，您还需要遵守 https://www.chinaz.com/aboutus/agreement.html 中的协议。

用户账户

为了充分利用此网站的所有功能，用户需要创建账户并填写准确的资料。用户有义务保护自己的账户和密码的保密性，并对其账户内的所有活动承担责任。若用户发现其账户遭到未经授权的使用，应迅速告知我们。

用户内容

此网站允许用户将问题记录存储并发送至服务器。用户需要对自身存储和发送的内容负责，确保其不触犯任何法律、法规或本协议。

行为规范

用户在使用此网站服务时，应遵循以下规定：

禁止发布、传播任何违法、淫秽、色情、赌博、暴力、恐怖或煽动犯罪的内容；

禁止发布、传播侵犯他人知识产权或其他合法权益的内容；

禁止发布、传播误导、欺诈、虚假信息或进行任何不诚实的行为；

禁止发布、传播政治宣传或进行任何政治活动；

禁止从事危害网络安全的行为，包括但不限于恶意攻击、恶意破坏、恶意干扰等；

禁止从事影响本网站正常运行的行为，包括但不限于非法使用本网站的资源、恶意注册、恶意请求等；

若用户违反上述规定，我们有权立即终止本协议并禁止用户使用本网站。

一般性支付条款

本网站提供的所有服务均为一次性付款，您只需支付所需的会员服务时长。服务到期后，本网站不会使用您过往的支付方式自动续费，也不存在需要取消的订阅。

会员服务时长购买后无法转送他人。本公司保留调整订阅价格的权力，已购买的服务时长内不受影响。

退款保障

如果由于本公司的过失导致您无法使用服务，您可以在首次购买服务后的24小时内申请取消服务并退还服务费。如果不符合上述要求，您的退款申请可以被考虑，但是最终决定权由本公司全权决定。本公司仅有义务通过原支付渠道进行退款，退款申请将在申请后30天内处理。如果您想根据我们的退款保证申请退款，请通过网站页面上客服联系方式进行联系咨询我们，我们收到信息将为您解决。本退款保证条款仅适用于通过本网站直接订阅服务的用户。

知识产权

本网站包含的所有内容，包括但不限于文本、图片、音频、视频、软件、代码、商标、商业信息等，皆受著作权、商标权、专利权及其他知识产权法律的保护。未经我们书面同意，用户不得使用、复制、修改、拷贝、发布、出售、出租、传播本网站的任何内容。

网站服务器回答内容责任

本网站的服务器根据用户的问题提供答案，但用户需要自行判断回答内容的正确性和可靠性，并自行承担使用回答内容的风险。我们不对回答内容的准确性、可靠性、完整性、有效性、及时性、适用性等作出任何保证或承诺。

隐私保护

我们尊重用户的隐私权，并承诺在使用用户的个人信息时遵守相关法律法规。我们将采取合理的安全措施保护用户的个人信息，但不对因不可抗力或非因我们的原因导致的信息泄露承担责任。

免责声明

本网站提供的信息和服务仅供参考，不构成任何担保或承诺。我们不保证本网站的信息和服务的准确性、可靠性、完整性、有效性、及时性、适用性。用户使用本网站的信息和服务所产生的风险由用户自行承担。

变更和终止

我们有权随时修改本协议的任何条款，并将修改后的协议在本网站上公布。若用户继续使用本网站，即表示用户同意受修改后的协议约束。若用户不同意修改后的协议，应立即停止使用本网站。

我们有权在任何时候终止本协议，且无需提前通知用户。在协议终止后，用户无权继续使用本网站。

适用法律

本协议的订立、执行、解释及争议的解决均适用中华人民共和国法律。如发生本协议与中华人民共和国法律相抵触时，应以中华人民共和国法律的明文规定为准。

如双方就本协议内容或执行发生任何争议，双方应尽力友好协商解决；协商不成时，任何一方均可向本网站所在地的人民法院提起诉讼。

其他

本协议构成双方对本协议之约定事项及其他有关事宜的完整协议，除本协议规定的之外，未赋予本协议各方其他权利。

如本协议中的任何条款无论因何种原因完全或部分无效或不具有执行力，本协议的其余条款仍应有效并且有约束力。

本协议中的标题仅供方便参阅，不具有实际意义，不能作为本协议涵义解释的依据。

本协议未尽事宜，您需遵守我们不时发布的其他服务条款和操作规则。

本协议自您接受之日起生效，对我们和用户均具有约束力。

确认

隐私政策

欢迎访问我们的产品。AIbase（包括 App 和网站等产品提供的服务，以下简称“产品和服务”）是由享联科技有限公司（以下简称“我们”）开发并运营的。确保用户的数据安全和隐私保护是我们的首要任务，本隐私政策详细说明了您访问和使用我们的产品和服务时所收集的数据以及其处理方式。

在继续使用我们的产品之前，我们强烈建议您认真阅读并理解本隐私政策的全部规则和要点。一旦您选择使用，即表示您同意本隐私政策的全部内容，并同意我们收集和使用您相关的信息。如果您在阅读过程中对本政策有任何疑问，请通过产品中的反馈方式联系我们的客服进行咨询。如果您不同意其中的任何条款或相关协议，则应停止使用我们的产品和服务。

本隐私政策旨在帮助您了解以下内容：

一、我们如何收集和使用您的个人信息；

二、我们如何存储和保护您的个人信息；

三、我们如何公开披露您的个人信息；

四、我们如何使用 Cookie 和其他追踪技术；

五、其他补充说明；

一、我们如何收集和使用您的个人信息

个人信息是指以电子或其他方式记录的能够单独或与其他信息结合识别特定自然人身份或反映特定自然人活动情况的各种信息。我们根据《中华人民共和国网络安全法》和《信息安全技术个人信息安全规范》（GB/T 35273-2017）以及其他相关法律法规的要求，严格遵循正当、合法、必要的原则，出于您使用我们提供的服务和/或产品等过程中而收集和使用您的个人信息，包括但不限于电话号码、电子邮箱地址、偏好及兴趣等。

为接受我们全面的产品服务，您应首先注册一个用户账号，我们将通过它记录相关的数据。您所提供的所有信息均来自于您本人在注册时提供的数据。如扫码登录、手机验证登录等方式，我们可能通过发短信或邮件的方式来验证您的身份是否有效。

二、我们如何存储和保护您的个人信息

作为一般规则，我们仅在实现信息收集目的所需的时间内保留您的个人信息。当您开立帐户或从我们的产品获取服务时，我们会在对于管理与您之间的关系严格必要的时间内保留您的个人信息。出于遵守法律义务或为证明某项权利或合同满足适用的诉讼时效要求的目的，我们可能需要在上述期限到期后保留您存档的个人信息，并且无法按您的要求删除。当您的个人信息对于我们的法定义务或法定时效对应的目的或档案不再必要时，我们确保将其完全删除或匿名化。

我们使用符合业界标准的安全防护措施保护您提供的个人信息，并加密其中的关键数据，防止其遭到未经授权访问、公开披露、使用、修改、损坏或丢失。我们会采取一切合理可行的措施，保护您的个人信息。我们会使用加密技术确保数据的保密性；我们会使用受信赖的保护机制防止数据遭到恶意攻击。

值得一提的是，为了加强对隐私数据的保护，我们在收集时就已对其进行了脱敏处理，即使在我们自己的数据库中，也不会储存具有关联性的、明文的隐私数据。

三、我们如何公开披露您的个人信息

为了更好地服务客户并追求合法利益，我们将合规并且恰当地使用您的个人信息。我们可能会根据法律法规规定或政府主管部门的强制性要求，对外共享您的个人信息。在符合法律法规的前提下，当我们收到上述披露信息的请求时，我们会要求必须出具与之相应的法律文件，如传票或调查函。我们坚信，在法律允许的范围内，对于要求我们提供的信息，应该尽可能保持透明。

在以下情形中，共享、公开披露您的个人信息无需事先征得您的授权同意：

与国家安全、国防安全直接相关的；

与犯罪侦查、起诉、审判和判决执行等直接相关的；

出于维护您或其他个人的生命、财产等重大合法权益但难以得到本人同意的；

您自行向社会公众公开的个人信息；

从合法公开披露的信息中收集个人信息的，如合法的新闻报道、政府信息公开等渠道；

根据个人信息主体要求签订和履行合同所必需的；

用于维护所提供的产品或服务的安全稳定运行所必需的，例如发现、处置产品或服务的故障；

法律法规规定的其他情形。

四、如何使用 Cookie 和其他追踪技术

为了确保产品正常运作，我们会在您的计算机或移动设备上存储名为 Cookie 的小数据文件。 Cookie 通常包含标识符、产品名称以及一些数字和字符。通过使用 Cookie，我们可以存储您的偏好或产品数据，并用于判断注册用户是否已登录，提高服务和产品质量以及优化用户体验。我们出于不同目的使用各种 Cookie，包括：严格必要型 Cookie、性能 Cookie、营销 Cookie 和功能 Cookie。某些 Cookie 可能由第三方提供，以向我们的产品提供其他功能。我们不会将 Cookie 用于本政策所述目的之外的任何用途。您可以根据自己的偏好管理或删除 Cookie。您可以清除计算机或手机中保存的所有 Cookie，大多数网络浏览器都设有阻止或禁用 Cookie 的功能，您可以对浏览器进行配置。阻止或禁用 Cookie 功能后，可能会影响您使用或无法充分使用我们的产品和服务。

五：其他补充

1、有关用户身份注销问题

关于您注销账户的方式以及您应满足的条件，请详见《站长之家账户注销须知》。您注销账户后，我们将停止为您提供产品与/或服务，并依据您的要求，除法律法规另有规定外，我们将删除您的个人信息。请您理解，由于技术所限、法律或监管要求，我们可能无法满足您的所有要求，我们会在合理的期限内答复您的请求。

确认