标签:基准测试
共 2 篇文章。
-
长上下文召回能力横评:主流模型谁在"吹牛"
横向对比主流大模型在长上下文场景下的真实召回表现,揭示上下文窗口数字与实际可用长度之间的差距,给出选型建议。
-
LLM 长上下文 Needle-in-a-Haystack 实测方法与结果解读
讲解 Needle-in-a-Haystack 长上下文测试的原理、自建测试脚本方法,以及主流模型在不同上下文深度下的检索表现与局限。
共 2 篇文章。
横向对比主流大模型在长上下文场景下的真实召回表现,揭示上下文窗口数字与实际可用长度之间的差距,给出选型建议。
讲解 Needle-in-a-Haystack 长上下文测试的原理、自建测试脚本方法,以及主流模型在不同上下文深度下的检索表现与局限。