大模型怎么做好角色扮演?最大的真实数据集、SoTA开源模型、最深入的评估在这里
论文标题:CoSER: Coordinating LLM-Based Persona Simulation of Established Roles 论文链接:https://arxiv.org/abs/2502.09082
CoSER 8B: https://huggingface.co/Neph0s/CoSER-Llama-3.1-8B CoSER 70B: https://huggingface.co/Neph0s/CoSER-Llama-3.1-70B CoSER Dataset: https://huggingface.co/datasets/Neph0s/CoSER CoSER Code: https://github.com/Neph0s/COSER See and Chat with Your Favorite Book Characters: https://ch.rhineai.com/characters
来自 771 本知名文学作品的 17,966 个角色 29,798 段书中的真实对话,而非由大模型生成 全面的数据类型:角色概述、对话(包含详细的上下文情景)、关键剧情的摘要和角色经历和等 语言、动作和想法:除了语言的对白,对话中还包括角色的动作和想法。
上图将 CoSER Dataset 与之前的数据集进行了比较。概括来说,CoSER 的独特之处在于: