来自植物标本室标本的图像和信息的数字化正在扩大它们的用途,并为表型和物候学研究提供重要资源。 截至 2020 年春季,一个密钥存储库, 数字生物,拥有超过 19 万个数字化标本。 高质量的带注释图像可用于训练机器学习算法,以自动执行某些基于数字图像的任务,从而节省时间。 然而,初始注释需要大量的人时投入,并且通常由志愿者完成。 因此,重要的是找到让志愿者完成任务的最简单和最有效的方法。
在发表于的一篇新文章中 在植物科学中的应用植物生物学中的机器学习特刊,主要作者 Laura Brenskelle 及其同事使用了高质量的预注释数据集,其中每个物种都包含 3000 个物种 李 or 宏碁 标本到 测试志愿者的标注准确性 两种不同条件下的物候性状。
首先,评分员亲自出现并接受 15 分钟的培训课程以及带有插图和示例的手册。 第二,计分员使用在线平台 来自大自然的笔记 并在没有额外培训的情况下获得了指导手册。 在第二个设置中,一个标本需要三个注释,并分配给两个评分员商定的注释。 然后,作者调查了诸如被评分的性状和分类群,以及植物学专业知识、学术生涯水平和个人评分者的速度等因素的影响。

令人惊讶的是,结果表明植物学专业知识、职业水平和速度并不是计分员准确度的重要因素。 相反,准确性取决于被评分的特征和分类群,无论是当面评分还是在线评分,以及个人本身……有些人只是更准确,而不考虑其他因素。 总的来说,那些亲自出现的人明显更准确,尽管两组都做得相当好。 Brenskelle 解释说:“我们认为有两个主要因素可能导致了在线标注准确性的轻微滞后——培训和图像质量,”他强调全面的培训手册和放大图像细节的能力。 她还指出,重复三次评分将在线准确性提高了 XNUMX%。 “这是提高在线注释准确性的另一种方法,尽管它确实需要完成注释数量的三倍。”
尽管在这项研究中评分的特征很简单,但 Brenskelle 相信可以有效地培训志愿者以完成更复杂的注释任务。 “[T] 这项研究中的特征是相对简单的存在/不存在注释。 我可以想象研究人员会对无数更复杂的注释任务感兴趣,尤其是对于植物物候学。 我确实认为,通过适当的志愿者培训,我们的一般方法将适用于更复杂的特征,”她说。 “我认为,对于更复杂的特征,你会遇到的最大挑战是让图像显示你要求志愿者评分的事物的适当细节水平。 除了这个挑战,我认为如果你开发带有视觉示例的培训手册,这将使志愿者能够对更复杂的特征进行评分。”