[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-93245":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"93245","ai","论文研究","The Decoder",59,"AI读X光片过于自信，RadLE 2.0基准测试揭示风险","RadLE 2.0基准测试显示，AI读X光片时即使错误也过于自信，人类放射科医生仍领先。","RadLE 2.0基准测试发现，AI模型在放射学诊断中常以完全自信输出错误结果，而人类放射科医生仍显著领先；AI在独立诊断前需学会“何时该保持沉默”。\n· RadLE 2.0专门测试AI模型能否判断何时应将诊断留给人类，结果许多模型在错误时仍给出高置信度。\n· 当前AI在放射学领域的表现仍不及人类医生，尤其在罕见病变或复杂病例中，过度自信可能导致误诊风险。\n· 研究强调，AI辅助诊断应优先提升不确定性表达能力，而非追求全自动诊断。\n影响\u002F看点：该基准测试为AI医疗应用敲响警钟——模型需要学会“自知之明”，未来AI辅助诊断系统的可信度评估将更注重校准和不确定性量化。","https:\u002F\u002Fthe-decoder.com\u002Fai-chatbots-reading-x-rays-can-be-dangerously-confident-even-when-theyre-wrong\u002F",null,"2026-07-19 15:35:20"]