FHIR🌏 International🏛 AI CERTsJP Translated
How Medical AI Safety Red-Teams Clinical Boundaries - AI CERTs News
医療AIの安全性評価:臨床境界のレッドチーミング手法
July 20, 2026AI CERTs
Summary
MedAgentBenchは300のタスクと100のFHIR患者プロファイルを連携させ、医療AIエージェントの臨床境界をベンチマーク評価する新フレームワークを提案している。AI CERTsが医療AI安全性評価の最新動向を包括的にまとめた分析記事。
Details
MedAgentBenchは300タスクと100のFHIR患者プロファイルを連携させ、医療AIエージェントの臨床境界をベンチマーク評価する新フレームワークを提案。OpenAIのHealthBenchは4,671問の単一ターン問診・トリアージ評価に特化。Nature Medicineの6月比較ではGPT-5.2がMedQA正解率94.2%を記録したが、有害な幻覚は依然残存している。HarmBenchは33モデル・18手法にわたり数千件の自動攻撃テストを実施。Hartford HealthCareの二段階研究では高リスク失敗率が30.2%から8.5%に低減。規制当局はRed-Teamingを継続的なガバナンス手法として位置づけており、EU AI法やFDA指針との整合が進む。
Read Original Article
https://www.aicerts.ai/news/how-medical-ai-safety-red-teams-clinical-boundaries/
Original content copyright by respective publishers