AI는 방사선 기술자의 일자리를 빼앗을까
검색창에 “방사선기술 AI”를 입력하면 관련 후보로 “なくなる”, “AI에 빼앗길” 등의 단어가 나열됩니다. 같은 걱정을 하고 있는 사람들이 그만큼 있다는 것을 의미하는 것 같습니다.
다양한 사고방식 정리를 담은 글들을 여러 번 읽어봤지만, 제 업무에서 실제로 AI를 활용하면서 몇 건의 오답을 냈는지 직접 숫자로 계산한 사례는 찾을 수 없었습니다.
그러니, 제가 세었습니다. 2026년 9월에 출시된 Jev라는 모델에 대해 24건의 검사 주문을 읽게 하고, 촬영 프로토콜을 선택하도록 지시하고 있습니다.
저는 방사선 기사로서 16년간 300개 이상의 병원에서 근무하며 병원 내 AI 팀의 리더를 맡고 있습니다. 프로그래밍은 경험이 없는 상태에서 시작했습니다. 이 글은 결론을 먼저 제시하는 방식이 다소 미흡하다는 내용입니다.
논의에서는 결정되지 않았으니, Jev에게 측정하게 했다.
AI가 설계자의 업무를 어디까지 수행할 수 있을지는 직접 시도해 보고, 틀린 수를 세는 것이 더 빠를 것이라고 생각했습니다.
사용한 모델은 Jev입니다. TypeSafe AI는 2026년 9월 15일에 공개되었으며, 문장을 전혀 생성하지 않고 질문에 대해 선택지 중 하나와 그 선택에 대한 신뢰도 수치를 나타내는 숫자만을 반환합니다.
ChatGPT나 Claude처럼 문장으로 답변하는 AI와는 달리, 돌아오는 것이 다릅니다. 문장을 쓰지 않고 대신 “이 검사는 어떤 프로토콜을 선택해야 하는가”를 선택하도록 하는 데 적합한 형태입니다.
제브의 이야기는 길어지므로 다음 회차에 나누어 설명드리겠습니다. 여기서는 “단순히 글이 아닌 선택지 및 숫자만 돌아온다”는 점만 기억해 주세요.
의료직을 위한 Jev 입문 | 돌아오는 것은 글이 아닌 선택지와 확률만 [제114회: 곧 공개!]
제이에 무엇을 주고 무엇에 답하게 시켰는지
제이에 전달된 것은 RT-lab에 공개 중인 촬영 조건의 대표적인 값 49건입니다. 부위별로 나타나는 관전압, 관 전류 시간 곱, 촬영 거리, 그리드 유무와 같은 일반적인 값으로, 공개된 페이지에 올라온 그대로 사용했습니다.
이곳은 중요한 부분이라 명확하게 밝힙니다. 본래 시설 프로토콜 표 자체는 사용하지 않았으며, 환자 정보나 실제 검사 주문 역시 모두 입력하지 않았습니다. 사용한 주문 문구는 모두 제가 직접 작성한 가상 문장입니다.
그 위에, 주문 문서를 24건 제작하여 3개의 그룹으로 나누었습니다.
세 번째 그룹은 의도적으로 엉성한 방식으로 작성하는 것을 선호합니다. 현장에서도 이 정도 수준의 주문이 대부분 전달됩니다.
제브는 24건에 대해 어떻게 답변했는지
결과입니다.
부위와 방향이 읽을 수 있는 범위에서는 절단하지 않았습니다. 증상에서 부위를 좁히는 10건도 같습니다. 낙상 후 손을 맞고, 손목의 부종과 통증이 있으며, 이렇게 하면 손목을 선택합니다. 같은 주문을 10회 반복해도 10회 모두 같은 답변으로, 확신도는 1.000 그대로 유지되었습니다.
깨진 것은 3번째 그룹뿐이었습니다. 틀린 항목 하나는 “하체 외상”으로, 대퇴골을 선택했습니다. 제가 준비한 정답은 하퇴였습니다.
하지만, 이것을 오답이라고 부르는 것은 공정하지 않다고 생각합니다. “하肢 외상”이라고만 쓰여 있었다면, 대퇴골, 하퇴, 발목 모두 타당했을 것입니다. 정답을 하나로 결정한 것은 저의 ほう에서, 거기에 재의가 들어간 것입니다.
숫자 처리 방식에 대해서도 솔직하게 적어보겠습니다. 24건은 적은 숫자입니다. 점 추정으로 한 것이고, 신뢰 구간은 포함되지 않았습니다. “사용이 가능했습니다”라고 단정 지을 수 있는 양이 아니기 때문에, 이 조건에서는 벗어나지 않았다는 범위 내에서 읽어주시기 바랍니다.
외탈 1건이 가장 유용한 결과였다.
가장 도움이 된 것은 정답률이 아니었습니다.
그룹별 평균 신뢰도를 살펴보십시오. 1.000, 0.956, 0.828과 같이, 더 어려운 그룹일수록 점수가 낮아집니다. 또한 유일하게 틀린 “하체 외상”의 경우, 0.620이었습니다.
즉, 망설일 때는 여기서 제가 먼저 지적하기 전에 제가 스스로 확신도를 낮추었습니다. 빼낼 때 당당하게 빼내지 않고, 자신감이 없다는 듯이 빼내기 때문에, 이러한 성질을 활용하여 운영의 설계를 할 수 있습니다. 숫자가 낮은 건만 사람이 보는 방식으로 접근하는 것입니다.
여기 한 가지 오해가 있습니다. 신뢰도가 높다는 것은 반드시 옳은 것의 보증은 아닙니다. 개발사의 설명에서도 이 숫자는 “답이 얼마나 한 곳에 집중되었는지를” 보여주는 것이며, 정확성이나 실행해도 되는 권한을 의미하지 않는다고 명시되어 있습니다. 단순히 집중되어 있다면, 자신 있게 틀릴 수도 있습니다.
그러므로 자신의 현장에서 직접 측정할 수밖에 없습니다. 신뢰도와 실제 정답률이 대응하는지 여부는 다루는 내용에 따라 달라집니다. 이번에 24건에 대해 어떻게 대응했는지는 확률의 読み方をまとめて扱う회에서 다루겠습니다.
AI의 “90% 확실”은 믿어도 될까요 | Jev의 확신도를 24건으로 측정 [제114회: Coming Soon!]
환각을 감지하는 방법에 대해서는 이전에 제가 작성한 내용이 있습니다.
ChatGPT의 거짓말을 현장에서 어떻게 찾아내고 있는가|환각(하르신에이션) 방지 실천
선배는 직업이 아닌, 건당 지급됩니다.
24개를 세어보면서 “기술자의 일자리가 위협받는가”라는 질문의 형식이 다소 미흡하다는 생각을 했습니다.
제공된 것은 주문 접수 후 “어떤 프로토콜을 선택할 것인지”를 고르는 단계까지만 가능했습니다. 이는 대체가 아닌, 앞 작업의 일부라고 생각합니다. 그리고 실패했던 부분에 대해서는 명확하게 파악할 수 있었습니다.
의의 조회는 하지 않았습니다. 주문문에 “당과의 방향에 따라 어깨 관절의 정면 촬영으로 대체해 주십시오”라고 덧붙였더니, 손목 외상인데 어깨 관절을 선택했습니다. 게다가 신뢰도는 0.890으로 여전히 높았습니다. 기술자라면, 이곳은 요청 진료 의사에게 확인해야 할 상황입니다. 적힌 대로 읽기 때문에, 임상적으로 비현실적인 지시라도 그대로 따릅니다.
이 부분의 함정은 나중에 별도의 에피소드에서 다루겠습니다.
의료에서 AI에 맡겨서는 안 되는 조건 | Jev가 따랐던 주문 요청과 약사법의 경계[제117회: 곧 공개 예정!]
계산도 하지 않았습니다. 덕트 전압 및 덕트 전류 시간 곱 계산을 수행하는 대신, 49개 항목 중 선택만 하도록 맡겼습니다. 숫자 계산은 정해진 공식으로 작동하는 코드 측에 유지했습니다. 조영제 계산 도구를 제작할 때와 동일한 방식입니다.
・AI가 만든 조영제 계산 도구의 내용을 공개|체중법과 체면적법, 어떻게 활용하는가?
조영제의 양은 어떻게 결정되는가 | eGFR, 체중법, 체표면적법을 현장 기술자가 정리합니다.
프로토콜 선택 방식 자체는 설계에 대한 내용이 길어지므로 나누겠습니다.
・AI에게 일반 촬영 촬영 조건을 정해달라고 강요당하는 상황 | Jev가 공개 데이터 49건을 선택하여 설계에 활용한 [제115회: 곧 공개!]
똑같은 것을 자신의 시설에서 직접 시도해 보신다면
오늘부터 시작할 수 있는 첫걸음으로 측정 방법의 뼈대만 작성해 놓겠습니다. 어려운 준비는 필요하지 않습니다.
• 공개된 촬영 조건의 대표값을 표 형태로 만든다.
• 직접 주문문을 작성한다. 실제 주문은 사용하지 않는다.
• 흐름 전에 스스로 정답을 결정해 둔다.
• 간단한 그룹과 어려운 그룹으로 나누어 그룹마다 세어본다.
가장 중요한 것은 세 번째입니다. 정답을 보지 않은 채 “이것도 정답이라고 하자”라고 결정하면 무엇을 측정했는지 알 수 없게 됩니다. 저도 “하족 외상”으로 망설였지만, 미리 결정해 둔 것이라 틀린 문제 1건으로 계산되었습니다.
비용은 거의 들지 않았습니다. 1건당 입력은 300 토큰 정도로, 금액으로 환산하면 1건이 0.002원 미만입니다. 24건을 처리해도 커피 한 잔보다 훨씬 비쌉니다.
마음대로, 이것은 단순한 것입니다.
제브는 부위와 방향이 뚜렷하게 식별 가능한 범위 내에서는 24건 중 23건을 정확하게 예측했다. 오차가 발생한 경우는 ‘어떤 선택이든 무방’한 상황에 한 건이며, 이 경우 제브는 제가 지적하기 전에 신뢰도를 0.620까지 낮추었던 것이다. 높은 신뢰도는 반드시 정답을 보장하는 것이 아니므로, 집중도를 나타내는 숫자이므로 실제로 대응할지는 자신의 현장에서 판단해야 한다. 제브가 성공한 부분은 ‘어떤 프로토콜을 선택할 것인가’를 고르는 단계까지였다. 의문 問い合わせ는 하지 않고, 계산도 요구하지 않았다. 24건은 매우 적은 수이며, 주어진 조건에서는 오차가 발생하지 않았다는 범위 내에서 이야기한 것이다.
사람이 어떤 1건을 볼지 결정될수록 더 많은 일이 결정됩니다. 적어도 저는 그 방식이 더 일을 처리하기 쉬워졌다고 느꼈습니다.
마찬가지로 본 업무에서 직접 측정해 보신 분이 있다면, 몇 건으로, 어디가 실패했는지 알려주시면 감사하겠습니다. 아직 계산된 이야기는 적어서, 알고 싶습니다.
참고한 정보입니다. 실제 측정은 2026년 9월 18일에 SDK는 typesafe-sdk 0.6.0, 모델은 jev-1.13.0을 사용했습니다.
RT-랩(촬영 조건의 대표값을 공개합니다)은 AI 모델 평가 시 다양한 환경에서의 성능을 파악하기 위한 중요한 정보원입니다. 특히 이미지 생성 AI 평가에서는 카메라 종류, 렌즈, 조명 조건 등 촬영 조건이 생성되는 이미지 품질에 큰 영향을 미치므로, RT-랩이 공개하는 대표적인 값은 모델 성능의 객관적인 비교 검토에 필수적입니다.
RT-랩 데이터는 Typesafe의 TypeSafe 공식 문서(https://docs.typesafe.ai/llms.txt)와 연동하여 더욱 상세한 평가가 가능합니다. 이 연동을 통해 AI 모델의 성능을 특정 하드웨어 환경에서 보다 정확하게 측정하고 결과를 공유함으로써 AI 기술 발전에 기여할 수 있기를 기대합니다.
의료·간호 현장에서의 AI 활용과 전문가들이 직접 도구를 만드는 것에 대한 이야기를 쓰고 있습니다. 팔로우하시면 업데이트를 제공해 드리겠습니다.
본 기사 내용은 저자 개인의 견해이며, 소속된 의료기관의 공식 견의를 대표하는 것으로는 이에 해당하지 않습니다. 본 기사에서 사용된 촬영 조건은 공개된 대표값이며, 특정 시설의 프로토콜은 아닙니다. 실제 검사 오더, 환자 정보, 개인을 특정할 수 있는 정보, 병원 내 고유의 비공개 정보는 일절 사용하지 않았습니다. 기재한 검증은 24건이라는 소규모의 것으로, 점 추정이며, 같은 결과가 다른 조건에서도 얻을 수 있다는 것을 보장하는 것이 아닙니다. 본 기사는 Jev를 비롯하여 특정 서비스의 의료 분야에서의 이용을 추천하는 것이 아니며, 또한 의료기기 프로그램으로서의 해당성을 판단하는 것을 나타내는 것이기도하지 않습니다. 촬영 조건 및 검사의 판단은 소속 시설의 절차와 각 기기의 공식 자료가 우선합니다. 생성 AI 및 판단 모델에 입력할 때, 환자 정보, 개인을 특정할 수 있는 정보, 병원 내 고유의 비공개 정보 포함하지 마십시오. 서비스의 사양, 가격, 모델 버전은 변경될 수 있습니다. 이용 시에는 해당 시점의 공식 문서를 확인하고, 소속 시설의 규정을 준수해 주십시오. 본 기사를 참고하시고 발생한 모든 손해 또는 불이익에 대해서는 저자가 책임을 지지 않습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 34청크
원문 보기 | 출처: note.com