003▲ 65 · 댓글 1LLM이 진정한 비동기 에이전트로 거듭난다현재 LLM 기반 에이전트는 순차적 상호작용만 지원한다: 읽기 → 생각 → 응답 또는 도구 호출 → 반복.
AI · 머신러닝 · LLMs are General Asynchronous Agents
LLM이 진정한 비동기 에이전트로 거듭난다
Key Point
LLM을 단순 음성 인식기나 로봇 제어기로만 쓰던 시대에서 벗어나, 진정으로 동시다중 작업을 처리하는 에이전트로 만드는 기술이 등장했다는 뜻이다. 이는 실시간 응답과 백그라운드 작업을 함께 해야 하는 음성 어시스턴트, 자율 로봇, 모니터링 시스템 등의 실용성을 크게 높일 수 있다.
핵심 요약
현재 LLM 기반 에이전트는 순차적 상호작용만 지원한다: 읽기 → 생각 → 응답 또는 도구 호출 → 반복.
실제 응용(음성 어시스턴트, 로봇 제어, 모니터링)은 비순차적이다. 에이전트가 생각하거나 작업을 수행하는 도중 새로운 입력이 들어온다.
현재는 음성·영상 처리, 로봇 제어(VLA), 비동기 도구 호출 등 용도별로 서로 다른 아키텍처를 구축해야 한다.
005▲ 28 · 댓글 1흉부 X선 분석을 위한 문장 중심 비전-언어 모델 SentZero흉부 X선(CXR) 이미지와 방사선 리포트를 사용한 비전-언어 사전학습이 의료 영상 이해에 유망하지만, 기존 방법들은 긴 임상 리포트를 간단한 제로샷 프롬프트로 정렬하기 어려워 작업별 미세조정에 의존한다.
AI · 머신러닝 · SentZero: An Enhanced Sentence-Centric Vision-Language Pretraining for Multi-Task Zero-Shot Chest X-Ray Analysis
흉부 X선 분석을 위한 문장 중심 비전-언어 모델 SentZero
Key Point
방사선학 텍스트의 특성을 고려한 새로운 문장 수준 설계와 거짓 음성 완화 기법이 흉부 X선의 미세조정 없는 분석 성능을 크게 향상시킨다.
핵심 요약
흉부 X선(CXR) 이미지와 방사선 리포트를 사용한 비전-언어 사전학습이 의료 영상 이해에 유망하지만, 기존 방법들은 긴 임상 리포트를 간단한 제로샷 프롬프트로 정렬하기 어려워 작업별 미세조정에 의존한다.
최근 문장 수준 접근법이 LLM으로 추출한 임상 구문을 사용해 이를 부분적으로 개선했으나, 방사선학 텍스트의 내재적 특성을 간과하고 양성 쌍의 다양성이 제한되어 있다.
임상적으로 동등한 문장이 환자 간에 반복되면서 대조 학습에서 거짓 음성이 발생하는 문제가 있다.