쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 24일 (목)까지 985건
23건 · "비디오"조건 지우기 ×
001 12:10 ▲ 33 · 댓글 1 자동회귀 비디오 생성 모델의 메모리 메커니즘 체계화 자동회귀 방식의 비디오 생성에서 맥락 윈도우 제약으로 인해 과거 정보가 손실되는 문제를 메모리 관점에서 분석했다. AI · 머신러닝 · The Past Frames the Future: Memory for Autoregressive Video Generation
자동회귀 비디오 생성 모델의 메모리 메커니즘 체계화 Key Point 장시간 비디오 생성과 대화형 세계 모델링에서 과거 맥락 손실이 모델 성능을 제한하는 근본적 문제인데, 이를 체계적으로 정리한 첫 시도라 메모리 설계 방향을 모색하는 연구자에게 참고가 된다.
핵심 요약
자동회귀 방식의 비디오 생성에서 맥락 윈도우 제약으로 인해 과거 정보가 손실되는 문제를 메모리 관점에서 분석했다. 지속적인 역사 정보를 유지하면서도 미래 생성에 영향을 주는 메모리 메커니즘을 표현 형식, 기능, 동작, 학습, 평가 5가지 관점에서 분류했다. 개체 정체성, 동적 상태, 인과 관계 변화 같은 임계적 정보가 생성 과정에서 손실되는 것을 극복하는 것이 핵심 과제임을 제시했다. 구성 가능한 메모리 아키텍처, 신뢰할 수 있는 상태 업데이트, 자동 롤아웃 학습, 표준화된 평가 기준의 개발을 향후 과제로 제안했다. 002 03:11 ▲ 193 · 댓글 165 GPT-6 Astra, 자동차 운전 벤치마크에서 최고 성능 기록 DrivingBench라는 자동차 자율주행 벤치마크 테스트에서 GPT-6 Astra가 100% 완주율을 기록했다. AI · 머신러닝 · GPT-6 Astra has gained the ability to drive a car
GPT-6 Astra, 자동차 운전 벤치마크에서 최고 성능 기록 Key Point GPT-6 Astra가 AI 모델의 자율주행 능력을 평가하는 공개 벤치마크에서 다른 주요 모델들을 압도적으로 앞서간 점이 중요하다.
핵심 요약
DrivingBench라는 자동차 자율주행 벤치마크 테스트에서 GPT-6 Astra가 100% 완주율을 기록했다. GPT-6 Astra는 5분 22초 내에 코스를 완료했으며, 같은 컨텍스트에서 최대 3회 시도 중 최고 성능을 달성했다. Claude Fable 5.1은 45% 진행률, Grok 4.6은 11%, GPT-5.6 Sol은 6% 수준으로 뒤처졌다. 각 모델의 시도는 궤적 재생과 비디오를 통해 검증 가능하며, 토큰 사용량과 비용도 함께 기록된다. 003 15:11 ▲ 14 · 댓글 2 비디오 확산 모델이 물리법칙을 위반하는 이유 텍스트-투-비디오 확산 모델이 우수한 화질에도 불구하고 현실 물리법칙을 위반하는 영상을 생성한다. AI · 머신러닝 · Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms
비디오 확산 모델이 물리법칙을 위반하는 이유 Key Point 비디오 생성 AI의 핵심 약점인 물리법칙 위반을 어텐션 메커니즘 수준에서 진단하고, 모델 재설계 없이 적용 가능한 경량 해법을 제시한다.
핵심 요약
텍스트-투-비디오 확산 모델이 우수한 화질에도 불구하고 현실 물리법칙을 위반하는 영상을 생성한다. 연구팀이 모션 계획 과정을 분석해 초기 노이징 제거 단계에서 동작 궤적이 형성되는 방식을 규명했다. Rotary Position Embedding(RoPE)이 과도한 공간 주의 감소를 야기해 초기 후보 영역이 물리적으로 불가능한 위치에 조기 고정되는 것을 발견했다. RoPE 주파수를 노이징 제거 단계별로 조정하는 경량 아키텍처 수정안을 제안해 주의 감소를 줄이고 일관된 물리적 동작 탐색을 돕는다. 학습 없이 적용하는 방식과 재학습 기반 실험 모두 생성 영상의 물리 상식성을 향상시키는 효과를 확인했다. 004 16:18 ▲ 23 · 댓글 3 인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인 인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다. AI · 머신러닝 · HuRo: Robotizing Human Videos for Scalable VLA Pretraining
인간 영상을 로봇 학습 데이터로 변환하는 'HuRo' 파이프라인 Key Point 저비용 인간 영상 데이터로 로봇 비전-언어 에이전트를 학습시킬 수 있는 스케일러블한 솔루션을 제시하며, 구체적 성능 개선 수치가 실용성을 입증한다.
핵심 요약
인간 비디오를 로봇 시점으로 변환하는 'HuRo' 파이프라인을 개발했으며, 5개 인간 영상 출처에서 63만 개 에피소드와 1억 4,200만 프레임을 처리했다. 4가지 실제 조작 작업에서 로봇화된 사전학습 데이터량을 늘리자 작업 완료율이 51.5%에서 80.3%로 증가했고, 공간·시각 변화에 대한 외삽 완료율도 34.9%에서 72.2%로 향상됐다. 시각적 로봇화는 분포 밖 상황에 대한 강건성을 높였으며, 행동 재타겟팅을 포함한 엔드투엔드 사전학습이 시각 정보만 활용한 전이 학습을 앞도했다. 005 16:18 ▲ 48 · 댓글 3 동영상 생성 AI, 에이전트 학습으로 정확도 19% 향상 비디오 생성 모델이 복잡한 프롬프트를 만족하지 못하는 문제를 해결하기 위해 VideoGen-Agent를 제시했다. AI · 머신러닝 · VideoGen-Agent: Reinforcing Video Generation Agents
동영상 생성 AI, 에이전트 학습으로 정확도 19% 향상 Key Point 비디오 생성 AI가 에이전트 기반 강화학습으로 복잡한 요구사항을 만족하는 방식이 크게 개선되었으며, 추후 생성 도구 발전 시 자동으로 성능 향상을 얻을 수 있다는 점이 중요하다.
핵심 요약
비디오 생성 모델이 복잡한 프롬프트를 만족하지 못하는 문제를 해결하기 위해 VideoGen-Agent를 제시했다. 이 에이전트는 증강·생성·검증 도구를 멀티턴 상호작용으로 조율하며, 프롬프트와 중간 관찰 결과를 바탕으로 의사결정한다. 지도 학습과 강화학습을 거쳐 도구 사용 능력을 개선했고, 카테고리별 균형잡힌 보상으로 평가했다. 절차적 지식, 신원 보존, 물리적 일관성 등 6가지 과제를 다루는 VABench 벤치마크 600개 프롬프트를 소개했다. VABench에서 기본 생성기 대비 56.5에서 75.6으로 19.1점 개선했으며, 도구 업그레이드 시 86.1까지 상승했다. 인간 평가에서 강화 구성이 최강 베이스라인 대비 84.3% 비율로 선호됐다. 006 16:18 ▲ 32 · 댓글 2 영상 생성 모델 평가용 대규모 벤치마크 'OmniVBench' 공개 참조 영상 기반 비디오 생성(R2V)의 평가와 학습을 위한 'OmniVBench' 벤치마크와 34만 개 샘플의 Omni-R2V 데이터셋을 공개했다. AI · 머신러닝 · OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation
영상 생성 모델 평가용 대규모 벤치마크 'OmniVBench' 공개 Key Point 참조 기반 영상 생성의 평가 기준과 학습 자료가 부족한 상황에서, 34만 개 규모의 산업 수준 데이터셋과 체계적 벤치마크를 제공해 R2V 모델 개발의 표준을 제시한다.
핵심 요약
참조 영상 기반 비디오 생성(R2V)의 평가와 학습을 위한 'OmniVBench' 벤치마크와 34만 개 샘플의 Omni-R2V 데이터셋을 공개했다. 콘텐츠, 모션, 스타일, 구조, 내러티브 등 7개 태스크 패밀리와 18개 세부 과제를 포함하며, 기존 벤치마크보다 다양한 참조 유형과 조합을 다룬다. 12,172개의 체크리스트 항목으로 구성된 '요소 기반 평가'를 도입해 참조 요소의 보존, 분리, 실현 여부를 세밀하게 검증한다. 학습 데이터는 전문 영상 자료를 기반으로 하며, 다양한 참조 유형과 다중 참조 조합을 지원하는 작업별 파이프라인을 제공한다. 기존 오픈소스·폐쇄소스 R2V 모델들의 광범위한 평가 결과, 태스크 계열과 평가 차원별로 상당한 성능 편차가 드러났다. 007 16:18 ▲ 137 · 댓글 4 비디오 세계 모델 WorldCrafter, 3D 메모리로 긴 시간 일관성 확보 비디오 세계 모델이 장시간 여러 시점에서 일관된 장면을 생성하기 어려운 문제를 해결하는 WorldCrafter 모델을 제시했다. AI · 머신러닝 · WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory
비디오 세계 모델 WorldCrafter, 3D 메모리로 긴 시간 일관성 확보 Key Point 비디오 생성 AI의 가장 큰 약점인 시간적 일관성 문제를 3D 메모리 구조로 근본적으로 해결하는 접근법으로, 향후 인터랙티브 비디오 생성 시스템의 품질을 크게 개선할 수 있는 기술이다.
핵심 요약
비디오 세계 모델이 장시간 여러 시점에서 일관된 장면을 생성하기 어려운 문제를 해결하는 WorldCrafter 모델을 제시했다. 요청한 시점에 따라 과거 관찰 데이터를 3D 인식 메모리로 압축해 비디오 생성 모델의 토큰 제약을 효율적으로 활용한다. 메모리 인코더와 포즈 조건 읽기 모듈이 역사 정보를 시점별 토큰으로 통합하되, 명시적 깊이 대응 없이 학습된다. 한 장 이미지나 텍스트 프롬프트에서 시작해 실시간으로 장면을 탐색할 수 있으며, 정적·동적 장면 모두에서 분 단위 탐색 중 시각 품질을 유지한다. 008 16:18 ▲ 47 · 댓글 4 AI 음성·영상 대화 학습 데이터 자동 생성 기술 오디오와 영상을 직접 입력받아 텍스트로 답하는 '오므니비챗' 태스크를 정의하고, 별도 음성 인식이나 캡션 없이 사용자의 질문을 이해한다. AI · 머신러닝 · OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
AI 음성·영상 대화 학습 데이터 자동 생성 기술 Key Point 음성-영상 기반 AI 모델의 학습 데이터가 부족한 가운데, 합성 데이터로 모델을 학습하고 평가하는 새로운 방식이 실제 성능 개선으로 검증되었기 때문입니다.
핵심 요약
오디오와 영상을 직접 입력받아 텍스트로 답하는 '오므니비챗' 태스크를 정의하고, 별도 음성 인식이나 캡션 없이 사용자의 질문을 이해한다. 에이전트와 비디오 생성 기술을 활용해 합성된 대화 데이터를 만드는 '오므니비챗-스튜디오' 엔진을 개발했다. 합성 데이터로 오므니비챗 모델의 기본 대화 능력을 5개 카테고리로 평가하는 벤치마크를 구축했다. 강화학습 기반 보상 설계로 답변 정확성·효율성·스타일을 동시에 최적화하는 '오므니비챗-RL'을 제시했다. 합성 데이터로 학습한 Qwen3-Omni-Instruct는 벤치마크는 물론 실제 녹음 데이터에서도 성능 향상을 보였다. 009 12:10 ▲ 117 · 댓글 116 iPhone 18 Pro 카메라, DXOMARK 평가에서 172점 획득 DXOMARK가 iPhone 18 Pro 카메라를 평가한 결과 종합 172점을 획득했다. 하드웨어 · 시스템 · Apple iPhone 18 Pro Camera test
iPhone 18 Pro 카메라, DXOMARK 평가에서 172점 획득 Key Point iPhone 18 Pro의 카메라 성능을 객관적 수치로 평가한 결과이므로, 신형 아이폰 구매를 고려하는 사용자와 카메라 성능 개선을 추적하는 개발자 모두에게 실질적 정보를 제공한다.
핵심 요약
DXOMARK가 iPhone 18 Pro 카메라를 평가한 결과 종합 172점을 획득했다. 가변 조리개(f/1.48~f/4.0)가 주요 강점으로, 복잡한 장면에서 초점 유지 능력이 우수하다. 광역 다이나믹 레인지, 자연스러운 명암비 표현, 안정적인 손떨림 보정이 장점으로 꼽혔다. 단거리 망원 렌즈 성능과 야간 포트레이트 블러 효과가 제한적이며, 일부 역광 장면에서 얼굴 노출이 낮은 편이다. 비디오는 우수한 안정화와 자연스러운 텍스처-노이즈 균형을 보이지만, 일부 조건에서 화이트 밸런스 색캐스트가 남아있다. 010 21:10 당일 +112 스크린 녹화의 오픈소스 대안 Cap, Loom 대체 솔루션 공개 Rust 기반 오픈소스 스크린 녹화 도구 Cap이 Loom의 완전한 대체 솔루션으로 포지셔닝되고 있다. 오픈소스 · 도구 · CapSoftware/Cap · Rust
스크린 녹화의 오픈소스 대안 Cap, Loom 대체 솔루션 공개 Key Point 데이터 소유권을 원하는 팀과 엔지니어들이 Loom의 폐쇄성에서 벗어나 완전히 제어 가능한 대체재를 찾고 있는 상황에서, 셀프 호스팅과 스토리지 자유도를 갖춘 성숙한 오픈소스 솔루션이 등장했습니다.
핵심 요약
Rust 기반 오픈소스 스크린 녹화 도구 Cap이 Loom의 완전한 대체 솔루션으로 포지셔닝되고 있다. 즉시 모드(업로드하면서 녹화)와 스튜디오 모드(로컬 편집)로 나뉘어 빠른 피드백부터 고품질 편집까지 지원한다. Cap Cloud, S3 호환 스토리지, 자체 호스팅 등 다양한 데이터 소유 옵션을 제공하며 완전한 제어를 원하는 팀을 위해 설계됐다. macOS와 Windows 데스크톱 앱, 웹 대시보드, 자동 자막·요약 생성 AI, Loom 비디오 임포트 기능을 포함한다. Docker Compose, Railway, Coolify 등으로 셀프 호스팅 가능하며, Turborepo 모노레포 구조로 Rust·TypeScript·Tauri·Next.js 등 다양한 기술 스택으로 구성돼 있다. 011 21:10 당일 +105 Windows에서 맥OS의 스페이스 프리뷰 기능을 쓸 수 있다 QuickLook은 Windows에서 macOS의 Quick Look 기능을 재현한 오픈소스 앱으로, 파일 탐색기에서 스페이스 키를 누르면 즉시 파일을 미리볼 수 있다. 오픈소스 · 도구 · QL-Win/QuickLook · C#
Windows에서 맥OS의 스페이스 프리뷰 기능을 쓸 수 있다 Key Point Windows 사용자가 파일을 일일이 열지 않고 빠르게 미리볼 수 있는 워크플로우가 일상적으로 변한다.
핵심 요약
QuickLook은 Windows에서 macOS의 Quick Look 기능을 재현한 오픈소스 앱으로, 파일 탐색기에서 스페이스 키를 누르면 즉시 파일을 미리볼 수 있다. 이미지, 비디오, PDF, 코드, 3D 모델, 폰트 등 100개 이상의 파일 형식을 지원하며 하드웨어 가속 렌더링으로 빠른 성능을 제공한다. Microsoft Store 설치 버전과 전체 기능을 지원하는 독립 설치 프로그램, Scoop 패키지 매니저, 나이틀리 빌드 등 다양한 배포 방식을 제공한다. 파일 탐색기뿐 아니라 열기/저장 대화상자, Total Commander 같은 제3의 파일 매니저, OneDrive·Dropbox 같은 클라우드 스토리지에서도 작동한다. C#으로 작성되었으며 GPL-3.0 라이선스로 공개되어 있고, 플러그인으로 기능을 확장할 수 있다. 012 21:10 당일 +161 AI 크리에이터 워크스페이스 OpenCreator 공개 오픈소스 AI 크리에이터 도구 OpenCreator(구 KrillinAI)가 공개되었으며, 한 곳에서 영상, 이미지, 음성, 아바타, 번역 등을 생성할 수 있다. AI · 머신러닝 · krillinai/OpenCreator · TypeScript
AI 크리에이터 워크스페이스 OpenCreator 공개 Key Point 개발자와 크리에이터 모두에게 필요한 멀티모달 AI 도구를 로컬 환경에서 통합 운영할 수 있는 오픈소스 솔루션이 나타났으며, 기존 Codex 에코시스템과의 연동으로 접근성을 높였다.
핵심 요약
오픈소스 AI 크리에이터 도구 OpenCreator(구 KrillinAI)가 공개되었으며, 한 곳에서 영상, 이미지, 음성, 아바타, 번역 등을 생성할 수 있다. Codex 기반의 에이전트 루프를 실행 엔진으로 사용하여 별도 구현 없이 재사용하며, 로컬 런타임과 시각 워크스페이스를 제공한다. 웹과 데스크톱 두 가지 인터페이스를 지원하고, 동일한 데이터와 상태로 시각 도구 모드와 AI 대화 모드를 전환할 수 있다. 비디오 번역, 다운로드, 썸네일 생성, 이미지/비디오 생성, 음성 더빙 등 10가지 크리에이터 도구를 포함하며, 한국어 등 다국어 인터페이스를 지원한다. 모든 데이터와 로그가 로컬에 저장되며, 스킬과 MCP를 통해 에이전트를 확장할 수 있고 메모리 및 버전 관리 기능을 제공한다. TypeScript로 개발되었으며 Apache 2.0 라이선스로 공개되어 있다. 013 09:10 당일 +130 생성형 AI용 문서 처리 플랫폼 Docling, 비디오·이메일 지원 Docling은 PDF, DOCX, PPTX, XLSX, HTML, EPUB, 이미지, 오디오, 비디오 등 40여 가지 문서 형식을 파싱하고 생성형 AI와 연계하는 오픈소스 도구다. AI · 머신러닝 · docling-project/docling · Python
생성형 AI용 문서 처리 플랫폼 Docling, 비디오·이메일 지원 Key Point 생성형 AI 개발에 필수적인 문서 전처리 도구로, 최근 비디오·이메일·XBRL 등 엔터프라이즈 형식 지원을 확대했으므로 데이터 파이프라인 구축에 직접 활용할 수 있다.
핵심 요약
Docling은 PDF, DOCX, PPTX, XLSX, HTML, EPUB, 이미지, 오디오, 비디오 등 40여 가지 문서 형식을 파싱하고 생성형 AI와 연계하는 오픈소스 도구다. 페이지 레이아웃, 표 구조, 수식, 이미지 분류 등 고급 PDF 이해 기능을 제공하며, 마크다운·HTML·JSON 등 여러 형식으로 내보낼 수 있다. LangChain, LlamaIndex, Crew AI 등 주요 AI 프레임워크와 통합되며, MCP 서버와 API 서버로 구동할 수 있고 로컬 실행으로 민감한 데이터 보호를 지원한다. 최근 비디오(MP4, AVI, MOV, MKV, WebM) 파싱, XBRL 금융 보고서, 이메일(EML, MSG), EPUB 전자책, Apple Pages, ODF 형식 등 새로운 포맷 지원을 추가했다. 차트를 표나 코드로 변환해 설명을 생성하는 기능과 음성 인식 기반 오디오 처리를 지원하며, Python 3.10 이상에서 작동한다. MIT 라이선스 오픈소스로 IBM 리서치가 주도하며 LF AI & Data Foundation 프로젝트로 진행 중이다. 014 21:11 당일 +120 중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화 미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다. AI · 머신러닝 · meituan-longcat/LongCat-Video · Python
중국 음성 생성 모델 LongCat-Video, 장시간 영상 생성에 특화 Key Point 기존 영상 생성 모델의 색감 저하·품질 감소 문제를 장시간 생성으로 해결하고, 음성 기반 인물 애니메이션까지 확장한 첫 번째 오픈소스 통합 모델이기 때문에 영상 생성 분야의 기술 진화를 보여준다.
핵심 요약
미투안이 개발한 LongCat-Video는 137억 개 파라미터 기반 통합 영상 생성 모델이다. 텍스트-투-비디오, 이미지-투-비디오, 비디오 연속 생성을 하나의 모델로 처리한다. 분단위 장시간 영상을 색감 저하나 품질 손실 없이 생성하며, 720p 30fps 영상을 분 단위로 생성할 수 있다. 시간·공간축 기반 다단계 생성 전략과 블록 희소 어텐션으로 효율성을 높였다. 다중 보상 강화학습 기반 GRPO로 학습해 상용 모델 수준의 성능을 달성했다. 최신 버전인 1.5는 음성 입력 기반 캐릭터 애니메이션을 지원하고, Whisper 기반 입술 싱크 개선과 8단계 증류 기반 고속 추론을 제공한다. 015 21:11 당일 +167 다중 에이전트로 미래 예측하는 'MiroFish' 공개 다중 에이전트 기술 기반의 AI 예측 엔진 'MiroFish'가 공개되었다. AI · 머신러닝 · 666ghj/MiroFish · Python
다중 에이전트로 미래 예측하는 'MiroFish' 공개 Key Point 대규모 언어모델과 멀티 에이전트 기술이 결합된 예측 도구의 실제 활용 가능성을 보여주며, 의사결정자와 콘텐츠 제작자 모두를 위한 새로운 시뮬레이션 방식을 제시한다.
핵심 요약
다중 에이전트 기술 기반의 AI 예측 엔진 'MiroFish'가 공개되었다. 뉴스·정책안·금융 신호 같은 실제 데이터를 입력하면 고충실도 디지털 세계를 자동 구성하고, 독립적 성격과 장기 기억을 가진 수천 개 에이전트가 상호작용하며 사회진화를 시뮬레이션한다. 동적으로 변수를 주입해 미래 궤적을 정확히 추론할 수 있으며, '신의 시점'에서 정책과 홍보를 위험 없이 테스트하는 의사결정 실험실로 활용 가능하다. 데이터 분석 보고서나 콘텐츠를 업로드하고 자연언어로 예측 요구사항을 설명하면 상세한 예측 보고서와 인터랙티브 디지털 세계를 제공한다. Python 기반이며 그래프 구축·환경 설정·시뮬레이션·보고서 생성·심화 상호작용의 5단계 워크플로우로 동작한다. Node.js 18+, Python 3.11~3.12, 도커를 통해 배포 가능하며 온라인 데모와 비디오 튜토리얼을 제공한다. 016 21:11 당일 +536 트랜스포머 생태계의 중심 - Hugging Face Transformers 라이브러리 Transformers는 NLP, 비전, 오디오, 비디오, 멀티모달 등 다양한 분야의 최신 머신러닝 모델을 정의하고 학습·추론하는 프레임워크입니다. AI · 머신러닝 · huggingface/transformers · Python
트랜스포머 생태계의 중심 - Hugging Face Transformers 라이브러리 Key Point Transformers는 최신 AI 모델들의 표준 정의 기준이 되어 있으며, 기업과 개발자가 프로덕션 환경에서 모델을 활용할 때 필수 생태계입니다.
핵심 요약
Transformers는 NLP, 비전, 오디오, 비디오, 멀티모달 등 다양한 분야의 최신 머신러닝 모델을 정의하고 학습·추론하는 프레임워크입니다. 라이브러리가 정의한 모델은 Axolotl, Unsloth, DeepSpeed 등 대부분의 학습 프레임워크와 vLLM, SGLang, TGI 같은 추론 엔진에서 호환됩니다. Hugging Face Hub에 100만 개 이상의 사전학습 모델 체크포인트가 공개되어 있어 즉시 활용 가능합니다. Pipeline API를 통해 텍스트, 음성, 이미지, 멀티모달 작업을 단순한 인터페이스로 처리할 수 있습니다. Python 3.10 이상, PyTorch 2.5 이상에서 동작하며 소스 설치를 통해 최신 버전을 사용할 수 있습니다. 017 21:11 ▲ 185 · 댓글 81 JetKVM Mini 공개, 39달러부터 시작하는 저가 KVM 스위치 JetKVM이 소형화된 보급형 모델 Mini를 공개했다. 유선(Ethernet) 버전 39달러, 무선(Wi-Fi 2.4/5GHz) 버전 42달러로 시작하며, 3개 패키지 구입 시 각각 33달러, 36달러로 내려간다. 하드웨어 · 시스템 · JetKVM Mini
JetKVM Mini 공개, 39달러부터 시작하는 저가 KVM 스위치 Key Point 기존 JetKVM 가격의 1/3 수준으로 모든 머신에 설치할 수 있는 원격 제어 솔루션이 나왔으며, 무선 모델까지 추가되어 인프라 환경에 따른 선택지가 넓어졌다.
핵심 요약
JetKVM이 소형화된 보급형 모델 Mini를 공개했다. 유선(Ethernet) 버전 39달러, 무선(Wi-Fi 2.4/5GHz) 버전 42달러로 시작하며, 3개 패키지 구입 시 각각 33달러, 36달러로 내려간다. ESP32-P4X 마이크로컨트롤러 기반으로 설계되어 Linux 시스템 없이도 1080p 30fps 또는 720p 60fps 비디오 캡처, H.264 인코딩, USB 키보드/마우스 제어, 가상 미디어 마운팅이 가능하다. TF 카드 슬롯으로 ISO 파일을 저장해 가상 미디어를 제공하고, 기존 JetKVM의 웹 인터페이스, 클라우드 접근, MQTT·Home Assistant 지원, OIDC 로그인, 무선 업데이트를 모두 지원한다. JetKVM OS Services로 연결된 컴퓨터의 화면을 최대 4K로 캡처할 수 있으며, 공유 클립보드, 게스트 터미널, 파일 전송 기능이 추가된다. 펌웨어는 첫 공개부터 오픈소스로 제공되며, eFuse에 JetKVM 공개키를 사전 설치해 펌웨어를 JetKVM 서명 버전으로만 고정할 수 있다. 2026년 10월 26일부터 인정된 리셀러를 통해 판매 예정이다. 018 03:10 ▲ 111 · 댓글 96 매트 멀렌웨그, 보드 갈등 48시간 만에 CEO 복귀 선언 Automattic 보드가 매트 멀렌웨그를 CEO 해임했으나 금요일 아침 그는 Slack에서 다시 통제권을 되찾았다고 공언했다. 스타트업 · 비즈니스 · Matt Mullenweg tells Automattic staff in Slack he's back in control after ouster
매트 멀렌웨그, 보드 갈등 48시간 만에 CEO 복귀 선언 Key Point WordPress 모체 회사의 통제권을 놓고 창립자와 보드 사이에 벌어진 권력 싸움의 전개 과정과 현재 상황의 불확실성이 무엇인지 명확히 해준다.
핵심 요약
Automattic 보드가 매트 멀렌웨그를 CEO 해임했으나 금요일 아침 그는 Slack에서 다시 통제권을 되찾았다고 공언했다. 멀렌웨그는 보드가 '배신'하면서 그를 유급 휴직 상태로 만들었고 CFO 마크 데이비스를 임시 CEO로 임명했다고 주장했다. 그는 Slack 관리자 권한을 모두 제거하고 'Mama Said Knock You Out' 뮤직비디오 링크를 올리는 등 이례적인 행동을 보였다. 멀렌웨그는 해임 이후 소셜 미디어에서 PE 회사 Silver Lake가 개입해 자신의 삶을 '파괴'하려 한다고 주장했다. 현재 Automattic은 멀렌웨그의 복귀 선언을 공식 확인하지 않았다. 019 21:11 당일 +801 352개 AI 제공사를 하나의 API로, OmniRoute 게이트웨이 OpenAI, Claude, Gemini, DeepSeek 등 352개 AI 제공자 전용 엔드포인트를 통합한 오픈소스 게이트웨이 OmniRoute를 공개했다. AI · 머신러닝 · diegosouzapw/OmniRoute · TypeScript
352개 AI 제공사를 하나의 API로, OmniRoute 게이트웨이 Key Point 수백 개 AI API의 복잡한 가격·할당량 관리를 한 곳에서 해결해주므로, 비용 절감과 개발 편의성이 동시에 필요한 개발자에게 실질적인 도움이 된다.
핵심 요약
OpenAI, Claude, Gemini, DeepSeek 등 352개 AI 제공자 전용 엔드포인트를 통합한 오픈소스 게이트웨이 OmniRoute를 공개했다. 월 약 14.7억 토큰의 무료 한도를 자동으로 계산해 제공하며, 2주마다 각 제공자의 무료 정책을 재검증해 대시보드에 표시한다. 할당량 부족 시 자동으로 다른 제공자로 전환하고, RTK+Caveman 압축 기술로 토큰 사용을 15~95% 줄인다. Claude Code, Cursor, Copilot 등 주요 AI 코딩 도구와 호환되며, CLI·MCP·데스크톱·PWA 형태로 설치할 수 있다. v3.8.50 버전에서 1,312개 모델 ID, 비전·오디오·비디오 멀티모달 지원, 실시간 할당량 감시 기능을 추가했다. 020 21:11 당일 +169 AI를 위한 메모리 엔진, 로컬 실행 가능한 Supermemory AI 대화 간 기억을 유지하는 메모리·컨텍스트 엔진으로, LongMemEval, LoCoMo, ConvoMem 등 주요 벤치마크에서 1위를 차지했다. AI · 머신러닝 · supermemoryai/supermemory · TypeScript
AI를 위한 메모리 엔진, 로컬 실행 가능한 Supermemory Key Point AI 어시스턴트가 대화 간 정보를 잊는 근본적인 문제를 해결하는 메모리 인프라로, 개발자들이 자신의 AI 도구에 장기 메모리를 추가하거나 에이전트에 통합할 수 있는 API를 제공한다.
핵심 요약
AI 대화 간 기억을 유지하는 메모리·컨텍스트 엔진으로, LongMemEval, LoCoMo, ConvoMem 등 주요 벤치마크에서 1위를 차지했다. 95% Recall@15을 달성하면서 컨텍스트를 99.4% 압축하고, 사용자 프로필을 약 50ms 내에 생성한다. Claude Code, Cursor, VS Code 등 AI 도구에 플러그인이나 MCP 서버로 통합되어 대화 전체에서 지속적인 메모리를 제공한다. RAG, 파일 처리, Google Drive·Gmail·Notion 등 커넥터, PDF·이미지·비디오·코드 등 멀티모달 추출기를 포함한 완전한 컨텍스트 스택을 제공한다. 로컬 실행이 가능하며 구성 없이 한 번에 배포 가능하고, Ollama와 함께 완전 오프라인 운영도 지원한다. 021 08:12 당일 +2,047 마이크로소프트의 MarkItDown, 각종 문서를 마크다운으로 변환 마이크로소프트가 공개한 Python 유틸리티로, PDF·파워포인트·워드·엑셀·이미지·오디오·HTML 등 다양한 파일을 마크다운 형식으로 변환한다. AI · 머신러닝 · microsoft/markitdown · Python
마이크로소프트의 MarkItDown, 각종 문서를 마크다운으로 변환 Key Point LLM 기반 애플리케이션에서 다양한 형식의 문서를 처리해야 할 때, 마크다운으로의 표준화된 변환 방식을 제시하는 도구가 등장했으므로.
핵심 요약
마이크로소프트가 공개한 Python 유틸리티로, PDF·파워포인트·워드·엑셀·이미지·오디오·HTML 등 다양한 파일을 마크다운 형식으로 변환한다. 제목, 리스트, 표, 링크 등 문서 구조를 마크다운으로 보존하도록 설계되었으며, LLM과 텍스트 분석 파이프라인에서 사용하기 위한 목적이다. 마크다운은 LLM이 기본적으로 이해하고 토큰 효율도 높기 때문에, GPT-4o 같은 주류 언어모델과의 호환성이 우수하다. Python 3.10 이상이 필요하고, pip로 설치 가능하며, PDF·DOCX·PPTX·XLSX·오디오·YouTube 자막 등 기능별 선택적 의존성을 제공한다. 타사 플러그인을 지원하며, markitdown-ocr 플러그인으로 LLM 비전을 통한 OCR 기능을 추가할 수 있다. Azure Content Understanding 통합으로 스캔된 PDF, 복잡한 표, 비디오 등의 고품질 변환도 가능하다. 022 08:12 ▲ 523 · 댓글 222 독립 위키가 구글 검색에서 신규 도메인 페널티에 갇혔다 2024년 3월 구글 변화로 인해 새로운 도메인의 위키는 메인페이지를 제외한 다른 페이지가 검색 결과에 거의 노출되지 않는 현상이 발생했다. 웹 · 프론트엔드 · There's a new "Google Jail" for independent wikis
독립 위키가 구글 검색에서 신규 도메인 페널티에 갇혔다 Key Point 신규 도메인의 위키를 만들려는 개발자·운영자들이 직면한 구글 검색 구조 변화의 실체와 대응책을 명확히 보여주기 때문이다.
핵심 요약
2024년 3월 구글 변화로 인해 새로운 도메인의 위키는 메인페이지를 제외한 다른 페이지가 검색 결과에 거의 노출되지 않는 현상이 발생했다. 비디오 게임 위키 트래픽의 약 85%가 구글에서 오기 때문에 이는 신규 위키 런칭에 심각한 장애물이 되고 있다. 구글이 SEO 스팸을 걸러내기 위해 신규 도메인을 대대적으로 억제하는 정책을 펼친 것으로 추정된다. 위상이 높은 기존 도메인의 서브도메인(예: overwatch.weirdgloop.org)에서는 신규 도메인 문제가 발생하지 않으며, 불과 7일 만에 구글 인덱싱에 성공했다. 위키 호스팅 업체들은 이제 신규 커뮤니티를 받을 때 기존 도메인의 서브도메인에 먼저 위키를 만든 후 안정화되면 독립 도메인으로 옮기는 방식을 고려하고 있다. 023 08:12 당일 +280 Next.js 기반 무료 영상 스트리밍 플레이어 공개 Next.js 14, TypeScript, Tailwind CSS로 구축한 크로스플랫폼 영상 통합 플레이어 'LunaTV' 공개. 오픈소스 · 도구 · MoonTechLab/LunaTV · TypeScript
Next.js 기반 무료 영상 스트리밍 플레이어 공개 Key Point 무료 스트리밍 서비스 구축 관심층이나 오픈소스 비디오 플레이어 기술에 관심 있는 개발자에게 직접 배포 가능한 완성도 높은 솔루션을 제공합니다.
핵심 요약
Next.js 14, TypeScript, Tailwind CSS로 구축한 크로스플랫폼 영상 통합 플레이어 'LunaTV' 공개. 다중 소스 검색, HLS.js와 ArtPlayer 통합 재생, 컬렉션 및 시청 기록 동기화, PWA 지원, 광고 자동 스킵 기능 제공. Kvrocks/Redis/Upstash를 통한 저장소 옵션 지원으로 여러 기기 간 진행 상황 동기화 가능. Docker 또는 Zeabur을 통해 배포 가능하며, 배포 후 관리자가 직접 API 소스와 재생 스트림 추가 필요. CC BY-NC-SA 라이선스로 상업 이용 금지, 중국 대륙 소셜 미디어 홍보 불허 조건 명시.