이미지·비디오·오디오를 하나의 아키텍처에서 함께 학습해 생성·이해·행동 예측을 통합하려는 멀티모달 기반 모델이며, FLUX 3 Video부터 Early Access로 제공됨 이미지의 공간 구조, 비디오의 시간·물리 역학, 오디오의 사건·소리 관계를 상호 제약으로 학습하며, Self-Flow를 기반으로 데이터와 연산 자원을 확장함 네이티브 오디오가 포함된 비디오를 한 번에 최대 20초까지 생성하며, 초기 평가에서 Grok Imagine Video보다 최대 69%, Runway Gen-4.5보다 77%, Luma Ray 3.2보다 93%의 비교에서 선호됨 이미지 합성·편집과 다국어 텍스트 렌더링을 지원하고, 사전 학습된 비디오 백본을 제한된 작업별 데이터로 미세조정해 로봇 행동 모델로 활용할 수 있음 Video·Image·Action과 오픈 가중치 기반 FLUX 3 Dev를 순차 출시하며, 장기적으로 지각·행동·언어 예측을 하나의 모델로 통합하는 것이 목표임 현실을 함께 학습하는 멀티모달 모델 FLUX 3는 이미지·비디오·오디오를 분리된 요소가 아니라, 동일한 현실을 서로 다른 센서로 관측한 결과로 취급함 이미지는 특정 시점의 공간 구조와 관계를 포착함 비디오는 시간 차원을 복원해 움직임, 시간적 역학, 물리 법칙을 드러냄 오디오는 시각만으로 감지하기 어려운 기계적 현상과 음향의 인과관계를 보여줌 언어는 이러한 지각을 목표·추상화·지시와 연결함 여러 양식을 함께 학습하면 소리는 충돌과 일치하고, 움직임은 질량을 따르며, 미래는 과거에서 이어져야 한다는 상호 제약을 활용할 수 있음 FLUX 3는 이러한 원칙만으로 구축한 첫 모델로, 물리·디지털 환경에서 지각하고 예측하며 행동하는 현실 세계의 시각 지능을 지향함 콘텐츠 제작과 물리 AI에서 얻은 초기 결과는 이 접근법의 가능성을 보여줌 Self-Flow 기반 통합 아키텍처 Self-Flow는 하나의 기반 아키텍처에서 멀티모달 생성과 이해를 효율적으로 정렬하는 접근법임 FLUX 3는 Self-Flow를 바탕으로 연산량과 데이터 자원을 크게 확장해 비디오·이미지·오디오를 동시에 학습함 공개 비교에는 양식별 생성 오류를 Flow Matching 기준 100으로 정규화한 Fréchet distance와, 미세조정 후 4개 작업군의 조작 성공률이 사용됨 비디오와 네이티브 오디오 생성 FLUX 3는 한 번의 생성으로 최대 20초 길이의 다양한 비디오와 오디오를 만들 수 있음 지...
Related
Claude가 AI 생성 콘텐츠를 표시하는 방식
47 minutes ago
0
한 연구자가 noreply.net을 샀더니 기업 기밀이 쏟아짐
2 hours ago
1
프랑스, 사전 동의 없는 텔레마케팅 전화 금지
2 hours ago
1
GitHub Actions에 OIDC audience 제약이 필요한 이유
4 hours ago
0
H3-metal - Apple Silicon용 네이티브 MiniMax-H3 추론
4 hours ago
1
AI가 웹을 잠식하면서 인터넷의 집단 기억이 사라지고 있음
5 hours ago
1
Rails는 DHH 없이도 Rails일 수 있을까
7 hours ago
1
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
7 hours ago
1
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved

2 weeks ago
14







![[테크 차이나] DeepSeek V4 Flash 1위… 중국 모델 강세 지속(OpenRouter 주간 AI 모델 사용량 순위)](https://img.etnews.com/news/article/2026/08/06/news-p.v1.20260806.379c2eee15bb4be5b29d934a203a6106_Z1.jpg)
English (US) ·