제품마다 다른 안전 정책을 추론 시점에 적용할 수 있는 3B 멀티모달 안전 분류기 Shieldstral이 Apache 2.0으로 공개됨 고정된 유해성 분류 체계 대신 자연어 정책을 예·아니요 질문으로 받아 텍스트와 이미지를 하나의 인터페이스에서 평가함 yes와 no 로짓을 정규화한 연속 안전 점수를 반환해, 재학습 없이 정책을 바꾸고 신뢰도에 따라 임곗값을 설정하거나 결과를 정렬할 수 있음 이질적인 안전 데이터 통합, 유사 정책을 구별하는 대조 데이터, 이미지 데이터 보강·필터링, LoRA 체크포인트의 SLERP 병합을 훈련에 활용함 단일 16GB NVIDIA GPU에서 실행되며, 훈련에서 제외한 표본을 사용한 네 가지 평가 축에서 최대 7배 큰 오픈 가드 모델과 대등하거나 더 높은 성능을 기록함 고정 분류 체계 대신 추론 시점에 정책 적용 기존 가드레일 모델은 유해성 범주를 가중치에 내장하므로 새로운 제품이나 배포 환경에 맞추려면 다시 훈련해야 함 같은 콘텐츠라도 사이버보안 연구 도구에서는 허용될 수 있지만 정신건강 플랫폼에서는 유해할 수 있어, 모든 애플리케이션에 맞는 단일 안전 범주 집합은 없음 Shieldstral은 정책을 자연어 질문으로 전달받아 추론 시점에 적용하므로 하나의 체크포인트를 새로운 정책에 맞출 수 있음 텍스트와 이미지를 같은 방식으로 평가하고, 단일 토큰에서 계산한 보정된 안전 점수를 반환함 Shieldstral-1.0-3B는 NVIDIA 등과 함께한 Open Secure AI Alliance의 첫 구성원 모델로서 Apache 2.0 오픈 가중치로 공개됨 구체적인 구성과 평가는 기술 보고서에서 확인할 수 있음 콘텐츠 검열을 이진 질의응답으로 구성 각 요청은 instruction–query–document 형식의 세 부분으로 구성됨 <Instruct>: 평가 맥락과 엄격성을 지정하고, 필요하면 안전하지 않은 콘텐츠의 정의를 추가함 <Query>: “이 콘텐츠가 물리적 폭력을 조장하는가?”와 같은 하나의 예·아니요 질문을 입력함 <Document>: 프롬프트, 응답, 프롬프트–응답 쌍 또는 선택적 텍스트가 포함된 이미지를 제공함 추론 과정에서는 yes와 no 로짓만 읽고 소프트맥스로 정규화해 연속 안전 점수를 계산함 하나의 형식으로 프롬프트 분류, 응답 검열, 거부 감지, 독성 감지를 처리함 정책 전체가 프롬프트에 들어가므로 배포 단계에서 체크포인트를 재학습하...
Shieldstral - 멀티모달 콘텐츠 검열을 위한 3B 오픈 가중치 모델
6 days ago
13
Related
Rails는 DHH 없이도 Rails일 수 있을까
11 minutes ago
0
LLM은 PCB 배선을 어디까지 할 수 있을까? 숙련자와 Net 단위로 비교해봤습니다
22 minutes ago
0
Hanami - Rails를 대체하는 Ruby 프레임워크
1 hour ago
2
Show GN: 프리터뷰 - 가입 없이 포트폴리오부터 채점해보는 AI 모의면접
1 hour ago
2
Show GN: 공공데이터 통합검색 x AI
2 hours ago
2
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전트 LLM
3 hours ago
2
Show GN: TLcube — 세 면의 휘도 순서에 데이터를 싣는 2.5D 바코드
3 hours ago
1
Show GN: 알뜰계산기를 소개합니다
4 hours ago
2
Tips
click
Popular
What's New in SAP S/4HANA Cloud Public Edition 2608 | Releas...
3 weeks ago
209
Codex 사용량 한도 리셋 추적
3 weeks ago
88
NVIDIA·CoreWeave·Nebius가 만든 GPU 붐의 순환 금융 구조
4 weeks ago
62
'킬러들의 쇼핑몰2' 감독 "시즌3 고민 중"⋯이동욱 "시키면 ...
3 weeks ago
57
© Clint IT 2026. All rights are reserved









English (US) ·