auto_awesomeAi Trend

Mistral、マルチモーダル安全分類器Shieldstralを公開―自然言語で判定方針を変更

は30億の安全分類器Shieldstralをオープンウェイトで公開。自然言語の質問として方針を渡し、再学習せずテキストと画像を判定する。

概要

※本記事は公開情報をもとに編集部が再構成したサマリです。一次情報は出典欄をご参照ください。

は2026年8月4日、テキストと画像の安全性を判定する「Shieldstral」を公開した。30億の小型で、判定したい方針を自然言語の質問として時に渡し、内容が該当する確率を返す。

従来の分類器は危険カテゴリを学習時に固定することが多い。Shieldstralは、利用場面に応じた方針を質問文で変更できるため、再学習なしで異なる基準へ対応する設計である。重みはApache 2.0で公開された。

事実のポイント

  • 公開日: 2026年8月4日
  • 規模: 30億パラメータ
  • 対象: テキスト、画像、テキストと画像の組み合わせ
  • 方式: 自然言語の方針質問に対する連続的な安全スコア
  • 提供: Apache 2.0のオープンウェイト

用語・背景の補足

安全分類器は、利用者の入力やAIの出力を検査し、禁止対象や要確認内容を判定する補助モデルである。業務ごとに許容範囲が違うため、固定カテゴリだけでは過剰拒否や見逃しが起きやすい。

連続スコアを返す方式では、一定以上なら拒否、中間なら人へ確認といった段階的な運用ができる。ただし、しきい値と質問文の設計が結果へ影響するため、実際のデータで調整する必要がある。

注意点

  • 公表は特定データセット上の結果であり、個別用途の性能を保証しない
  • 自由な方針設定は柔軟だが、曖昧な質問文では判定も不安定になりうる
  • 単独の分類器に依存せず、権限管理と人による確認を組み合わせる必要がある

編集部見解

(追記予定)

info 公開情報をもとに編集部が再構成したサマリです。一次情報・追加情報は出典欄をご参照ください。

出典

arrow_backニュース・トピックス一覧へ Autais

5つのご相談入口

目的に合った入口からお気軽にどうぞ。すべてカジュアル相談OKです。