関連ニュース
スマホで動く視覚言語モデル「LFM2.5-VL-3B」が登場、日本語対応でUI認識やOCRに活用できる
アメリカに拠点を置くAI企業のLiquid AIが視覚言語モデル「LFM2.5-VL-3B」を発表しました。LFM2.5-VL-3Bはスマートフォンでも動作することが確認されている軽量VLMで、...
GIGAZINE
08/13 07:31
無料でローカルPCの操作を自動化できる「UI-TARS-desktop」について現状を確認してみた
ByteDanceが公開したマルチモーダルGUIエージェントスタックであるUI-TARS-desktopは、自然言語による指示と画面のスクリーンショットをセルフホスティングした視覚言語モデル(V...
GIGAZINE
06/28 13:00
出典メディア
GIGAZINE (2)
はてなテクノロジー (1)
つながり
数字は「視覚言語モデル」と一緒に出てきた記事の本数。 グラフには強いものだけが出るので、ここが全部です。
...</a></
2
.net/news
2
...</a></b
2
<p><
2
<p><b
2
href="https://
2
href="https
2
.net/
2
視覚言語
2
llm-jp
1
45;desktop/">
1
UI-TARS-
1
規模言語
1
マルチモーダル
1
英語マルチモーダルデ
1
UI-TARS-desktop
1
ローカルPC
1
9Bリリース
1
、LLM-jp
1
スクリーン
1
LLM-jp-
1
AI・人工知能
1
8b-
1
9Bパラメータ
1
LFM2.5-VL-3B
1
、LLM-
1
AI企業
1
マルチモーダルGUIエージェントスタック
1
ローカル
1
-tars
1
アメリカ
1
LLM-jp
1
ByteDance
1
著者:、杉浦一
1
LFM2.5
1
UI-TARS
1
スマートフォン
1
LLM
1
VL-3
1
モデル
1