mirror of
https://github.com/crewAIInc/crewAI.git
synced 2026-09-23 19:30:45 +00:00
* chore(tools): make the vision_tool more dynamic * tackle review comments * chore: update tool specifications * refactor(tools): simplify vision tool model selection --------- Co-authored-by: github-actions[bot] <41898282+github-actions[bot]@users.noreply.github.com> Co-authored-by: ViditOstwal <viditostwal@gmail.com> Co-authored-by: Vidit Ostwal <110953813+Vidit-Ostwal@users.noreply.github.com>
63 lines
2.6 KiB
Plaintext
63 lines
2.6 KiB
Plaintext
---
|
|
title: أداة الرؤية
|
|
description: أداة `VisionTool` مصممة لاستخراج النص من الصور.
|
|
icon: eye
|
|
mode: "wide"
|
|
---
|
|
|
|
# `VisionTool`
|
|
|
|
## الوصف
|
|
|
|
تُستخدم هذه الأداة لاستخراج النص من الصور. عند تمريرها إلى الوكيل، ستستخرج النص من الصورة ثم تستخدمه لتوليد استجابة أو تقرير أو أي مخرج آخر.
|
|
يجب تمرير عنوان URL أو مسار الصورة إلى الوكيل.
|
|
|
|
يمكنك أيضًا طرح استعلام `query` مخصص حول الصورة واختيار مستوى تعقيد `complexity_level` يقوم تلقائيًا باختيار النموذج الأنسب للطلب:
|
|
|
|
| مستوى التعقيد | النموذج |
|
|
| :--------------- | :------------ |
|
|
| `easy` | `gpt-5.6-luna` |
|
|
| `medium` (افتراضي) | `gpt-5.6-terra` |
|
|
| `hard` | `gpt-5.6-sol` |
|
|
|
|
عند تمرير `llm` أو `model` بشكل صريح إلى الأداة، فإنه يأخذ الأولوية على اختيار النموذج المستند إلى مستوى التعقيد.
|
|
|
|
## التثبيت
|
|
|
|
ثبّت حزمة crewai_tools
|
|
|
|
```shell
|
|
pip install 'crewai[tools]'
|
|
```
|
|
|
|
## الاستخدام
|
|
|
|
لاستخدام VisionTool، يجب تعيين مفتاح API الخاص بـ OpenAI في متغير البيئة `OPENAI_API_KEY`.
|
|
|
|
```python Code
|
|
from crewai_tools import VisionTool
|
|
|
|
vision_tool = VisionTool()
|
|
|
|
@agent
|
|
def researcher(self) -> Agent:
|
|
'''
|
|
This agent uses the VisionTool to extract text from images.
|
|
'''
|
|
return Agent(
|
|
config=self.agents_config["researcher"],
|
|
allow_delegation=False,
|
|
tools=[vision_tool]
|
|
)
|
|
```
|
|
|
|
## المعاملات
|
|
|
|
تقبل VisionTool المعاملات التالية:
|
|
|
|
| المعامل | النوع | الوصف |
|
|
| :----------------- | :------- | :------------------------------------------------------------------------------- |
|
|
| **image_path_url** | `string` | **إلزامي**. مسار ملف الصورة (أو عنوان URL) المراد استخراج النص منها. |
|
|
| **query** | `string` | **اختياري**. السؤال أو التعليمات المراد طرحها على النموذج حول الصورة. القيمة الافتراضية هي `"What's in this image?"`. |
|
|
| **complexity_level** | `string` | **اختياري**. مستوى تعقيد الطلب، والذي يحدد النموذج: `easy` أو `medium` أو `hard`. القيمة الافتراضية هي `medium`. |
|