رونمایی Parse 5
Cohere در 27 اوت 2026 از Parse 5 (parse-v5.0) رونمایی کرد؛ مدل چندمودالی زبان-بصری با 2.3 میلیارد پارامتر که برای تبدیل فایلهای PDF پیچیده و غنی از عناصر تصویری—از گزارشهای مالی تا مقالات علمی—به Markdown ساختیافته همراه با مختصات دقیق جعبههای محدودکننده طراحی شده است.
معماری و مشخصات فنی Parse 5
Parse 5 برای پردازش حجم بالای دادهٔ سازمانی بهینه شده و پنجرهٔ متنی 8K توکن را پشتیبانی میکند تا متن و تصاویر را همزمان دریافت کند. این مدل بر پایهٔ معماری North-Micro-Vision-Instruct ساخته شده و از یک کدنویس دیداری بومی 400 میلیون پارامتری بهره میبرد که از SigLIP 2 SO400M مقداردهی اولیه شده است. کدنویس، از جاسازی موقعیتی دوبعدی چرخشی و جاسازی موقعیتی یکبعدی یادگرفتهشده برای حفظ ساختار فضایی سند استفاده میکند و یک Projector اختصاصی ویژگیهای بصری را به فضای جاسازی مدل زبان نگاشت میکند.
لایهٔ ترکیب دیداری و زبانی
موتور استدلال Parse 5 شامل یک مدل زبان داخلی حدود 2 میلیارد پارامتری (North Micro LLM) مبتنی بر معماری Command A+ است. رویکرد DeepStack امکان تزریق جاسازیهای قطعهای از چندین لایهٔ کدنویس دیداری در لایههای اولیهٔ مدل زبان را فراهم میکند تا نمایشهای بصری در سطوح انتزاعی متعدد قابل دسترسی باشند. این ترکیب خروجی مستقیم Markdown ساختیافته تولید میکند و نیاز به خطمشیهای پیچیدهٔ مبتنی بر قوانین و OCR سنتی را کاهش میدهد.
عملکرد در بنچمارکها
Cohere برای سنجش دقت از مجموعهدادهٔ ترکیبی و انسانی ParseBench استفاده کرده است؛ شامل بیش از 2,000 صفحهٔ سازمانی در حوزههای بیمه، مالی و دولتی. بنچمارک ابعاد مهمی مانند استخراج جدول، وفاداری محتوایی و قالببندی معنایی را ارزیابی میکند. Parse 5 میانگین امتیاز 79.2 را کسب کرده که آن را در ردهٔ رقابتی قرار میدهد؛ در حالی که پیکربندیهای پریمیوم مانند LlamaParse Agentic Plus با امتیاز 90.20 پیشتاز هستند و برخی رقبای شناختهشده مانند Mistral OCR و Google Gemini 3 Flash امتیازهای پایینتری ثبت کردهاند.
ویژگیهای کلیدی برای توسعهدهندگان
- خروجی Markdown ساختیافته که فرآیند پردازش بعدی را ساده میکند و وابستگی به قواعد دستی را کاهش میدهد.
- بازگشت مختصات جعبههای محدودکننده همراه با متن استخراجشده تا دادهها قابل استقرار و حسابرسی باشند؛ این قابلیت برای صنایع تنظیمشده اهمیت ویژه دارد.
- پشتیبانی از ادغام در جریانهای کاری RAG و سامانههای عامل مستقل از طریق API و سازگاری با پلتفرمهایی مانند Microsoft Azure AI Foundry و Amazon SageMaker.
نمونهٔ فراخوانی API
نمونهٔ سادهٔ استفاده با پایتون برای استخراج Markdown:
import cohere
# Initialize the Cohere V2 Client
co = cohere.ClientV2("YOUR_COHERE_API_KEY")
with open("quarterly_earnings_report.pdf", "rb") as file:
document_content = file.read()
response = co.models.parse(
model="parse-v5.0",
document=document_content,
output_format="markdown"
)
print("Extracted Markdown:\n", response.text)
print("Layout Elements:\n", response.bounding_boxes)
نمونهٔ cURL:
curl --request POST \
--url https://api.cohere.com/v2/parse \
--header 'Authorization: Bearer YOUR_COHERE_API_KEY' \
--header 'Content-Type: multipart/form-data' \
--form 'model=parse-v5.0' \
--form 'document=@quarterly_earnings_report.pdf' \
--form 'output_format=markdown'
دسترسی و ادغام
API Parse 5 از طریق سکوی Cohere در دسترس است و پشتیبانی از استقرارهای سازمانی روی ابرهای متداول را نیز ارائه میدهد. برای تیمهایی که اجرای محلی یا بررسی مدلهای مرتبط را میخواهند، مخازن و منابع مرتبط با معماری North-Micro-Vision-Instruct روی Hugging Face قابل دسترس است. برای مروری فنی بر یادگیری چندمودالی میتوان از مرجع Multimodal learning در ویکیپدیا استفاده کرد.
ملاحظات عملی و جامعهٔ توسعه
گفتگوها در انجمنهای توسعه نشان میدهد که مهمترین نگرانیها شامل موارد زیر است:
- دقت استخراج جدول و حفظ قالببندی پیچیده در اسناد ترکیبی متن-تصویر
- سهولت یکپارچهسازی با استکهای موجود و مسیرهای ورود فایل PDF
- نیاز به ابزارهای پایش و حسابرسی برای خروجیهای ساختیافته در محیطهای تنظیمشده
چشمانداز و موارد استفاده
اگر Parse 5 بتواند عملکرد بنچمارک را در تولید حفظ کند، میتواند روند پردازش اسناد سازمانی را سادهتر، قابلردیابیتر و کمهزینهتر کند و جایگزین مراحل مبتنی بر قواعد و OCR سنتی شود. موارد استفادهٔ مناسب شامل استخراج جداول مالی، خلاصهسازی گزارشها، جذب اطلاعات از اسناد حقوقی و خودکارسازی گردشهای کاری محتوامحور است. توسعهدهندگان و تیمهای محصول اکنون میتوانند قابلیتها را در جریانهای کاری واقعی آزمایش کنند و میزان کاهش هزینه و پیچیدگی را بسنجند.





