رونمایی Parse 5

Cohere در 27 اوت 2026 از Parse 5 (parse-v5.0) رونمایی کرد؛ مدل چندمودالی زبان-بصری با 2.3 میلیارد پارامتر که برای تبدیل فایل‌های PDF پیچیده و غنی از عناصر تصویری—از گزارش‌های مالی تا مقالات علمی—به Markdown ساخت‌یافته همراه با مختصات دقیق جعبه‌های محدودکننده طراحی شده است.

معماری و مشخصات فنی Parse 5

Parse 5 برای پردازش حجم بالای دادهٔ سازمانی بهینه شده و پنجرهٔ متنی 8K توکن را پشتیبانی می‌کند تا متن و تصاویر را هم‌زمان دریافت کند. این مدل بر پایهٔ معماری North-Micro-Vision-Instruct ساخته شده و از یک کدنویس دیداری بومی 400 میلیون پارامتری بهره می‌برد که از SigLIP 2 SO400M مقداردهی اولیه شده است. کدنویس، از جاسازی موقعیتی دوبعدی چرخشی و جاسازی موقعیتی یک‌بعدی یادگرفته‌شده برای حفظ ساختار فضایی سند استفاده می‌کند و یک Projector اختصاصی ویژگی‌های بصری را به فضای جاسازی مدل زبان نگاشت می‌کند.

لایهٔ ترکیب دیداری و زبانی

موتور استدلال Parse 5 شامل یک مدل زبان داخلی حدود 2 میلیارد پارامتری (North Micro LLM) مبتنی بر معماری Command A+ است. رویکرد DeepStack امکان تزریق جاسازی‌های قطعه‌ای از چندین لایهٔ کدنویس دیداری در لایه‌های اولیهٔ مدل زبان را فراهم می‌کند تا نمایش‌های بصری در سطوح انتزاعی متعدد قابل دسترسی باشند. این ترکیب خروجی مستقیم Markdown ساخت‌یافته تولید می‌کند و نیاز به خط‌مشی‌های پیچیدهٔ مبتنی بر قوانین و OCR سنتی را کاهش می‌دهد.

عملکرد در بنچمارک‌ها

Cohere برای سنجش دقت از مجموعه‌دادهٔ ترکیبی و انسانی ParseBench استفاده کرده است؛ شامل بیش از 2,000 صفحهٔ سازمانی در حوزه‌های بیمه، مالی و دولتی. بنچمارک ابعاد مهمی مانند استخراج جدول، وفاداری محتوایی و قالب‌بندی معنایی را ارزیابی می‌کند. Parse 5 میانگین امتیاز 79.2 را کسب کرده که آن را در ردهٔ رقابتی قرار می‌دهد؛ در حالی که پیکربندی‌های پریمیوم مانند LlamaParse Agentic Plus با امتیاز 90.20 پیشتاز هستند و برخی رقبای شناخته‌شده مانند Mistral OCR و Google Gemini 3 Flash امتیازهای پایین‌تری ثبت کرده‌اند.

نمونه خروجی Parse 5 از یک فایل PDF به صورت Markdown و مختصات جعبه‌ها

ویژگی‌های کلیدی برای توسعه‌دهندگان

  • خروجی Markdown ساخت‌یافته که فرآیند پردازش بعدی را ساده می‌کند و وابستگی به قواعد دستی را کاهش می‌دهد.
  • بازگشت مختصات جعبه‌های محدودکننده همراه با متن استخراج‌شده تا داده‌ها قابل استقرار و حسابرسی باشند؛ این قابلیت برای صنایع تنظیم‌شده اهمیت ویژه دارد.
  • پشتیبانی از ادغام در جریان‌های کاری RAG و سامانه‌های عامل مستقل از طریق API و سازگاری با پلتفرم‌هایی مانند Microsoft Azure AI Foundry و Amazon SageMaker.

نمونهٔ فراخوانی API

نمونهٔ سادهٔ استفاده با پایتون برای استخراج Markdown:

import cohere
# Initialize the Cohere V2 Client
co = cohere.ClientV2("YOUR_COHERE_API_KEY")
with open("quarterly_earnings_report.pdf", "rb") as file:
    document_content = file.read()
response = co.models.parse(
    model="parse-v5.0",
    document=document_content,
    output_format="markdown"
)
print("Extracted Markdown:\n", response.text)
print("Layout Elements:\n", response.bounding_boxes)

نمونهٔ cURL:

curl --request POST \
--url https://api.cohere.com/v2/parse \
--header 'Authorization: Bearer YOUR_COHERE_API_KEY' \
--header 'Content-Type: multipart/form-data' \
--form 'model=parse-v5.0' \
--form 'document=@quarterly_earnings_report.pdf' \
--form 'output_format=markdown'

دسترسی و ادغام

API Parse 5 از طریق سکوی Cohere در دسترس است و پشتیبانی از استقرارهای سازمانی روی ابرهای متداول را نیز ارائه می‌دهد. برای تیم‌هایی که اجرای محلی یا بررسی مدل‌های مرتبط را می‌خواهند، مخازن و منابع مرتبط با معماری North-Micro-Vision-Instruct روی Hugging Face قابل دسترس است. برای مروری فنی بر یادگیری چندمودالی می‌توان از مرجع Multimodal learning در ویکی‌پدیا استفاده کرد.

ملاحظات عملی و جامعهٔ توسعه

گفتگوها در انجمن‌های توسعه نشان می‌دهد که مهم‌ترین نگرانی‌ها شامل موارد زیر است:

  • دقت استخراج جدول و حفظ قالب‌بندی پیچیده در اسناد ترکیبی متن-تصویر
  • سهولت یکپارچه‌سازی با استک‌های موجود و مسیرهای ورود فایل PDF
  • نیاز به ابزارهای پایش و حسابرسی برای خروجی‌های ساخت‌یافته در محیط‌های تنظیم‌شده

چشم‌انداز و موارد استفاده

اگر Parse 5 بتواند عملکرد بنچمارک را در تولید حفظ کند، می‌تواند روند پردازش اسناد سازمانی را ساده‌تر، قابل‌ردیابی‌تر و کم‌هزینه‌تر کند و جایگزین مراحل مبتنی بر قواعد و OCR سنتی شود. موارد استفادهٔ مناسب شامل استخراج جداول مالی، خلاصه‌سازی گزارش‌ها، جذب اطلاعات از اسناد حقوقی و خودکارسازی گردش‌های کاری محتوامحور است. توسعه‌دهندگان و تیم‌های محصول اکنون می‌توانند قابلیت‌ها را در جریان‌های کاری واقعی آزمایش کنند و میزان کاهش هزینه و پیچیدگی را بسنجند.

منابع تکمیلی