简单用鹈鹕做了下测试,对比了astra、gpt6-sol、gtpt5.6-sol、opus5.5 4个模型,medium和ultra两种effort(oups为xhigh),共8种组合的鹈鹕测试。统计了任务完成时间、token消耗与预估开销。

prompt统一为“Generate an SVG of a pelican riding a bicycle.”

summary

summary_token